
Sign up to save your podcasts
Or


グーグルは米国時間10月9日、企業のあらゆる業務フローにAIを行き渡らせる新基盤「Gemini Enterprise」を発表しました。Thomas Kurian氏はブログで、これを“職場のAIへの新しい玄関口”と表現。裏側ではGoogle DeepMindの研究に基づく最新Geminiモデル群と、GoogleのTPUを含むAI最適化スタックを土台に据え、業務で求められる知能と安全性、拡張性を一体で提供すると強調しました。
特徴は、単なるチャットボットを超え“六つのコア要素”を一つのUIに束ねた設計にあります。ノーコードのワークベンチで現場部門でもエージェントを編成し、導入初日から使えるGoogle製の事前構築エージェント群を追加。社内外の文書・アプリ—Google Workspaceはもちろん、Microsoft 365やSalesforce、SAP—に安全に接続し、中央集権のガバナンスで可視化・監査まで一元管理します。さらに10万超のパートナーからなるオープンなエコシステムを掲げ、“組み上げ不要の統合基盤”を前面に出しました。
ユースケース面でも厚みがあります。データ業務を自動化する「Data Science Agent」(プレビュー)を公開し、MorrisonsやVodafoneが既に活用。顧客接点ではCustomer Engagement Suiteを刷新し、ボイスを含む多言語の次世代会話エージェントをアロウリストで提供開始。ドイツのCommerzbankは相談の70%を自動解決する実績を示し、日本ではメルカリがコールセンターをAIで再設計し、担当者負荷を2割以上削減して5倍のROIを見込むとしています。さらにGoogle VidsやMeetの同時通訳拡張など、Workspace内でのマルチモーダルな“仕事の変換”も打ち出しました。
開発者の生産性も押し上げます。端末常駐の「Gemini CLI」と、その拡張フレームワークにより、CI/CDや監視、課金など開発〜運用の道具立てとAIを直結。エージェント同士の連携はGoogle主導のオープン標準「A2A(Agent2Agent)」が担い、決済まで含む業務完結には新たな「AP2(Agent Payments Protocol)」を用意。エージェントのコミュニケーションとコマースの標準化に踏み込み、“エージェント経済”の基盤を整えにいっています。
パートナー体制も同時拡充です。BoxやServiceNow、Workdayなど主要SaaSとのクロスプラットフォーム連携を広げ、審査済みエージェントを見つけられる「AI agent finder」も公開。大手コンサル各社はGemini Enterpriseの導入・内製支援を発表し、PwCは連携強化を正式に表明しました。
なお料金水準については、外部報道で“1ユーザー月額30ドル(中小向けは21ドル)”という観測が出ています。マイクロソフトやOpenAIなどが進める“エージェントの企業実装”競争に、Googleがフルスタックで真正面から挑む構図が鮮明になりました。正式な契約・提供条件は地域やプランで異なる可能性があるため、導入検討の際は公式発表の確認が必要です。
グーグルが開発者向けに「Gemini CLI Extensions」を正式公開しました。端末で使うAIエージェント「Gemini CLI」に、外部ツールを“差して”使える拡張スロットを与える発想で、初期段階からDynatrace、Elastic、Figma、Harness、Postman、Shopify、Snyk、Stripeといった業界パートナーの拡張が並びます。各拡張にはAIに使い方を教える“プレイブック”が同梱され、導入直後から実務で使える応答を返すのが売りです。リリースは米国時間2025年10月8日付。ローンチからわずか3カ月で「Gemini CLIの開発者は100万人超」と同社は明かしており、エコシステムの滑り出しは力強いものになりました。
技術的な肝はMCP、すなわちModel Context Protocolです。MCPはAnthropicが2024年に公開したオープン標準で、AIエージェントと外部システムを双方向で安全につなぐ共通レイヤーを提供します。Gemini CLIはこのMCPサーバーと連携し、ローカルスクリプトやSaaSのAPIも含めて“道具箱”のように扱える設計です。拡張はその上に知識と手順を重ねることで、ただつながるだけではなく“賢く使える”ところまで持ち上げる──ここが今回の最大の進化点と言えます。
Google製の拡張群も充実しています。Cloud Runへのワンステップ公開、GKEやgcloudの操作、Cloud Observabilityでの可観測性、Chrome DevToolsやFirebase、Flutter、Google Maps、Looker、そしてGenkitまで、同社のクラウドと開発者スタックを端末から一気通貫で扱えるようになります。遊び心のあるNano Bananaの画像生成拡張まで用意され、拡張カタログは専用サイトでGitHubのスター順に探せるという導線です。
周辺の布石も見逃せません。夏には「Gemini CLI GitHub Actions」ベータを投入し、IssueのトリアージやPRレビューなどの協調作業にAIを組み込む道筋を示しました。さらに9月下旬にはAI Pro/UltraのサブスクでCLIとCode Assistの利用上限を引き上げ、日常の開発フローにAIを“常時稼働”させやすい料金・枠組みを整えています。拡張エコシステムの公開は、これらの施策を束ねて「端末=AI中枢」という未来像を一気に現実に近づけるステップと言えるでしょう。
競合環境で見れば、MicrosoftのCopilotやAnthropicのClaudeが押し進めてきた“エージェント×開発”の文脈に、GoogleはMCP準拠かつオープンソースのCLIという形で厚みを増しました。端末からCI/CD、監視、課金やセキュリティまで横断できれば、開発者は画面遷移やツール切替の負担を下げ、失敗時の復旧や改善も連続した文脈で回せます。会社としては、既存のSaaS契約を“拡張”に置き換えるだけでAI化の恩恵を受けられるため、導入コストと社内展開のハードルも下がる。今回の発表は、単なる機能追加ではなく、開発現場の“統合施政権”を端末に取り戻す動きの本丸と言ってよさそうです。
10月7日、Google DeepMindが「Gemini 2.5 Computer Use」モデルを公開し、開発者が“画面を見て手を動かす”タイプのエージェントをGemini API経由で組めるようになりました。ブログでは、フォーム入力やドロップダウン操作、ログインの裏側での処理まで、人間と同じようにクリック・タイプ・スクロールでUIを進められることを強調。Google AI StudioとVertex AIからすぐ試せるプレビュー提供が始まっています。
仕組みはシンプルで強力です。新しい「computer_use」ツールに、ユーザーの目的、現在のスクリーンショット、直近のアクション履歴を渡すと、モデルは「どこをクリックするか」「何をタイプするか」といった関数呼び出しを返します。クライアント側はそのアクションを実行し、更新後のスクリーンショットとURLを再びモデルへ送り、タスク完了までループを回す。Webブラウザ最適化が先行しつつ、モバイルUIでも有望な結果が示され、デスクトップOSレベルの制御はまだ最適化途上とされています。
性能評価では、Online-Mind2Web、WebVoyager、AndroidWorldといったベンチマークで、競合手法に対して高い成功率と低レイテンシを示したと報告。Browserbaseのハーネスを用いた測定や自社評価、自己申告値をまとめた結果として公表されています。つまり“速くて当たる”ことを前提に、長めの手順を粘り強くやり切るエージェント像に近づいてきたというわけです。
安全面の作り込みも具体的です。第一に、モデル内に安全機能を学習させ、悪用意図や想定外挙動、Web上のプロンプトインジェクションや詐欺への耐性を強化。第二に、実行前に各アクションを検査する「Per-step safety service」と、購入など高リスク操作でユーザーの明示確認を求められるシステム指示を提供。開発者向けドキュメントでは、サンドボックス環境での実行や禁止用途の遵守など、実装上のガイドも整理されています。
適用例もすでに動き出しています。Google社内ではUIテストの自動化で本番運用が始まり、関連技術はProject Mariner、Firebase Testing Agent、さらに検索のAIモードの一部機能にも投入。外部の早期アクセス参加者も、個人アシスタントやワークフロー自動化、UIテストの現場で手応えを得ているといいます。プレビューのモデル名は「gemini-2.5-computer-use-preview-10-2025」。PlaywrightやBrowserbaseの参照実装を使えば、ローカルやクラウドVMですぐ検証を回せる導線が整っています。
実務の肌感で言うと、これは“APIがないところも回せる自動化”です。SaaS間のつなぎ込み、社内ポータルの定型処理、ECや業務サイト横断の情報収集など、最後は人の手でクリックしていた箇所を、説明可能なアクション列として記録しながら任せられる。高リスク操作はユーザー確認で止められ、禁止関数の除外や独自関数の追加も可能。開発チームはSandbox+監視で小さく導入し、評価をしながら工程を広げる――そんな堅実な始め方がハマりそうです。
10月6日、OpenAIが「ChatGPTにアプリを導入」すると発表しました。使い方はシンプルで、たとえば「Spotify、金曜のホームパーティ用にプレイリスト作って」と話しかけると、チャット中にアプリが立ち上がり、曲リストや地図、スライドといったUIをその場で操作できます。まずはEU以外のログインユーザー向けにFree/Go/Plus/Proで提供を開始し、ZillowやCanvaなどの初期アプリが“会話の文脈に応じて”提案される設計です。
開発側には新しい「Apps SDK」がプレビューで公開されました。MCP(Model Context Protocol)を土台に、アプリの会話ロジックとUIをコードで定義し、自社バックエンドと直接つなげられるのが肝。オープンソースとして提供され、Developer ModeでChatGPT内テスト→年内に申請受付→審査通過で公開、という流れが示されています。収益化の詳細は追って案内され、専用ディレクトリも開設予定です。
安全とプライバシー面では、全アプリに利用規約・年齢適合性・外部連携の遵守を求め、初回接続時に“共有され得るデータ”を明示。今後はデータカテゴリ単位でより細かな権限制御も提供するとしています。企業向けには年内にBusiness/Enterprise/Eduへの展開を予定し、組織配布や管理の選択肢が広がる見込みです。
同日発表の「AgentKit」との並走もポイントです。AgentKitは、ドラッグ&ドロップで業務ワークフローを組めるAgent Builderや、データ接続を一元統制するConnector Registry、会話UIのChatKit、評価基盤Evalsなどを束ね、エージェントの“設計・埋め込み・評価・微調整”を一気通貫にします。Appsが“ユーザー体験の玄関口”だとすれば、AgentKitは“裏側の作り込み”。両輪で、会話から実務までを滑らかにつなぐ構図が見えてきました。
この動きの実務的な意味を一言でいえば、“探して開く”アプリから“話して呼ぶ”アプリへの転換です。社内の申請フォーム、営業支援、学習コンテンツ、買い物まで、チャットの流れを断たずに用を足す。標準ディレクトリと将来の決済標準(Agentic Commerce Protocol)が整えば、“つど必要な機能が会話に現れる”世界が現実味を帯びます。国内のプロダクトチームにとっては、まずApps SDKで小さく体験を作り、AgentKit側で評価と統制を仕込む――そんな段階導入が相性よさそうです。
10月6日、OpenAIが「AgentKit」を発表しました。これまで分断していたオーケストレーション、コネクタ管理、評価環境、フロント実装を一つに束ね、企業や開発者が“実運用前提のエージェント”を短期間で作って回せるようにする――そんな狙いです。発表では、Responses APIとAgents SDKの流れを継ぎ、Klarnaのサポート自動化やClayの営業エージェントなど、実案件の加速例も示されました。
中心となる「Agent Builder」は、業務フローをキャンバス上で設計し、プレビュー実行やインラインでの評価設定、フルのバージョニングまで備えます。法務・現場・開発が同じ画面で合意しながら反復できるため、エージェント導入の“合意形成の詰まり”を減らせる設計です。RampやLINEヤフー(LY Corporation)が数時間で初号エージェントを立ち上げたという証言も紹介されました。
プロダクトへの埋め込みは「ChatKit」が受け持ちます。ストリーミング、スレッド管理、“考え中”の見せ方まで含めた会話UIを短時間で組み込め、テーマやブランドに合わせたカスタマイズも容易。社内ナレッジ支援から顧客対応、オンボーディングまで幅広い用途で、HubSpotやCanvaの採用例が言及されました。
企業導入で鍵となるのが「Connector Registry」。ChatGPTとAPIの両方で使うデータソースやツール接続を、管理者が一元ガバナンスできる仕立てです。標準コネクタに加え、MCPによる外部ツールもまとめて可視化・統制でき、誤接続や権限逸脱の抑止に効きます。
信頼性の底上げには「Evals」が拡張されました。データセット起点の評価作成、ワークフロー全体を踏査するトレース採点、注釈に基づく自動プロンプト最適化、そして他社モデルの横並び評価まで。評価面の“作って回す”を内製化しやすくするアップデートで、実際に導入企業で開発時間短縮や精度向上の例が出始めています。
さらに推論モデルの“実地適性”を磨くために、強化学習ベースの「RFT」も位置付けが明確になりました。o4-miniで一般提供、GPT-5はプライベートβで、ツールの呼び時を学ばせる“カスタムツールコール”や、現場に即した“カスタムグレーダー”が追加。評価指標と微調整が一体化し、業務要件に沿った振る舞いを段階的に獲得させやすくなります。
安全面では、オープンソースの「Guardrails」をBuilderやSDKと併用可能です。プロンプトインジェクション検知、PII検出、ハルシネーション検出、Jailbreak検知などをパイプラインで差し込み、Python/TypeScriptのクライアントを“差し替えるだけ”で自動検証を走らせられます。
提供形態は段階的。ChatKitと新しいEvals機能は一般提供、Agent Builderはβ、Connector Registryは一部のAPI/ChatGPT Enterprise/Edu顧客にGlobal Admin Console経由でβ開始。いずれも標準のAPIモデル料金に含まれ、今後はChatGPT側にスタンドアロンのWorkflows APIとエージェント配備オプションも追加予定としています。
総じて、設計→埋め込み→評価→微調整→配備の鎖が一本化され、IT部門は“ガバナンスを効かせたまま早く回す”現実解を得た格好です。日本勢の事例も芽を出しており、社内のデータ接続と評価基準を先に整えた会社ほど、AgentKitの効果を大きく引き出せるはずです。
10月2日、TDKが“アナログ電子回路で小脳の働きを模した”リザバーAIチップのプロトタイプを発表しました。最大の見どころは、クラウドに頼らずエッジで“リアルタイム学習”ができる点。人の指先の加速度データを取り込み、その人ごとの癖をその場で学びながら、次に出す手を先回りして判断する――そんな“先読み”をハード側で実装したと言います。共同開発は北海道大学。実機デモは10月14~17日のCEATEC 2025で、TDK製加速度センサと組み合わせた「絶対に勝てないじゃんけん」として披露されます。
背景にあるのが、リザバーコンピューティングという考え方です。大量の重みを調整するディープラーニングと異なり、時間変化する入力を物理のダイナミクス(波の干渉のような現象や、アナログ回路の状態遷移)に通して高次元に“広げ”、最後の読み出し層だけを学習するのが肝。学習すべきパラメータが少ないため学習が速く、省電力で時系列タスクに強い――この特性が、センサ直結のエッジ機器と相性がよいのです。今回のTDKの説明でも、ディープラーニングとの対比、低消費電力・高速の利点が強調されました。
TDKはこのプロトタイプを、実務に寄った“使いどころ”で見せに来ています。ウェアラブルやヒューマンインタフェース、ロボットの反応制御など、ミリ秒単位の反応と個体差への追従が必要な場面で、センサからの時系列データをチップ内のアナログ“リザバー”に放り込み、その読み出しを軽く学習して即時に行動へつなげる。デモのじゃんけんは分かりやすい見本市向けの題材ですが、要は“人の次の動き”を予測して装置側の動きを先に決める設計思想で、現場に実装したときの効き目を示す狙いです。
中長期の絵も語られています。TDKは2024年にスピントロニクス系の“脳型”ニューロモルフィックデバイスを掲げましたが、今回は“小脳を模した”リザバーで時系列特化を打ち出し、センサ事業(TDK SensEI)との連携で商用化を加速させる方針です。クラウド依存を減らした省電力AIの実装路線として、用途別に“脳(大脳)”と“小脳”を使い分けるポートフォリオが見えてきます。
技術トレンドの文脈でも追い風があります。物理・アナログ実装のリザバーは、読み出し層だけを更新するため学習の安定性と再現性が取りやすく、消費電力も抑えやすい。基礎研究ではアナログ回路アーキテクチャのCMOS実装や、ロボット制御など実時間系での応用が報告されており、TDKのようにセンサとワンパッケージで見せる動きは、実装ロードマップとして理にかなっています。課題は、タスクの選び方と量産時のばらつき管理ですが、まずはCEATECで“手応え”を示せるかが一里塚になりそうです。
10月6日、AMDとOpenAIが“6ギガワットのAMD GPUを段階的に導入する”戦略提携を正式発表しました。契約は複数年・複数世代にまたがり、初弾は2026年後半にInstinct MI450で1ギガワットを着工。その後、将来世代のGPUやラックスケールのAIソリューションまで視野に、6ギガワット規模へ積み上げていく青写真です。両社はMI300X/MI350X時代からの最適化の知見を持ち寄り、製品ロードマップのすり合わせも進めるとしています。
資本面では、AMDがOpenAIに対して最大1億6000万株分のワラント(権利行使価格は$0.01)を発行。権利は段階的な調達達成に連動して確定し、最初の1GW導入で一部が確定、最終的には6GW購入で満額に到達します。さらに株価水準などの追加条件も設定され、報道では$600水準の目標連動も言及されました。いずれも“実際に大規模展開が進むほどOpenAIの権利が増える”仕立てです。
今回の発表直後、米主要メディアは“AMDがNVIDIA一強のAIチップ市場に対抗する起爆剤”と位置づけ、株価の急伸など市場の反応も伝えています。AMDは本提携を“数十億ドル規模の収益貢献(tens of billions)”と表現。OpenAIはNVIDIAやMicrosoftとの関係を保ちつつ、サプライヤーの多様化を明確化した格好です。初期1GWの工程やマイルストーンの設計が公開情報として示されたことで、2026年に向けた実装の見通しも具体度を増しました。
実務の景色を描いてみましょう。1GW級の着工は、学習クラスターの“塊”をまず確保し、モデル開発・自己改善・推論配備の循環を安定運転に乗せる段取りです。MI450世代を皮切りに世代交代を織り込むことで、性能/電力効率の進化を前提とした“継続増設”が可能になります。OpenAIにとっては、モデル規模と利用者増が同時進行する中で、供給リスクを分散しつつ、ソフトウェア側のスタック最適化(コンパイラ、通信、メモリ管理)をAMD向けにも深められる利点があるでしょう。
一方のAMDにとっては、ラックスケールでの量産・運用知見をOpenAIとともに磨く機会になります。ハード単体の性能競争に留まらず、ネットワーキングや冷却、スケジューラまで含めた“AI工場”の総合最適で競争力を引き上げられる。株式ワラントという“成果連動の絆”を結ぶ設計は、供給・価格・品質の三点で長期のアラインメントを効かせる狙いと読み取れます。市場はこの“量と継続性”を先読みし、ニュース直後のプレマーケットでAMD株が急伸したと報じられました。
最後に一言、現場目線です。6GWという大枠の数字に目を奪われがちですが、実際の勝負は“最初の1GWをいかに遅延少なく立ち上げ、翌世代へ滑らかに接続できるか”。この初弾の出来が、その後の加速とワラントの権利確定にも直結します。OpenAIはNVIDIAなど既存パートナーとの併走を続けつつ、AMD系スタックの成熟を実証できるか。2026年後半、MI450の立ち上げがひとつの関門になりそうです。
10月6日、Google DeepMindがコードセキュリティ専用のAIエージェント「CodeMender」を発表しました。狙いは“見つけるだけ”で終わらない自動防御。新たな脆弱性を即時にパッチしつつ、既存コードをより安全なデータ構造やAPIへ置き換え、脆弱性の“種類ごと”に再発を断つアプローチが示されました。研究開始から直近6カ月で、総行数が数百万行規模の大型プロジェクトを含め72件の修正をオープンソースに上流反映済みだとしています。
土台となるのは、長考推論を強化した「Gemini Deep Think」。これを頭脳に、静的解析・動的解析・差分テスト・ファジング・SMTソルバーといったプログラム解析ツール群を“腕・目”として束ね、変更前に筋の悪い候補をふるい落とし、適用後はLLMジャッジで機能等価性やリグレッションを自動検査する――そんな“計画→実行→検証→自己修正”の一連のループが公開情報から確認できます。提出前のパッチはすべて人間の研究者がレビューする運用で、品質最優先の立ち上げを強調しています。
プロアクティブな“書き換え”の具体例も出ました。DeepMindは画像ライブラリlibwebpの一部に、Clangの境界安全拡張「-fbounds-safety」のアノテーションを自動付与する実験を実施。これによりコンパイラが境界検査を挿入し、バッファオーバー/アンダーフロー由来の任意コード実行を原理的に封じる、と説明しています。libwebpでは2023年にCVE-2023-4863として知られる重大欠陥が報告され、ゼロクリックのiOS攻撃チェーンに使われた経緯がありました。CodeMender流の“安全化リライト”は、まさにこうしたクラスの不正を“最初から起きない形”に寄せる試みです。
今回の守りは、昨年からの攻めの布石ともつながります。DeepMindとProject Zeroの「Big Sleep」は、実世界のSQLiteで未公開のメモリ安全性バグを初発見し、既存のファジング網をすり抜けるバリアント探索をAIで補完できることを示しました。Googleは今夏、AI防御の包括施策とともに“AIで見つけ、AIで直す”路線を明確化しており、CodeMenderはその“直す側”の中核を担う位置づけです。
受け皿の広がりも見えます。業界メディアは、CodeMenderが“自律パッチ適用”と“安全化リライト”の両輪を備える点を評価し、上流PRの受理実績(72件)や数百万行級コードでの適用例を相次いで紹介しました。DeepMindは今後、重要OSSのメンテナと連携を拡大し、テクニカルペーパーの公開も予定。段階的に一般開放を目指すとしています。現場にとっては、CI上での自動提案→人手レビュー→上流反映という馴染みの流れにAIが“相棒”として入り込むイメージで、手戻りや検証コストの削減が期待できます。
ビジネスの観点では三つ。第一に、既存の“シフトレフト”と整合的に、コードレビューやテストの前段で危険な変更を弾けること。第二に、特定クラスの欠陥をアーキテクチャごと潰す“安全化リライト”が長期のTCOを下げること。第三に、AIが攻守の両面に立つ時代に、LLMジャッジや形式検証ツールを絡めた“説明可能な修正プロセス”を確立できることです。総じて、“人が基準を握り、AIが手を動かす”役割分担を保ちつつ、脆弱性の雪だるま化を食い止める一歩が踏み出された、そんな印象です。
9月29日、Microsoftは“Vibe Working”という新しい働き方の合言葉とともに、Microsoft 365 Copilotに二つの大きな機能を発表しました。ひとつはExcelとWordに組み込まれる「Agent Mode」。もうひとつはCopilotのチャットからプレゼンや文書を一気通貫で作る「Office Agent」です。発表では、従来の“指示→単発生成”を超えて、AIがマルチステップで計画・実行・検証を回し、ユーザーは舵取り役に徹するコラボレーション様式を前面に掲げました。
まずExcelのAgent Modeは“Excelを母語のように話すAI”を標榜します。表や関数、ピボット、グラフといったアプリ固有のオブジェクトを理解し、必要に応じてコードを実行してワークブックを直接操作。結果を自己点検して不具合を修正し、検証が通るまで反復する――という“計画・実行・内省”ループを備えています。Microsoftの技術解説では、ワークブックの要約をJSON/Markdownで生成する“文脈プロデューサー”、簡易テストを仕込む“検証駆動生成”、品質を底上げする“AIグレーダー”など、実務で通用させるための工学的工夫が具体的に示されました。
性能面では、公開ベンチマークSpreadsheetBenchの全912タスクを用いた社内評価で、Agent Modeが57.2%の正答率を記録したと説明されています。同社は“ベンチ最適化ではなく実務最適化を重視する”とも明記しており、会計表の作成やローン計算、家計管理などのプロンプト例とともに、生成過程の可視化と再現性を意識したつくりをアピールしました。
WordのAgent Modeは“会話で仕上げる執筆体験”に振り切っています。要約や追記の指示を出すと、Copilotが原稿を下書きし、スタイルや強調、社内ルールの反映まで提案しながら一緒に磨き込む。意図のすり合わせを挟みつつ、最終的にはアプリ内のスタイルで整ったドキュメントに落とし込む、という流れです。PowerPoint対応も“近日”と予告されました。
もう一方の主役、Office Agentは“チャットから作品を完成させる”ためのマルチエージェントです。まず意図を確認し、ウェブでの情報収集と推論を行い、途中経過をプレビューしながら、完成度の高いPowerPointやWordを吐き出します。基盤はAnthropicのClaudeモデルとオープンソースのオーケストレーションを組み合わせ、見た目の質感まで作り込むためにTDD(Taste-Driven Development)を導入。社内で蒐集した良質な作例から“味の青写真”を抽出し、レイアウトやタイポグラフィの一貫性を保つ仕組みが語られました。
提供形態は段階的です。Agent ModeはExcel/WordともにMicrosoft 365のFrontier Programで本日から順次ロールアウト。現時点ではWeb版が対象で、デスクトップは今後対応予定。Office Agentはまず米国のMicrosoft 365個人向け(Personal/Family/Premium)で英語・Webから開始し、商用対応はこれからとされます。
戦略の底流にあるのは“マルチモデル化”です。MicrosoftはCopilot Studio経由でOpenAIに加えてAnthropicのClaude(最新のSonnet 4.5など)を選択可能にしており、用途に応じて最適な推論エンジンを組み合わせる設計を鮮明にしています。Office AgentがClaude、Agent Modeが最新の推論モデル群とそれぞれの強みを生かし分けることで、生成の質と業務への当て込みやすさを両立させようという意図が読み取れます。
実務の肌感で言えば、ExcelのAgent Modeは“数式・表・グラフが絡む一連の作業”を任せやすく、監査可能なワークブックを残す作りが現場に効きそうです。WordのAgent Modeは月次レポートや顧客報告の“推敲の同伴者”。Office AgentはRFPのたたき台や経営会議の説明資料など、ゼロ→イチの“見せ物”を素早く形にする使い所が合います。いずれも、人が意図と基準を握り、AIが作業を走らせる――という役割分担が前提。社内のスタイルガイドや根拠データを整理しておくほど、効果は出やすくなるでしょう。
9月下旬、Qwenが新しいマルチモーダル群「Qwen3-VL」を発表しました。シリーズの目玉は、オープンウェイトで公開されたフラッグシップ「Qwen3-VL-235B-A22B」で、用途別にInstruct版と推論重視のThinking版を同時公開。公式ブログとコミュニティ告知で“現行Qwenファミリー最強のVL”をうたうとともに、開発者向けの実装ガイドとAPI連携も一気に整えてきました。
Qwenはこの発表で、視覚認識や図表・文書理解、長尺動画の時系列把握までを広くカバーしつつ、テキスト単能でも一線級の性能を目指す設計だと説明しています。特徴として、256Kの長コンテキスト、空間・時間の位置合わせを高めた推論、そして多言語OCRの強化などを挙げ、企業の現場ワークフローに直結する“読む・考える・説明する”一連の体験を前提にチューニングしているのが見て取れます。
性能面の主張では、Qwen自身が「Instructが視覚系ベンチでGemini 2.5 Proに匹敵あるいは凌駕、Thinkingは複数のマルチモーダル推論ベンチでSOTA級」と強気の自己評価を提示しました。もっとも、これは自己申告に基づく数字であり、実務では独立評価やドメイン別検証が欠かせません。とはいえ“閉じた最上位”に肉薄するオープンの選択肢が増えた意義は小さくありません。
開発者体験も急速に整備されています。GitHubの公開リポジトリでは9月23日の235B公開に続き、10月4日にはより扱いやすい「Qwen3-VL-30B-A3B」系のInstruct/Thinkingも追加。さらにFP8版の配布で推論・学習の実用負荷を下げる工夫も進み、Hugging Faceや各種ホスティングでの運用が広がっています。商用利用に親和的なApache-2.0ライセンス採用も、エンタープライズ導入の後押しになりそうです。
産業利用の文脈で見ると、文書と図表まみれのバックオフィス、現場カメラ由来の映像、設計図・取説・時系列ログといった“バラけたモダリティ”を統合しやすくなるのが最大の効用です。例えば製造なら検査映像と工程票の突合せ、金融・公共ならスキャンPDFのOCR+根拠付き要約、メディアなら長尺素材のカタログ化とナレーション生成までを、一つのモデルで連続的に回しやすくなります。Qwen3-VLの“Thinking版”は推論チェーンを伴うタスクで強みが出やすく、社内RAGやエージェントと組み合わせると、説明責任と再現性の両立に一歩近づくでしょう。
From the publisher's feed