
Sign up to save your podcasts
Or


OpenAIが、開発者たちのクリスマスプレゼントとして特大のニュースを投下しました。かつてGitHub Copilotの頭脳として一世を風靡した「Codex」の名前が、最新モデル「GPT-5.2 Codex」として復活を遂げたのです。
今回のモデルが画期的なのは、これまでの「コード補完(オートコンプリート)」という概念を完全に過去のものにした点にあります。これまでのAIは、エンジニアが書いているコードの続きを予測する「優秀な助手」に過ぎませんでした。しかし、GPT-5.2 Codexは「自律したエンジニア」として振る舞います。
具体的には、自然言語で書かれた仕様書や、「このバグを直して」といった抽象的な指示を与えるだけで、リポジトリ全体の構造を理解し、必要なファイルを特定して修正案を作成。さらにはテストコードを書いて実行し、エラーが出れば自らデバッグして修正するというサイクルを、人間の介入なしに完遂します。これはまさに、今年注目を集めた「エージェンティック・ワークフロー」の究極形と言えるでしょう。
Web検索で競合状況を整理すると、この領域では先行する「Devin」やGoogleのモデルがしのぎを削っています。しかし、GPT-5.2 Codexは、圧倒的な「推論速度」と、数百万行規模の巨大なコードベースを一度に読み込めるコンテキストウィンドウの広さで差別化を図っています。特に、企業の基幹システムに残る古いコード(レガシーコード)を、最新の言語に書き換える「レガシーマイグレーション」のタスクにおいて、人間が数ヶ月かかる作業を数時間で終わらせるポテンシャルを秘めています。
エンジニアにとっては、「コードを書く仕事」から「AIが書いたコードをレビューし、アーキテクチャを決定する仕事」へのシフトが、いよいよ待ったなしの現実となりそうです。2026年は、人間とAIがGitHub上で対等に議論し合う姿が日常になるかもしれません。
日本のニュース消費のスタイルが、また一つ進化を遂げそうです。LINEヤフー株式会社は今週、同社の旗艦アプリである「Yahoo! JAPANアプリ」において、生成AIを活用した新たなニュース閲覧機能の提供を開始しました。
今回実装されたのは、ニュース記事を単に「読む」だけでなく、AIと一緒に「深掘り」できる機能です。具体的には、記事の下部に表示される「AIアシスタント」をタップすると、そのニュースの要点を3行でまとめたり、「なぜこの事件が起きたのか?」「専門用語の意味は?」といった疑問に対して、チャット形式で即座に解説してくれたりします。
これまで、ニュースを読んでいて分からないことがあれば、一度ブラウザに戻って検索し直す必要がありました。しかし、この新機能により、ユーザーはアプリから離脱することなく、シームレスに理解を深めることができます。Web検索で得られた周辺情報を踏まえると、これは単なる機能追加以上に、滞在時間の延長とユーザーエンゲージメントの強化を狙った戦略的な一手と言えます。
LINEヤフーは、2024年の合併以降、社内業務でのAI活用を徹底する「AI義務化」などを通じてノウハウを蓄積してきました。台湾市場ではAIがポッドキャスト風にニュースを読み上げる「PODCAST TODAY」を展開するなど、グループ全体で「AI×コンテンツ」の実験を加速させています。今回の機能も、そうした社内外の知見が結実したものと言えるでしょう。
SmartNewsやGunosyといった競合アプリもAI要約を取り入れていますが、Yahoo! JAPANが持つ圧倒的なユーザー基盤と、検索データに裏打ちされた回答精度が組み合わされれば、ニュースアプリの勢力図に再び変化が起きるかもしれません。
フランスのAIユニコーン、Mistral AIがまた一つ、ビジネスの現場に革命を起こすツールを送り出してきました。一昨日の12月17日、同社は最新の文字認識モデル「Mistral OCR 3」を発表しました。これは今年の春にリリースされ、その精度の高さで業界を驚かせたOCR機能の正統進化版となります。
これまで、企業の現場で「紙のデジタル化」が進まない最大の理由は、「AIが読めない書類」の存在でした。くしゃくしゃになった領収書、走り書きのメモ、あるいは古いファックスで潰れてしまった文字などです。これらは結局、人間が目で見て手入力するしかありませんでした。しかし、今回のMistral OCR 3は、こうした「悪条件」の下でも驚異的な認識精度を発揮するとされています。
特に注目すべきは、金融や医療といった「ミスが許されない業界」へのフォーカスです。銀行の本人確認書類や、病院のカルテなどは、複雑な表組みや手書きが混在する最難関のデータです。Mistralはここをターゲットに、競合であるGoogleやAWSのサービスよりも安価、かつ高速に処理できる点を売りにしています。文書を単なる文字の羅列としてではなく、人間のように「レイアウトごとの意味」を理解してMarkdown形式で出力してくれるため、その後のデータ分析にもスムーズに繋げることができます。
これは単なる便利ツールの話にとどまりません。Mistral AIの狙いは、このOCRを「企業AIへの入り口」にすることです。まずOCRで企業の膨大な紙資料をデータ化させ、そのデータを分析するために自社の高性能なAIモデルを使ってもらう──そんなエコシステムを作ろうとしているのです。
私たちの日々の業務から「手入力」という作業が消える日は、意外と近くまで来ているのかもしれませんね。
Googleから、開発者にとって非常に興味深いクリスマスプレゼントが届きました。同社は今週、新たなオープンモデル「FunctionGemma」を発表しました。このモデルの何が画期的かというと、その「小ささ」と「賢さ」のギャップにあります。
これまで、AIに「明日の東京の天気を調べて」といった指示を出して、裏側で実際に天気予報APIを叩かせるような高度な処理(Function Calling)を行うには、比較的大きなAIモデルが必要でした。しかし、今回登場したFunctionGemmaは、わずか2億7000万パラメータ(270M)という極小サイズです。これは、最新の高性能なノートPCどころか、少し古いパソコンやラズベリーパイのような小型コンピュータでもサクサク動く軽さです。
Googleはこのモデルを、先月リリースされたばかりの「Gemma 3」アーキテクチャをベースに開発しました。汎用的なお喋り能力を少し犠牲にする代わりに、「ユーザーの命令を理解して、正確なプログラムコードやAPIリクエストを吐き出す」という一点に能力を集中させています。
これにより何が変わるのでしょうか? 例えば、自宅のスマート家電を制御するAIや、企業の機密データを扱う社内ボットを、インターネットに接続せず、完全にローカルな環境(エッジ)で構築できるようになります。「クラウドにデータを送りたくないけれど、気の利いたアシスタントが欲しい」というニーズに対し、FunctionGemmaは決定的な解決策になるでしょう。
Ollamaなどのプラットフォームですぐに試せる状態で公開されており、2026年は、この小さな頭脳を搭載した「専用AIエージェント」が、私たちのデスクトップの裏側で無数に働き始める年になりそうです。
2025年も押し迫った12月17日、ロイター通信が世界を震撼させるスクープを報じました。記事によると、中国・深センの厳重に警備された工場内で、ある巨大な装置が稼働を開始したといいます。それは、米国が長年阻止しようとしてきた「中国国産のEUVリソグラフィ装置」のプロトタイプでした。
このプロジェクトは、中国政府内部で「マンハッタン計画」と呼ばれています。その名の通り、国家の存亡をかけた極秘任務であり、元ASMLのエンジニアを含む精鋭部隊が、西側の特許やサプライチェーンを完全に排除した状態で、最先端の露光装置をリバースエンジニアリング、あるいは独自再構築することに挑んできました。
これまで、SMICなどの中国メーカーは、古い世代の露光装置(DUV)を何度も使い回す「マルチパターニング」という手法で、無理やり7nmや5nm相当のチップを作ってきました。しかし、この方法は歩留まりが悪く、コストがTSMCの1.5倍近くかかると言われています。今回報じられた国産EUVが実用化されれば、このコスト構造が一変し、HuaweiのAIチップ「Ascend 910C」などが、NVIDIA製品と遜色ないコストと量で生産される未来が現実味を帯びてきます。
もちろん、専門家の見方は冷静です。「光は灯ったが、量産にはまだ遠い」というのが現在地です。しかし、重要なのは「0が1になった」という事実です。西側の包囲網によって窒息するどころか、中国は独自の「半導体生態系」を完成させつつあります。もし2026年にこの装置が実戦投入されれば、AI開発における米中のデカップリングは決定的なものとなり、私たちが使うAIサービスの裏側も、完全に二つの世界に分断されることになるでしょう。
日本のIT業界が長年抱えてきた「時限爆弾」に対し、ついに具体的な解除策が提示されました。12月11日、ベトナムのIT大手FPTソフトウェアと、日本のSCSKが合弁会社「COBOL PARK(コボルパーク)」の設立を発表しました。この新会社は名前の通り、銀行や保険会社の基幹システムで今なお動き続けている古いプログラミング言語「COBOL」の専門部隊です。
なぜ今、COBOLなのでしょうか? 背景にあるのは深刻な技術者不足です。日本のベテランCOBOLエンジニアが次々と定年退職を迎える中、若手エンジニアはAIやWeb開発に流れ、古いシステムを守る人がいなくなっています。これが、いわゆる「2025年の崖」の正体の一つです。
FPTとSCSKの戦略は非常にユニークです。彼らはベトナムの豊富な若手エンジニアにCOBOL教育を施し、圧倒的な規模の「保守部隊」を編成します。FPTはすでに日本市場で数百億円規模の売上を持ち、日本企業の文化にも精通しています。ここにSCSKの国内顧客基盤を掛け合わせることで、システムを「捨てられない」企業の延命措置と、その先のモダナイゼーション(最新技術への移行)を一手に引き受ける狙いです。
さらに、Web検索で周辺情報を探ると、FPTが並行して進めている「FPT AI Factory」との連携も見え隠れします。FPTはNVIDIAから数千基の最新GPU「H200」を調達し、強力なAI開発環境を整えています。単に人間がコードを直すだけでなく、このAIパワーを使って、数百万行に及ぶCOBOLコードを解析し、自動的に現代の言語へ書き換える──そんなハイブリッドな解決策が、この「COBOL PARK」から生まれてくる可能性が高いでしょう。
今回の提携は、単なる「下請け」の話ではありません。日本の社会インフラを支える古いシステムを、アジアの若い力と最新のAI技術でソフトランディングさせる、極めて現実的かつ重要なプロジェクトと言えます。
イーロン・マスク率いるxAIが、ついに音声対話の領域でも勝負に出ました。2025年12月17日、同社は「Grok Voice Agent API」を正式にリリースしました。これは、以前からTesla車内などで提供されていたGrokの音声機能を、世界中の開発者が自分のアプリやサービスに組み込めるようにしたものです。
このAPIの最大の特徴は、徹底的に「リアルタイム性」にこだわっている点です。技術的には「WebSocket」という通信規格を採用しており、ユーザーが話し終わると同時にサーバーから音声データが送り返されてくるため、人間同士の会話のような自然な掛け合いが可能になります。これまでAIとの音声会話といえば、一瞬の「待ち時間」が気まずさを生んでいましたが、Grokはこのレイテンシを極限まで削ぎ落としてきました。
また、グローバル展開を意識し、リリース当初から日本語を含む100以上の言語に対応しています。単に言葉を翻訳するだけでなく、それぞれの言語特有のアクセントやイントネーションまで再現できるため、例えば日本の高齢者向け見守りサービスや、海外顧客向けの24時間対応コンタクトセンター(IVR)など、ビジネス現場での即戦力として期待されています。
競合するOpenAIも「Realtime API」を展開していますが、xAIは後発ならではの強みとして、Grok特有の「個性」を音声にも反映させています。真面目な対応が必要な医療・金融相談から、少しウィットに富んだエンターテインメントまで、声のトーンや性格を調整できる点は、開発者にとって大きな魅力となるでしょう。2026年は、私たちの身の回りのあらゆるデバイスが、Grokの声で「おしゃべり」し始める年になるかもしれません。
OpenAIが、チャットボットの枠を超え、本格的な「科学者」としてのAI活用に舵を切りました。同社が新たに公開した「Frontier Science」ページでは、AIを単なる事務アシスタントではなく、物理学、生物学、気象学といったハードサイエンスの領域で“発見の主体”として位置づけるビジョンが示されています。
この動きの背景には、2025年12月にリリースされたばかりの最新モデル「GPT-5.2」および推論特化型モデル「oシリーズ」の存在があります。これまでGoogle DeepMindの「AlphaFold」などが特定の科学領域(タンパク質構造解析など)で成果を上げてきたのに対し、OpenAIのアプローチは「汎用的な推論能力」で科学全般に挑む点に特徴があります。
具体的には、ロスアラモス国立研究所との提携が大きな柱です。同研究所のスーパーコンピュータ「Venado」にOpenAIのモデルを実装し、核セキュリティや未知の病原体の解析といった国家レベルの課題に取り組んでいます。また、長寿研究を行うRetro Biosciencesとの協業では、AIが再設計した因子によって実験効率が劇的に向上した事例も報告されており、AIが「仮説立案→実験設計」という科学的メソッドの根幹を担い始めています。
競合であるGoogleやMicrosoftも同様に「AI for Science」を掲げていますが、OpenAIは「推論モデルが専門家の推論プロセスを模倣できる」という点に勝機を見出しています。研究者が数十年かけて行う仕事を数年に短縮することを目指すこのプロジェクトは、AI業界が「生成」から「発見」へとフェーズを移したことを象徴する出来事と言えるでしょう。
2025年も残すところあとわずかとなったこのタイミングで、Googleが大きな一手打ってきました。かねてより噂されていた次世代モデル「Gemini 3 Flash」の正式リリースです。今月上旬にOpenAIが「GPT-5.2」を投入し、AI業界は騒然としていましたが、Googleは「速度と知能の両立」という明確な答えを提示してきました。
今回のGemini 3 Flashの最大の特徴は、これまでトレードオフの関係にあった「処理速度」と「推論の深さ」の壁を壊した点にあります。これまでの「Flash」シリーズは軽快さが売りでしたが、複雑な論理的推論は苦手としていました。しかし、今回のバージョンでは、11月に発表された上位モデル「Gemini 3 Pro」譲りの高度な推論能力を、ほぼ遅延ゼロで提供することに成功しています。
Web上の開発者コミュニティや技術ブログの反応を見ると、特に注目されているのが「エージェンティック・ワークフロー」への適性です。AIが自律的にタスクをこなす際、判断のスピードが遅いと実用的ではありません。Gemini 3 Flashは、人間が思考するよりも速いスピードで複数のツールを連携させることができるため、真の意味での「リアルタイム・アシスタント」が実現すると期待されています。これを支えるのが、同時に発表された開発基盤「Google Antigravity」です。
市場の動向を見ても、2025年は「モデルをどう作るか」から「どう動かすか」へ、競争の軸足が完全に「推論(インファレンス)」に移行しました。電力コストやチップ不足が叫ばれる中、Googleは独自のTPUインフラとモデルの軽量化技術を組み合わせることで、競合他社に対して「圧倒的なコストパフォーマンス」という堀を築こうとしています。
私たちの生活レベルでは、スマートフォンのAIアシスタントが、待機時間なしで複雑な旅行の予約を完了させたり、動画の内容を瞬時に理解して要約したりといった体験が、当たり前のものとして定着していくでしょう。来たる2026年は、この「爆速の知能」があらゆるアプリの裏側で動き回る一年になりそうです。
画像処理の世界を一変させたMetaの「SAM(Segment Anything Model)」が、ついに音声の世界にもやってきました。Metaは今週、音声編集を劇的に簡略化する新モデル「SAM Audio」を発表しました。これは、画像内の特定の物体をワンクリックで切り抜くように、録音データの中から「犬の鳴き声」や「ギターの音」だけを自在に抜き出したり、消去したりできる技術です。
これまで、音声編集といえば「波形」との戦いでした。特定のノイズを取り除くには、周波数スペクトルを目で確認し、手作業でフィルタリングする必要があり、これには高い専門性が求められました。しかし、SAM Audioはこの常識を覆します。「車のエンジン音を消して」とテキストで指示したり、動画内の車を指定したりするだけで、AIがその音の意味を理解し、綺麗に分離してくれるのです。
技術的なポイントは、SAMシリーズ特有の「ゼロショット学習」能力です。特定の音を事前に学習させていなくても、AIがその場で文脈を理解して処理を行います。Redditで開催された開発チームのAMA(Ask Me Anything)セッションによると、このモデルはSAM 3やSAM 3Dと共に「Segment Anythingコレクション」の一部として展開され、Hugging Faceですぐに試せる状態で公開されています。
競合するAdobeなども音声編集AIを強化していますが、Metaの強みはやはりそのオープンな展開戦略にあります。開発者はこのモデルを自社のアプリに組み込むことができ、今後、会議録音から特定の人の声だけを抽出するツールや、動画制作のバックグラウンドノイズを一瞬で消すプラグインなどが爆発的に増えることが予想されます。私たちのようなポッドキャスト配信者にとっても、救世主となる技術かもしれませんね。
From the publisher's feed