
Sign up to save your podcasts
Or


ラスベガスで開催中のAWS re:Invent 2025から、非常に驚きのある、そして業界の転換点とも言えるニュースが飛び込んできました。あの「クラウドの巨人」AWSが、競合であるGoogle Cloudと手を組み、両社のクラウドを直接つなぐ新サービス「AWS Interconnect - multicloud」を発表したのです。
これまで、AWSといえば「All-in on AWS」、つまりすべてのシステムをAWSに集約することを推奨する姿勢が目立っていました。他社のクラウドとつなぐことは技術的には可能でしたが、複雑なVPN設定や、物理的なデータセンターでの回線引き込みなど、数週間かかる面倒な手続きが必要でした。いわば、AWSは「高い城壁」の中にユーザーを囲い込む戦略をとっていたわけです。
しかし、今回の発表はその城壁に自ら扉を作ったようなものです。 新しい「AWS Interconnect」を使えば、エンジニアは管理画面から数回クリックするだけで、AWSとGoogle Cloudの間に高速な専用線を開通させることができます。これまでは物理的な作業を含んで数週間かかっていた開通作業が、なんと「数分」で完了するというのですから、現場のエンジニアにとっては魔法のような話です。
なぜ今、AWSは競合との接続を容易にしたのでしょうか? 背景には「AI」と「障害対策」という二つの切実な事情があります。現在、AI開発の現場では「データはAWSにあるが、学習に使いたい特定のAIモデルはGoogleにある」といった状況が日常茶飯事です。データを自由に、高速に移動させたいという顧客の熱烈な要望を無視できなくなったのです。 また、今年10月に発生した大規模なクラウド障害も影響しているでしょう。一つのクラウドに依存するリスクを避けるため、複数のクラウドを併用する「マルチクラウド」が企業の当たり前の選択肢となり、AWSもその現実を受け入れ、インフラとしての利便性を取る道を選んだと言えます。
なお、現在はGoogle Cloudとの接続がメインですが、2026年にはMicrosoft Azureとの接続も計画されています。クラウド事業者が互いに敵対する時代から、ユーザーのために協力し合う「相互接続」の時代へ。今回のニュースは、その象徴的な出来事として長く記憶されることになるでしょう。
今回は、画像生成AIの世界に現れた、小さくてもとてつもなく器用なニューカマーについてお話ししましょう。アリババの国際研究チームであるAIDC-AIが、Hugging Faceで「Ovis-Image-7B」という新しいモデルを公開しました。
皆さん、画像生成AIを使っていて「惜しい!」と思ったことはありませんか? 例えば、「カフェの看板を描いて」と頼んだとき、絵は完璧におしゃれなカフェなのに、看板に書かれている文字が、まるで宇宙語のような謎の記号になってしまっている……そんな経験です。実は、これまでのAIにとって、画像の中に正しいスペルで文字を書くというのは、非常に難しい課題でした。
ところが、今回登場した「Ovis-Image-7B」は、まさにその弱点を克服するために生まれてきました。このモデル、名前に「7B」とある通り、パラメータ数は70億と、業界の基準で見ればかなりコンパクトなサイズです。一般的にAIは、脳みそであるパラメータが大きいほど賢いとされていますが、このOvisは違います。その小さな体で、なんとあのGPT-4oのような超巨大モデルに匹敵するほど、「正確に文字を描く」ことができるんです。
なぜそんなことが可能になったのでしょうか。その秘密は「構造的埋め込み(Structural Embedding)」という独自の技術にあります。従来のAIが画像を「色の集まり」としてぼんやり捉えていたのに対し、Ovisは画像を、まるで文章を読むように「意味のある構造」として捉えます。これにより、「この位置に、このフォントで、正確に『SALE』と書く」といった指示を、驚くほど忠実に実行できるようになったのです。
これが普及すれば、例えば飲食店のメニュー表や、イベントのポスター、Webサイトのバナー広告などが、デザイナーでなくとも一瞬で作れるようになります。しかも、軽量なモデルなので、巨大なサーバーを用意しなくても、手元の高性能なPCでサクサク動かせる未来もすぐそこに来ています。
「文字が書けない」という画像生成AIの長年の悩みが、このコンパクトな巨人によって解決されようとしています。クリエイティブの敷居がまた一つ下がりそうですね。
2025年も残すところあと1ヶ月となった今日、12月1日。中国のAI企業DeepSeekが、またしても業界を震撼させるニュースを投下しました。Hugging Faceで公開されたのは、彼らの最新シリーズ「DeepSeek-V3.2」。その中でも特に注目すべきは、「Speciale(スペチアーレ)」と名付けられた特別版の存在です。
この「DeepSeek-V3.2-Speciale」が掲げたベンチマーク結果は衝撃的です。なんと、OpenAIの「GPT-5」を上回り、Googleの「Gemini-3.0-Pro」と対等に渡り合える推論能力を持っているというのです。特に、今年の国際数学オリンピック(IMO)と国際情報オリンピック(IOI)の両方で「金メダル」相当の成績を叩き出したとされており、その論理的思考力は、もはや人間のトップ層すらも凌駕しつつあります。
技術的なブレイクスルーの鍵は、「DSA(DeepSeek Sparse Attention)」と呼ばれる新しいアーキテクチャにあります。これは、膨大なデータの中から必要な情報だけを効率よく拾い上げる技術で、これによって長い文脈を理解する際の計算コストを劇的に下げつつ、精度を維持することに成功しました。
しかし、このSpecialeには非常にユニークな「割り切り」があります。それは、「ツール機能を持たない」ということです。最近のAIは、Web検索をしたり、コードを実行したりと「手足」を使う方向に進化していますが、このSpecialeはあえてその機能を削ぎ落とし、ひたすら「脳みそ」の深さを追求しました。DeepSeekのモデルカードには「深層推論タスク専用であり、ツール呼び出し機能はサポートしていない」と明記されています。
つまり、DeepSeekは「何でもできる便利屋」ではなく、「部屋に籠もって難問を解く天才数学者」のようなAIを世界に公開したわけです。米国勢が汎用性を目指す中で、あえて「純粋思考」に特化して性能競争を挑む中国勢。この年末、AIの覇権争いは新たなフェーズに入ったと言えるでしょう。
今回同時にリリースされた「DeepSeek-V3.2-Speciale」が“天才的な頭脳”を持つ特化型だとすれば、無印の「DeepSeek-V3.2」は、私たちの仕事や生活に寄り添う“働き者のパートナー”と言えるでしょう。9月に「実験版(Exp)」として先行公開され、業界で大きな話題を呼んだあの技術が、ついに完成形となって私たちの手元に届きました。
このモデルの最大の武器は、賢さそのものではなく、「賢さを維持したまま劇的に軽くなった」という点にあります。それを実現したのが「DSA(DeepSeek Sparse Attention)」という独自技術です。 従来のAIは、例えるなら辞書を読むときに、全てのページの全ての文字を均等に熟読して理解しようとしていました。これでは時間がかかり、エネルギーも無駄になります。しかしDSAを搭載したDeepSeek-V3.2は、人間のように「目次を見て、必要なページだけをパッと開いて読む」ことができます。これにより、長いドキュメントや過去の膨大な会話履歴を読み込ませても、驚くほど高速に、しかも低コストで回答を生成できるようになったのです。
実際、DeepSeekは今回のリリースに合わせてAPI価格を大幅に引き下げており、以前の主力モデルであるV3.1-Terminusと比較して、コストは半分以下に抑えられています。性能ベンチマークを見ても、日常的なタスクやコーディングにおいてV3.1とほぼ同等のスコアを記録しており、「安かろう悪かろう」ではありません。
これは何を意味するのでしょうか。企業にとっては、社内の膨大なマニュアルを全てAIに読み込ませて質問に答えさせたり、数時間におよぶ会議の音声を文字起こしして要約させたりといった、「以前は高すぎて躊躇していたタスク」を、気軽にAIに任せられるようになるということです。 超高性能なSpecialeで難問を解き、高効率なV3.2で日常業務を回す。DeepSeekが提示したこの「二刀流」の戦略は、AIの実用化を次のステージへと押し上げる強力な一手となるでしょう。
今回は、TikTokや動画編集アプリCapCutを手掛けるByteDanceが発表した、新しいAIプロジェクト「Vidi」について解説します。 これまで、動画に関するAIといえば、「テキストからゼロから動画を作り出す(Soraのような生成AI)」か、あるいは「防犯カメラの映像から不審者を見つける(認識AI)」といった具合に、「作る」と「見る」は別々の技術として発展してきました。しかし、今回登場したVidiは、この二つの能力を一つの脳ミソ、つまり一つの「LMM(大規模マルチモーダルモデル)」に統合してしまったのです。
Vidiの凄さは、動画を「見て理解する」能力をベースにして、高度な「編集」を行える点にあります。 例えば、ユーザーが動画をアップロードして「このシーンの天気を雨にして」や「走っている犬を猫に変えて」とテキストで指示したとします。従来のAIであれば、単に映像の上からフィルターをかけるような処理になりがちでしたが、Vidiはまず映像を深く「理解」します。「ここに地面があり、空があり、犬がどのような姿勢で走っているか」という文脈を把握した上で、まるでプロの編集者が作業するように、自然な形で雨を降らせたり、動物を入れ替えたりすることができるのです。
また、逆に「この動画の3分ごろに何が起きた?」といった質問に答えさせることも可能です。つまり、Vidiは動画に対する「目(認識)」と「手(編集)」の両方を持っているわけです。
ByteDanceがこの技術に注力する理由は明確です。彼らは世界中で使われているTikTokやCapCutという巨大なプラットフォームを持っています。もしVidiの技術が将来的にスマートフォン上のアプリに組み込まれれば、私たちは撮影した動画をアップロードし、チャットで指示を出すだけで、高度なVFX(視覚効果)を使った映画のような映像を一瞬で作れるようになるでしょう。 「動画を作る」時代から、AIと対話しながら「動画を直感的に操る」時代へ。Vidiはその転換点となる重要な技術と言えます。
中国のテック大手Alibabaが、検索とブラウザの常識を覆すようなアップデートを行いました。同社の人気ブラウザ「Quark(クォーク)」が、PC向けの新しいクライアントソフトを発表し、そこに自社開発の高性能AIモデル「Qwen(通義千問)」を全面的に統合したのです。これにより、Quarkは単なる「Webサイトを見るための道具」から、仕事や学習を完結させる「万能AIアシスタント」へと進化を遂げました。
これまで、何かを調べたり資料を作ったりするとき、私たちはブラウザで検索し、別のソフトで文章を書き、また別のツールでスライドを作る……といった具合に、複数のアプリを行き来していました。しかし、新しいQuarkはその手間を過去のものにします。ブラウザの右側にAIパネルが常駐し、そこに「AI検索」「AIライティング」「AI要約」「AIスライド作成」といった機能が集約されているのです。
例えば、AI検索では、ユーザーの質問に対してWeb上の情報を統合し、まるで人間が答えるように回答を生成します。さらに驚くべきは「創作」の能力です。ユーザーがトピックを入力するだけで、Qwenの強力な言語能力を使ってドキュメントの下書きを作成したり、さらにはその内容を基にPowerPoint形式のプレゼンテーション資料を自動生成したりすることも可能です。これらはすべて、ブラウザという一つの画面の中で完結します。
この動きの背景には、中国国内での激しい「AI検索戦争」があります。検索大手のBaidu(百度)が自社のAI「Ernie Bot」を検索に組み込んで先行する中、Alibabaは若者に人気のQuarkを武器に反撃に出た形です。特にQuarkは25歳以下のユーザーが過半数を占めており、効率を重視する彼らにとって、検索から資料作成までを「ワンストップ」で行える体験は非常に魅力的です。
Alibabaのこの戦略は、ブラウザが単なる「インターネットの入り口」ではなく、AIを使いこなすための「オペレーティングシステム(OS)」のような存在になりつつあることを示しています。PCを開けば、そこに優秀な秘書がいて、検索も執筆も代行してくれる──そんな未来が、Quarkによって現実のものになろうとしています。
AIの進化がまた一つ、大きなマイルストーンに到達しました。中国のAI企業DeepSeekが発表した最新モデル「DeepSeekMath-V2」が、なんと国際数学オリンピック(IMO)の今年の課題において、6問中5問を解くという快挙を成し遂げました。これは人間の参加者で言えば「金メダル」に相当する成績であり、AIが高度な論理的推論能力においてトップクラスの人間と肩を並べつつあることを示しています。
これまで数学の難問解決といえば、GoogleのDeepMindやOpenAIといった米国の巨大テック企業がリードしてきました。実際、今年の7月には彼らのモデルも同様に「金メダル級」のスコアを記録しています。しかし、DeepSeekが今回の発表で示したのは、中国のスタートアップがその背中を猛烈な勢いで追いかけ、すでに技術的にはほぼ追いついているという事実です。特にDeepSeekはオープンなモデル開発に積極的であり、この技術が広く公開されることで、業界全体の開発スピードがさらに加速する可能性があります。
また、この「数学」という領域で戦っているのは巨大企業だけではありません。今回のニュースと時を同じくして、米国のスタートアップであるHarmonicも、自社のAIモデル「Aristotle」がIMOで金メダル級の成績を収めたと発表しました。Harmonicは今週、シリーズCラウンドで1億2000万ドル、日本円にして約180億円規模の資金調達を完了し、その企業評価額は14億5000万ドルに達しています。彼らが目指すのは「数学的超知能(MSI)」と呼ばれる領域で、AI特有の嘘や間違い、いわゆるハルシネーションを数学的なアプローチで排除しようとしています。
なぜ今、これほどまでに「数学」が重視されるのでしょうか。それは、AIが単に流暢な文章を作る段階から、複雑な手順を踏んで正解を導き出す「推論」の段階へと進化しているからです。数学の問題を解くには、文脈を読むだけでは不十分で、厳密な論理の積み重ねが求められます。つまり、数学ができるようになったAIは、プログラミングや科学研究、金融分析といった、ミスが許されない実務領域でも真価を発揮するようになるのです。DeepSeekとHarmonicの躍進は、AI開発の主戦場が「言葉」から「論理」へとシフトしたことを象徴する出来事と言えるでしょう。
画像生成AIの世界に、またしてもとてつもない怪物が放たれました。ドイツのBlack Forest Labsは2025年11月25日、同社の最新モデル「FLUX.2」を正式にリリースし、Hugging Faceにてその設計図にあたるウェイトを公開しました。
今回のFLUX.2、何がすごいかと言いますと、その「脳の大きさ」が桁違いです。前作のFLUX.1も非常に優秀でしたが、今回のモデルサイズはなんと320億パラメーター。これは一般的な家庭用PCで動く限界を攻めたサイズであり、その表現力はもはや実写の写真と区別がつかないレベル、いわゆる「4メガピクセル級」の超高解像度生成を実現しています。
技術的に非常に興味深いのは、ユーザーの指示文(プロンプト)を理解するパートに、テキスト生成AIとして定評のある「Mistral 3 Small」を採用した点です。これにより、「右手に赤いリンゴを持ち、左手で遠くを指差している」といった複雑な指示も、以前より遥かに正確に描き分けられるようになりました。
そして、クリエイターたちが最も歓喜しているのが「マルチリファレンス機能」の搭載です。これは最大10枚までの画像を参考資料としてAIに渡せる機能で、例えば自社製品の写真や、特定のキャラクターのスケッチを読み込ませれば、その特徴を完全に維持したまま、別のポーズや背景で新しい画像を生成できます。これまで「LoRA」と呼ばれる追加学習が必要だった作業が、これ一つで解決してしまうかもしれない、まさに革命的な機能です。
ただし、この高性能には代償もあります。そのまま動かすには90GBものVRAMが必要となるため、事実上、業務用の巨大なGPUサーバーが必要です。しかしそこは抜け目なく、NVIDIAと協力して軽量化(FP8量子化)を行っており、最新のRTXシリーズなどのハイエンドな個人用GPUでもなんとか動かせるようチューニングされています。
Hugging Faceのブログでは、すでにこのモデルを使った開発コードが公開されており、世界中のエンジニアがこの新しい「画家の筆」をどう使いこなそうかと、今まさに熱狂している最中です。
ついに、AIが「賢いチャットボット」の枠を飛び出し、「有能なデジタル社員」へと進化する瞬間が訪れました。Anthropicは2025年11月24日、同社の最上位モデルとなる「Claude 4.5 Opus」を正式にリリースしました。
今回の発表で最も注目すべきは、単なる文章生成能力の向上ではありません。「Agentic(エージェンティック)な能力」、つまりAIが自律的に行動する能力が劇的に強化された点です。
実はAnthropicは、今年9月に中位モデルである「Sonnet 4.5」を先行してリリースし、開発者たちの間でそのコーディング能力の高さが話題となっていました。しかし、今回登場した「Opus 4.5」は、より複雑で長期的な思考を必要とするタスクに特化しています。
特筆すべきは、2024年にベータ版として登場し、世界を驚かせた「Computer Use」機能の完成度です。Opus 4.5ではこの機能が正式版として統合され、AIが人間のようにブラウザを開き、社内システムにログインし、データを抽出してExcelで集計し、Slackで報告するといった一連の業務フローを、ほとんどミスなく完遂できるようになったとされています。
競合であるOpenAIやGoogleも同様の「エージェント機能」を強化していますが、Anthropicは「安全性」と「制御可能性」を強みとしており、企業の基幹業務システムを操作させるようなセンシティブな用途において、Opus 4.5は非常に魅力的な選択肢となります。
市場の反応も好意的で、特に金融や法務といったミスが許されない業界での導入が進むと見られています。これまでのAIは「質問に答えるツール」でしたが、これからのAIは「仕事を任せるパートナー」になる。Claude 4.5 Opusの登場は、そんな未来がもう目の前にあることを私たちに告げていると言えるでしょう。
ついに、日本のビジネス現場に「日本語を真に理解するAI」が本格実装される時が来ました。ソフトバンクの子会社であるSB Intuitionsは、2025年11月25日の公式ブログにて、かねてより開発を進めていた国産LLM「Sarashina(サラシナ)」の法人向けAPIサービスの全貌を公開しました。
これまで、日本の企業が生成AIを導入する際は、どうしてもOpenAIなどの海外勢に頼らざるを得ませんでした。しかし、海外製AIは日本語の流暢さこそ向上したものの、「空気を読む」ような日本独特の文脈理解や、国内の商習慣に基づいた細やかな対応には課題が残っていました。
今回発表された「Sarashina API」は、まさにその隙間を埋める存在です。特筆すべきは、その頭脳を支えるインフラの強大さです。実はこの発表の直前、11月中旬に公開されたスーパーコンピュータのランキングにおいて、ソフトバンクの計算基盤「CHIE-4(チエ・フォー)」が国内1位、世界でもトップクラスの性能を叩き出しました。この圧倒的な計算力を背景に、Sarashinaは日本語能力だけでなく、推論速度やコストパフォーマンスでも海外勢に真っ向勝負を挑める水準に達しています。
ブログでは技術的な詳細も明かされており、特に注目されるのは「10万トークン」クラスの長文脈理解(コンテキストウィンドウ)への対応です。これにより、企業は膨大な社内規定や過去の議事録をAIに読み込ませ、セキュリティを担保したまま、高精度な検索や要約を行わせることが可能になります。すでに中外製薬などが臨床開発業務での活用を表明しており、機密情報を海外サーバーに出したくない金融・医療業界からの引き合いが強まっています。
「AIは海外製を買うもの」から「国産を選んで使うもの」へ。Sarashinaの商用解禁は、日本のAI産業が自立し、独自の進化を遂げるための大きな転換点となるかもしれません。11月28日のサービス開始を前に、市場の期待は最高潮に達しています。
From the publisher's feed