タイトル
アリババ、リアルタイム同時通訳AI「Qwen3.8-LiveTranslate」を発表──遅延2.3秒への短縮と話者分離・声質保持を単一モデルで実現
このエピソードで登場するキーワードを説明します。
Qwen3.8-LiveTranslate: アリババが発表したリアルタイム同時通訳に特化した次世代マルチモーダルAIモデル。
Interleave(インターリーブ)アーキテクチャ: 音声・テキスト・映像などの異なるモダリティを別々のパイプラインで直列処理せず、時系列に沿って1つのシーケンスとして織り交ぜて処理する統合構造。
Thinker-Talkerモデル: 理解・推論・翻訳テキスト生成を担う「Thinker」と、原話者の声質を反映して翻訳音声を直接合成する「Talker」で構成されるハイブリッドMoE(Mixture of Experts)設計。
LAAL (Length-Adaptive Average Lagging): 同時通訳における入力音声に対する出力の「平均遅延時間」を測る評価指標。
話者分離(Diarization): 音声ストリーム内で「誰が話しているか」をリアルタイムに識別・区別する技術。
それでは解説に入ります。
2026年9月18日、アリババのQwenチームは、リアルタイム同時通訳AI「Qwen3.8-LiveTranslate」を正式発表しました。「Names the speaker. Carries the meaning.(話者を特定し、文脈と真意を届ける)」をスローガンに掲げ、単なる高速な翻訳にとどまらず、話者の識別や声質の再現、長文脈による曖昧さの解消までを一体化したモデルです。
従来のリアルタイム通訳システムは、「音声認識(ASR)→ 機械翻訳(MT)→ 音声合成(TTS)」という3段階のパイプラインで構築されることが多く、各段階での遅延累積や文脈落ち、話者情報の喪失が課題とされていました。Qwen3.8-LiveTranslateでは、映像・音声・テキストをひとまとめに時系列処理する「Interleaveアーキテクチャ」を採用。聞き取った音声や生成済み翻訳をキャッシュして再利用することで、通訳の正確性と流暢性を向上させつつ、平均遅延(LAAL)を前世代の2.8秒から2.3秒へと大幅に短縮しました。
本モデルの大きな進化点は、実世界の複雑な対面会議や多人数ディスカッションに対応した3つの新機能です。
第1に、リアルタイムな「話者分離と声質クローニング」です。複数人が交代で発言しても「誰の発言か」をモデル自身が即座に判別・タグ付けし、通訳音声でも各話者本来の声色やトーンを維持して再生します。
第2に、「原文と訳文の同期出力」です。バイリンガル表示に対応しており、通訳音声を聞きながら画面上で原文と訳文の対照テキストを即座に確認できます。これにより、字幕表示や会議録の要約・検索機能への後段連携が容易になります。
第3に、「長文脈と視覚情報を活かした曖昧性解消」です。直前の対話履歴やカメラ映像のフレームをコンテキストとして参照することで、同音異義語や固有名詞、代名詞の指示対象を取り違えることなく、一貫した訳出を行います。
対応言語は、音声入力・テキスト出力で日本語を含む60言語、翻訳音声の出力(合成)で29言語をサポートしています。評価ベンチマーク「FLEURS」や複数話者データセット「Omnilingua-MSpeaker」においても、主要な既存通訳システムを上回る忠実度と低い話者分離エラー率(DER)を記録しました。
すでにアリババのクラウド基盤「DashScope(Model Studio)」を通じて、WebSocket形式のリアルタイムAPI「qwen3.8-livetranslate-flash-realtime」として提供が開始されています。国際会議や多国籍チームのリモートワーク、クロスボーダーな接客・商談など、グローバルビジネスの現場における言語の壁を一段と低くする実務的基盤として注目を集めています。
今回のエピソードは以上で終了です。また次回お会いしましょう。