大家好,歡迎來到「初心客家」。這隻節目逐日都在這摎你共下分享客家个大細事,𠊎係主持人阿元妹。
今晡日這一期,𫣆愛來讀一篇當重要个人工智慧文章,係 Sesame 團隊在二零二五年二月二十七日發表个〈Crossing the uncanny valley of conversational voice〉。這篇文章講个毋單淨係 AI 聲音合成技術,應該係一隻較深个問題:若係 AI 愛成為人類真正會想長透使用个助理,佢个聲音毋好淨係清楚、標準、無雜音,還愛有情緒、有節奏、有停頓、有理解現場个能力。
文章一開始就問:𫣆仰般知一個人正經理解𫣆?其實毋一定係因為佢回答个字句完全正確,較多時節,係從聲音肚聽出來。譬如一個人講話个時節,聲音有一點興奮,有一點停頓,有一點安慰,有一點溫暖,𫣆就會感覺佢有聽入心。聲音毋單淨傳達文字,聲音還帶等語氣、情緒、節奏摎關係。
Sesame 團隊講,這下當多 digital voice assistants,雖然做得回答問題,毋過少忒一種會分人感覺「佢在這位陪你」个品質。若一隻 personal assistant 長透用平平、無情緒、無變化个聲音講話,頭擺新鮮感過忒以後,人就會覺得攰,甚至無想愛繼續用。這就係文章講个重點:AI 聲音若愛行過 uncanny valley,就毋好淨像人,還愛分人感覺自然、可信、鬆爽。
這裡个 uncanny valley,原本係機器人學摎動畫領域常講个概念。意思係,當一個東西有一點像人,毋過又毋完全像人,𫣆反而會感覺怪怪、毋自在。用在聲音項,若 AI 聲音聽起來很像真人,毋過情緒錯位、停頓毋自然、回應節奏怪怪,該就會落入聲音个 uncanny valley。你會覺得佢差一點就係人,毋過就係該一點差距,分人心肝肚發毛。
Sesame 提出一隻核心目標,喊做 voice presence。這隻詞做得理解成「聲音个臨場感」或者「聲音个存在感」。毋係淨講音質靚,應該係講 AI 在語音互動肚,分人感覺佢有在聽、有在回應、有在理解,還有穩定个個性。voice presence 包含四隻要素:第一係 emotional intelligence,會讀情緒摎回應情緒;第二係 conversational dynamics,會掌握自然个時間、停頓、打斷摎強調;第三係 contextual awareness,會照情境調整語氣摎風格;第四係 consistent personality,會維持一致、可靠、合適个存在感。
這四點若放在客話 AI 來想,當有啟發。譬如一隻客話打嘴鼓機器人,毋係淨會翻譯「𠊎愛食飯」就好。佢愛知講話个人係細人仔、後生人、長輩,還係學客話个初學者;愛知對方係歡喜、緊張、毋知所措,抑係想用客話練習告白;愛知這句話係正式場合,還係屋下飯桌邊个打嘴鼓。若係 AI 毋曉得情境,客話會變成冷冰冰个字詞;若係 AI 有 voice presence,客話就較有機會變成真正生活个聲音。
文章後半部進入技術介紹,Sesame 團隊提出 Conversational Speech Model,簡稱 CSM。傳統 text-to-speech,也就係 TTS,主要係摎文字變成聲音。問題係,同一句話做得有當多種講法。譬如「你來了」這句,做得歡喜講,做得驚訝講,做得生氣講,做得冷冷講。文字一樣,語氣無共樣,意思就差當遠。這就係文章講个 one-to-many problem:一句文字有當多合理个聲音版本,毋過只有少數版本符合當下情境。
故所,CSM 毋係淨看這一句文字,佢會利用前背个 conversation history,也就係對話歷史,來生成較自然、較連貫个聲音。這一點當重要。人類打嘴鼓本來就毋係一句一句孤立講出來。𫣆會記得前一句係麼个,會聽對方个語氣,會照對方个情緒調整自家講法。若 AI 聲音毋看上下文,佢就容易講出「音質像人、態度不像人」个回答。
技術項,CSM 係一隻 multimodal text and speech model,用 transformers 來處理文字摎聲音。文章講,當代音訊模型常會摎連續个 waveform 轉成 discrete audio tokens。這兜 tokens 大體有兩類:semantic tokens 摎 acoustic tokens。semantic tokens 較像係壓縮過个語意摎語音特徵,做得掌握講麼个、發音大方向摎部分韻律;acoustic tokens 則保留較細个聲學細節,像講者个聲音特色、音色摎質感。
頭擺有兜方法會先生成 semantic tokens,再用第二階段重建高品質音訊。這種兩階段方法有結構,毋過問題係 semantic tokens 會變成瓶頸。若係第一階段無完整抓著 prosody,也就係聲調、節奏、重音、停頓這兜韻律資訊,後背再仰般重建,聲音乜會差一截。Sesame 个 CSM 特色,係想用較 end-to-end 个方式來處理,直接在 RVQ tokens 項工作,減少階段切開造成个限制。
文章提著 RVQ,也就係 Residual Vector Quantization。簡單講,這係一種摎聲音壓成多層 codebooks 个方式。每一層 codebook 保留一部分聲音資訊,合起來就做得重建較細緻个音訊。毋過,RVQ 乜有延遲問題。若模型愛一層一層生成,等到全部 codebooks 都準備好正出聲,real-time conversation 就會慢。打嘴鼓最驚慢半拍,因為人類對停頓當敏感。停忒久,感覺就毋自然。
CSM 个設計係用兩隻 autoregressive transformers。第一隻 multimodal backbone 處理交錯个 text and audio tokens,先預測第零層 codebook;第二隻較細个 audio decoder 再生成後背个 codebooks,重建聲音。這樣做个好處,係 backbone 掌握主要語意摎上下文,decoder 負責補聲音細節。decoder 較細,延遲較低,較合適 real-time speech generation。
文章還提著 compute amortization。這部分聽起來較硬,毋過意思做得簡單理解:若每一個音訊 frame、每一層 codebook 都完整訓練,記憶體摎運算負擔會忒重,訓練會慢,模型也無法度快速試驗。Sesame 个方法係,第零層 codebook 每一幀都訓練,後背 decoder 則隨機抽一部分 frame 來訓練,像係一種分攤運算个方法。照文章講,這樣做無明顯影響音質損失,卻做得減少訓練負擔。
實驗部分,Sesame 用大約一百萬小時、主要係英文个公開音訊資料,經過 transcription、diarization 摎 segmentation。佢兜訓練三種模型大小:Tiny 係 1B backbone 加 100M decoder;Small 係 3B backbone 加 250M decoder;Medium 係 8B backbone 加 300M decoder。逐隻模型用 2048 sequence length,大約兩分鐘音訊,訓練五個 epochs。
評估方面,文章提醒,傳統語音合成指標,像 word error rate 摎 speaker similarity,已經有一點飽和。也就係講,現代模型在「字有無唸對」「聲音像毋像某位講者」這兜指標項,已經接近真人水準。問題係,這無代表模型正經會打嘴鼓。因為會唸字,毋代表會照情境唸對;聲音像人,毋代表語氣有貼著場合。
故所 Sesame 提出較細緻个測試,像 Homograph Disambiguation。同一串英文字母在毋同情境有毋同發音,例如 lead 做金屬个「鉛」時,讀音摎 lead 做「帶領」時無共樣。模型若正經理解上下文,就愛選著正確發音。另一隻測試係 Pronunciation Continuation Consistency,評估多輪對話中,模型會毋會維持某隻詞个發音一致。像 route 有毋同地區發音,AI 若前背跟某一種講法,後背就毋好突然跳去另一種。
這對客話乜有直接啟發。客話有四縣、海陸、大埔、饒平、詔安等腔調,還有地方詞彙差異。若一隻客話 voice AI 頭一句用四縣腔,第二句突然變海陸腔,或者同一隻詞前後發音無一致,聽个人馬上會覺得怪。故所未來客話語音模型,毋單淨愛「會講客話」,還愛「腔口一致」、「情境合適」、「前後連貫」。
主觀評估方面,Sesame 用 CMOS,也就係 Comparative Mean Opinion Score,請人類聽 generated speech 摎真人錄音,評哪一個較像真人、哪一個較適合接續對話。結果當有意思:若無給上下文,人類評審對生成聲音摎真人聲音無明顯偏好,表示自然度可能已經接近飽和。毋過,若提供前九十秒个音訊摎文字上下文,評審就較偏好真人錄音。這代表 AI 聲音表面自然已經做得當好,毋過在「照上下文調整 prosody」這件事項,還同真人有一段差距。
這就是 conversational voice 个真正難題。毋係淨係聲音靚,應該係聲音要知前情、知氣氛、知輪到誰講、知幾時停、知幾時接、知幾時輕聲、知幾時強調。人類打嘴鼓有 turn taking,有 pauses,有 pacing,有 interruption,有眼神、表情、現場關係。CSM 這下做得生成高品質 conversational prosody,毋過文章也坦白講,佢還只能建模文字摎語音內容,無完全建模打嘴鼓个整體結構。未來可能愛行向 fully duplex models,分 AI 做得一邊聽、一邊理解、一邊準備回應,像人類打嘴鼓共樣自然。
文章最尾講限制。CSM 這下主要用英文資料訓練,所以多語能力還無好,雖然資料肚可能有一兜語言混入,毋過表現還毋理想。Sesame 計畫擴大模型、增加資料量,支援超過二十種語言,也想結合 pre-trained language models,行向同時深懂 speech 摎 text 个 large multimodal models。佢兜也講,會開源研究个重要組件,模型會用 Apache 2.0 license。
這篇文章對𫣆做客話、客家文化、AI 應用,有幾隻重要提醒。第一,客話 AI 毋好淨追「文字翻譯正確」,還愛追「聲音自然」。第二,聲音自然毋係淨音質好,還包含情緒、停頓、腔口、語境。第三,客話有腔調差異,故所模型需要高品質、標註清楚、有情境个語音資料。第四,若愛分後生人願意摎客話 AI 打嘴鼓,AI 个聲音就愛有親近感,毋好像課本朗讀,也毋好像客服系統。
用教育來講,未來客話學習若結合這種 conversational voice,可能會出現當生趣个場景。學生下課後打開手機,AI 用四縣腔陪佢練習買東西、講心情、介紹屋下、問路、講故事。學生講毋著,AI 毋係冷冷糾正,應該係用鬆爽个語氣講:「這句已經聽得識,若愛較自然,做得恁樣講。」這種有聲音、有回饋、有情緒个練習,會比單純背詞較接近生活。
毋過𫣆乜愛驚怕另一件事:若資料無掌握在社群手項,若腔口無經專業先生摎在地長輩校對,若模型淨用主流語言資料來推估客話,該生成个客話可能會表面流利,實際項錯誤當多。故所客話 conversational voice 未來若愛做好,毋單需要工程師,還需要客話先生、社區長輩、語料整理者、文化研究者共下合作。
總結來講,Sesame 這篇〈Crossing the uncanny valley of conversational voice〉真正重要个地方,係摎 AI 聲音个目標從「像人講話」推進到「像一個會理解情境个打嘴鼓夥伴」。這毋單係技術升級,乜係介面觀念个改變。未來人摎 AI 互動,可能毋再係打字、等答案,應該係用聲音自然來回,像摎一位助理、教練、先生、朋友講話。
對「初心客家」來講,這篇文章提醒𫣆:客話个未來毋單在文字保存,乜在聲音復活。若有一日,AI 做得用自然个四縣腔、海陸腔、詔安腔,陪後生人打嘴鼓,陪長輩記錄故事,陪學生練習生活對話,該就毋係淨淨一項科技產品,應該係客話重新行入日常生活个一條新路。
這就係今晡日「初心客家」摎你共下閱讀个文章。人工智慧个聲音若愛行過 uncanny valley,關鍵毋係聲音有幾像真人,應該係佢有無理解情境、有無掌握節奏、有無尊重語言个文化脈絡。對客話來講,這條路還當長,毋過方向已經當清楚:𫣆毋單愛分 AI 會講客話,還愛分 AI 用對个腔、對个情緒、對个節奏,摎人正經打嘴鼓。
資料來源:
Sesame:Crossing the uncanny valley of conversational voice。
--
Hosting provided by SoundOn