【訂正 2025/11/24】
当初アップロードした音声内で紹介した、文字起こしに要した時間の計測方法に誤りがあることが分かりました。
音声では、30秒のオーディオデータを文字起こしした際の時間 (whisper large v3 model 使用) として
- faster-whisper: 約11.8秒
- Pytorch版 whisper (OpenAI公式): 約94秒
と紹介していましたが、 faster-whisper の計測コードに誤りがありました。
正しくは
であり、 PyTorch版の約2倍程度速い、というのが計測結果です。
誤解を生む発言となったことをお詫びいたします。
(エピソード内でも訂正の文言を入れています。)
以下、通常の show notes です。
Lonが文字起こし (speech-to-text) の技術を調査し、実際に検証した学びについて共有しています。
Open AI が開発したモデルである whisper と、それを CTranslate2 ラインタイムで高速化した faster-whisper について、その概要と実際にこのPodcastのエピソードで文字起こしをした結果について共有しています。
文字起こしの技術について深く議論をしているのは 15:20 ごろからです。
そこまでは文字起こしの技術を調べようと思った背景や、今後このポッドキャストで挑戦したい内容について雑談をしています。
参考リンク
Open AI whisper Github repository: https://github.com/openai/whisper
faster-whisper Github repository: https://github.com/SYSTRAN/faster-whisper
CTranslate2 Github repository: https://github.com/OpenNMT/CTranslate2