Sign up to save your podcastsEmail addressPasswordRegisterOrContinue with GoogleAlready have an account? Log in here.
GitHubの音楽・音声AIリポジトリを毎日1本、約2分で紹介。TTS(音声合成)、MIDI、オーディオ処理など、「音」にまつわるオープンソースの注目プロジェクトをKanaとMariが声でナビゲートします。※この番組は日本語でお届けします。Kana と Mari のプロフィールはこちら:Kana – Newbie Esports Caster: https://y... more
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 432 episodes available.
October 01, 2026keonlee9420/STYLER|高速で制御可能な音声合成|GitHubSTYLERは、音声をテキストから生成するニューラルTTSフレームワークです。非自己回帰型モデル、音声とテキストのアライメント、話者・発話スタイル・ノイズ要因の分離により、高速で頑健かつ表現豊かで制御可能な音声合成を実現します。VCTKとWHAM!を用いた学習、前処理、評価、推論に対応しています。関連: keonlee9420/STYLER/高速で制御可能な音声合成/GitHub...more3minPlay
September 30, 2026sidharthrajaram/StyleTTS2|文章を自然な音声に変換するAI|GitHubStyleTTS 2をPythonパッケージとして利用し、文章から自然な音声を合成する推論ライブラリです。事前学習済みモデルによる音声生成、参照音声を使った声質のクローニング、スタイルベクトル指定、WAV出力に対応しています。学習やファインチューニング機能は含まれず、推論に特化しています。関連: sidharthrajaram/StyleTTS2/文章を自然な音声に変換するAI/GitHub...more2minPlay
September 29, 2026pattern-ai-labs/agentcall|音声で会議に参加するAI|GitHubAIエージェントをGoogle Meet、Zoom、Microsoft Teamsなどのビデオ会議に音声参加させるAgentCallスキルです。リアルタイム文字起こし、音声応答、アバター表示、画面共有、チャット、スクリーンショットなどを提供し、各種コーディングエージェントと連携して会議中の作業も可能にします。関連: pattern-ai-labs/agentcall/音声で会議に参加するAI/GitHub...more3minPlay
September 28, 2026owenawsong/Inflect|ローカル英語音声合成エンジン|GitHubInflect v2は、英語テキストを24kHzの音声波形へ変換するローカルTTSエンジンです。PyTorchによるCPU・CUDA推論、Python API、CLI、長文分割、速度・発話変動・乱数シード制御に対応し、3.96Mと9.36Mパラメータの2モデルを提供します。リポジトリには評価資料やZipVoice・MOSS-TTSとの比較用サーバーも含まれます。関連: owenawsong/Inflect/ローカル英語音声合成エンジン/GitHub...more3minPlay
September 27, 2026leemysw/yovoice|文字を音声に変える音声生成AI|GitHubyovoiceは、macOSとWindows上で動作するローカル音声生成・音声制作ツールです。音声クローニング、感情や話し方の制御、字幕対応の複数話者プロジェクト、タイムライン編集、WAV書き出しを提供し、デスクトップアプリとCLIの両方でクラウドAPIなしにTTSモデルを実行できます。関連: leemysw/yovoice/文字を音声に変える音声生成AI/GitHub...more3minPlay
September 26, 2026zhenye234/FlashSpeech|高速なゼロショット音声合成|GitHubFlashSpeech論文に基づく、効率的なゼロショット音声合成の実装です。AmphionのNaturalSpeech2を基盤に、音声データの前処理、LibriTTSを用いた段階的な学習、推論、音声品質や話者類似度などの評価機能を提供します。ステージ3の実装など、一部の機能は未完成です。関連: zhenye234/FlashSpeech/高速なゼロショット音声合成/GitHub...more3minPlay
September 25, 2026chinokikiss/GSV-TTS-Lite|低遅延な音声合成エンジン|GitHubGPT-SoVITS V2、V2Pro、V2ProPlus向けの高性能な音声合成推論バックエンドです。ストリーミング推論、バッチ処理、字単位タイムスタンプ、音色変換、話者認証などを提供し、CUDA GraphやKVキャッシュ、連続バッチ処理により低遅延・低VRAM動作を実現します。関連: chinokikiss/GSV-TTS-Lite/低遅延な音声合成エンジン/GitHub...more3minPlay
September 24, 2026soniqo/speech-android|GitHubAndroid端末上で音声認識、音声合成、音声区間検出、話者分離、話者埋め込み、ノイズ抑制を実行するオンデバイス音声SDKです。Kotlin SDKとJNIブリッジを通じてspeech-coreおよびONNX Runtimeを利用し、クラウドへデータを送信せず、音声パイプラインやシステム音声入力・TTSサービス、デモアプリを提供します。関連: soniqo/speech-android/GitHub...more3minPlay
September 23, 2026AlexandaJerry/whisper-vits-japanese|音声から日本語音声合成を学習|GitHubGoogle Whisperを音声認識とデータ準備に利用し、長時間音声を自動文字起こし・分割してVITS用の日本語音声合成データセットへ変換するプロジェクトです。前処理からVITSの学習、推論、単一話者・複数話者モデルの作成までをColabやJupyter Notebookで実行できます。関連: AlexandaJerry/whisper-vits-japanese/音声から日本語音声合成を学習/GitHub...more3minPlay
September 22, 2026HojoAI/Hojo-TTS-Light|軽量な音声合成エンジン|GitHubHojoAIが開発する軽量なテキスト音声合成モデルで、中国語と英語の音声を生成します。40M版は15種類のプリセット音声、80M版は数秒の音声を使った話者音声クローンに対応し、ONNX RuntimeによるCPU・GPU推論を提供します。関連: HojoAI/Hojo-TTS-Light/軽量な音声合成エンジン/GitHub...more3minPlay
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 432 episodes available.