Sign up to save your podcastsEmail addressPasswordRegisterOrContinue with GoogleAlready have an account? Log in here.
GitHubの音楽・音声AIリポジトリを毎日1本、約2分で紹介。TTS(音声合成)、MIDI、オーディオ処理など、「音」にまつわるオープンソースの注目プロジェクトをKanaとMariが声でナビゲートします。※この番組は日本語でお届けします。Kana と Mari のプロフィールはこちら:Kana – Newbie Esports Caster: https://y... more
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 413 episodes available.
August 13, 2026sgl-project/sglang-omniSGLang-Omniは、マルチモーダル、音声、音声合成(TTS)モデル向けのマルチステージ推論・サービングランタイムです。前処理、エンコーダ、自己回帰生成、デコーダ、ボコーダなどを分離して管理し、共有メモリ・NCCL・NIXL・Mooncakeによるステージ間通信と、OpenAI互換APIを提供します。音声生成・ストリーミング・音声認識・話者分離・画像や動画理解に加え、性能および精度評価用のベンチマーク機能も含みます。...more3minPlay
August 12, 2026FelixWaweru/elevenlabs-nodeEleven Labs APIを利用して、テキストを音声に変換するNode.js向けパッケージです。音声ファイルへの保存や音声ストリームの取得に加え、音声・モデル・ユーザー情報の取得、音声設定の編集や音声削除などのAPI操作を提供します。...more3minPlay
August 11, 2026WelkinYang/Learn2Sing2.0Learn2Sing 2.0は、歌唱データを持たない対象話者向けに、歌唱教師のデータから高品質な歌声を合成する音声合成研究の公式実装およびデモページです。拡散モデルによる音響特徴復元と相互情報量制約による話者・歌唱スタイル表現の分離を利用し、学習・推論用スクリプトと生成音声のブラウザ再生デモを提供します。...more3minPlay
August 10, 2026roatienza/efficientspeechEfficientSpeechは、組み込み機器やCPU上で高速に動作する軽量なニューラル音声合成(TTS)モデルです。テキストを音素列へ変換し、ピラミッド型Transformer/U-Net風のモデルでメルスペクトログラムを生成した後、HiFi-GANボコーダーで音声波形を合成します。学習、推論、WAV出力、ONNXおよびTorchScriptへの変換、LJSpeechデータセットの前処理に対応しています。...more3minPlay
August 09, 2026zeropointnine/tts-audiobook-tooltts-audiobook-toolは、EPUBやテキストファイルから高品質なオーディオブックを生成する生成AIベースのテキスト音声合成ツールです。複数のTTSモデル、音声クローン、音声認識による生成結果の検証・再試行、音声編集・連結・音量正規化、M4B/FLAC出力に対応しています。生成音声と単語単位のタイミング情報を利用した、同期ハイライト付きの静的ブラウザプレイヤーやREST型TTSサーバーも提供します。...more3minPlay
August 08, 2026mx-space/coreMix Spaceは、個人ブログやクリエイター向けWebサイトのためのAI対応ヘッドレスCMSスタックを構築するモノレポです。NestJS製コアサーバー、React製管理画面、iOSクライアント、APNsプッシュ通知リレー、テレメトリ収集基盤、および各種共有SDK・CLI・エディタ関連パッケージを提供します。...more3minPlay
August 07, 2026Kyubyong/speaker_adapted_tts事前学習済みのTTSモデルを利用し、わずか1分程度の音声サンプルで話者適応を行う実験プロジェクトです。約10分のファインチューニングで、Nick Offerman、Kate Winslet、Modern Family出演者などの声を再現する結果を紹介しています。モデルの詳細や実装、事前学習済みモデルは関連リポジトリのDCTTSで提供されています。...more3minPlay
August 06, 2026ivanvovk/durian-pytorchDurIAN(Duration Informed Attention Network)の実装で、音素ごとの継続時間・アライメント情報を利用したテキスト音声合成(TTS)モデルを提供します。バックボーン音声合成モデルと継続時間予測モデルを同時学習でき、LJSpeechデータセット向けの学習、検証、チェックポイント保存、推論をサポートします。独自データをMontreal Forced Alignerで音素アライメントする手順も説明されています。...more3minPlay
August 05, 2026resemble-ai/resemble-unity-text-to-speechResembleの音声生成APIとUnityを連携させるためのUnityプラグインです。生成音声や音素・タイミング情報をUnity内で扱い、音素テーブルを利用したシェーダー制御やBlendShapeによるキャラクターのリップシンクを実現します。サンプルシーンや音声アセットも含まれています。...more3minPlay
August 04, 2026tugstugi/pytorch-dc-ttsGuided Attentionを用いた深層畳み込みネットワークベースのText-to-Speech(TTS)システムをPyTorchで実装しています。テキストからメルスペクトログラムを生成するText2Melモデルと、メルスペクトログラムから線形スペクトログラムを高解像度化するSSRNモデルの学習・音声合成・データ前処理に対応し、英語(LJ Speech)とモンゴル語(Mongolian Bible)のデータセットを利用できます。...more3minPlay
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 413 episodes available.