Sign up to save your podcastsEmail addressPasswordRegisterOrContinue with GoogleAlready have an account? Log in here.
GitHubの音楽・音声AIリポジトリを毎日1本、約2分で紹介。TTS(音声合成)、MIDI、オーディオ処理など、「音」にまつわるオープンソースの注目プロジェクトをKanaとMariが声でナビゲートします。※この番組は日本語でお届けします。Kana と Mari のプロフィールはこちら:Kana – Newbie Esports Caster: https://y... more
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 426 episodes available.
August 06, 2026ivanvovk/durian-pytorchDurIAN(Duration Informed Attention Network)の実装で、音素ごとの継続時間・アライメント情報を利用したテキスト音声合成(TTS)モデルを提供します。バックボーン音声合成モデルと継続時間予測モデルを同時学習でき、LJSpeechデータセット向けの学習、検証、チェックポイント保存、推論をサポートします。独自データをMontreal Forced Alignerで音素アライメントする手順も説明されています。...more3minPlay
August 05, 2026resemble-ai/resemble-unity-text-to-speechResembleの音声生成APIとUnityを連携させるためのUnityプラグインです。生成音声や音素・タイミング情報をUnity内で扱い、音素テーブルを利用したシェーダー制御やBlendShapeによるキャラクターのリップシンクを実現します。サンプルシーンや音声アセットも含まれています。...more3minPlay
August 04, 2026tugstugi/pytorch-dc-ttsGuided Attentionを用いた深層畳み込みネットワークベースのText-to-Speech(TTS)システムをPyTorchで実装しています。テキストからメルスペクトログラムを生成するText2Melモデルと、メルスペクトログラムから線形スペクトログラムを高解像度化するSSRNモデルの学習・音声合成・データ前処理に対応し、英語(LJ Speech)とモンゴル語(Mongolian Bible)のデータセットを利用できます。...more3minPlay
August 03, 2026nobodywho-ooo/nobodywhoNobodyWhoは、llama.cppを基盤としてGGUF形式の大規模言語モデルを端末上でオフライン推論するRust製の推論エンジンです。ストリーミングチャット、会話コンテキスト管理、文法ベースのツール呼び出し、埋め込み・再ランキング、画像・音声入力、音声合成およびモデルダウンロードを提供し、Kotlin、Swift、Python、Flutter、React Native、Godotから利用できます。...more3minPlay
August 02, 2026Saganaki22/ComfyUI-VoxCPM2ComfyUI上でVoxCPM2を利用した多言語Text-to-Speech機能を提供するカスタムノードです。音声デザイン、参照音声による可 controllable/ultimate voice cloning、48kHz音声出力、LoRAの読み込みとComfyUI内でのLoRA学習に対応しています。ASRによる参照音声の自動文字起こし、ノイズ除去、モデルの自動管理、torch.compile最適化なども提供します。...more4minPlay
August 01, 2026OpenBMB/UltraEval-Audio音声基盤モデルの評価を統合的に行うためのオープンソース・フレームワークです。音声理解(ASR/AST/感情認識など)、音声生成(Speech-to-Speech/TTS)、音声コーデック評価を含む複数ベンチマークをまとめ、データセット管理、評価指標の実行、再現実験、断点再開や並列実行まで支援します。...more3minPlay
July 31, 2026ServiceNow/evaEVAは、会話型音声エージェントをエンドツーエンドで評価するためのオープンソースフレームワークです。音声入力から会話の完了度(Accuracy)と対話体験(Experience)を自動採点し、ボット同士の音声対話、ツール実行、検証、メトリクス集計までを一連で行います。航空・医療HR・ITSMなどの企業向けシナリオデータセットや、ノイズ・アクセント・回線劣化などの摂動評価も含まれます。...more3minPlay
July 30, 2026aahl/zai-ttsZAI/GLMのTTS(音声合成)APIを提供するプロキシ/ラッパー系のリポジトリです。Docker、CLI、Home Assistant連携を通じて、智谱TTSの内蔵音色やクローン音色を使った音声合成をローカル環境から利用できるようにしています。...more3minPlay
July 29, 2026team-telnyx/aiTelnyxのAI向け開発支援リポジトリで、AIエージェントやAI-first開発者がTelnyx APIを使いやすくするためのツール群をまとめています。主な内容は、Python/TypeScriptのAgent Toolkit、エージェント向けCLI、Claude Code/Cursor/Gemini/OpenCode向けプラグイン、MCPプロキシ、Agent Skills、運用ガイドです。...more3minPlay
July 28, 2026keonlee9420/StyleSpeechMeta-StyleSpeech / StyleSpeech の PyTorch 実装で、マルチスピーカー対応のテキスト音声合成(TTS)を学習・推論するためのリポジトリです。LibriTTS などのデータセットを前処理し、メタ学習を含む学習、単文・バッチ推論、TensorBoard での可視化を行えます。...more3minPlay
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 426 episodes available.