Sign up to save your podcastsEmail addressPasswordRegisterOrContinue with GoogleAlready have an account? Log in here.
GitHubの音楽・音声AIリポジトリを毎日1本、約2分で紹介。TTS(音声合成)、MIDI、オーディオ処理など、「音」にまつわるオープンソースの注目プロジェクトをKanaとMariが声でナビゲートします。※この番組は日本語でお届けします。Kana と Mari のプロフィールはこちら:Kana – Newbie Esports Caster: https://y... more
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 424 episodes available.
September 13, 2026akiani/aidialer|リアルタイムAI電話自動応答|GitHubTwilioの電話回線と音声AIサービスを連携し、低遅延で割り込み可能なAI電話発信・応答システムを構築するリポジトリです。音声認識、LLMによる会話制御、音声合成、通話転送・終了、文字起こし表示をFastAPIとStreamlitで提供します。なお、Deepgram・ElevenLabs・OpenAIのAPI変更により、2025年時点ではコードが obsolete で参照用として維持されています。関連: akiani/aidialer/リアルタイムAI電話自動応答/GitHub...more3minPlay
September 12, 2026tabahi/bournemouth-forced-aligner|音声を音素単位で強制アライン|GitHubBournemouth Forced Alignerは、音声ファイルと発話テキストを入力として、各音素・単語の発話位置をミリ秒単位で推定する多言語強制アライメントツールです。CUPEニューラルモデルとespeak-ngによる音素化を使い、JSON、Praat TextGrid、メルスペクトログラム向けフレームラベル、音素埋め込みを出力できます。関連: tabahi/bournemouth-forced-aligner/音声を音素単位で強制アライン/GitHub...more3minPlay
September 11, 2026ahpxex/read-aware|AI搭載電子書籍リーダー|GitHubReadAwareは、EPUBやPDFなど多様な形式に対応したローカルファーストの電子書籍リーダーです。読書中のハイライト、メモ、会話をもとに記憶を構築する単一AIエージェントと、機能を拡張できるサンドボックス型プラグインシステムを備えています。関連: ahpxex/read-aware/AI搭載電子書籍リーダー/GitHub...more3minPlay
September 10, 2026EveningStudy/asmr-dubber|音声動画を中国語に吹き替え|GitHub日本語または英語の音声・動画を認識、翻訳し、中国語の字幕や音声へ変換するローカル向けダビングツールです。原音を保持したまま、ASR、翻訳、音声合成、混音を段階的に実行でき、字幕やタイミングを手動校正できます。関連: EveningStudy/asmr-dubber/音声動画を中国語に吹き替え/GitHub...more3minPlay
September 09, 2026jianchang512/pyvideotrans|動画を翻訳して吹き替えるAI|GitHubpyVideoTransは、動画や音声の音声認識、字幕生成・翻訳、AI音声合成、吹き替え、音声と映像の同期までを一括して行うオープンソースの動画翻訳ツールです。ローカルモデルと各種オンラインAPIに対応し、GUI、CLI、WebUI、Dockerによる実行環境を提供します。関連: jianchang512/pyvideotrans/動画を翻訳して吹き替えるAI/GitHub...more3minPlay
September 08, 2026Mag1cFall/AIStudio2API|GitHubGoogle AI StudioのWebプロトコルを変換し、OpenAI Chat Completions・Responses、Anthropic Messages、Gemini GenerateContent互換のAPIとして提供する高性能プロキシサービスです。複数Googleアカウントのローテーション、ストリーミング、画像・動画・音声生成、Googleツール、ファイル、Live通信などに対応し、Web UIからアカウントやサービスを管理できます。関連: Mag1cFall/AIStudio2API/GitHub...more3minPlay
September 07, 2026scorbo2/TalkWithMe|ローカルAIグループチャット|GitHubTalkWithMeは、ローカルで動作するllama.cppサーバーと接続して利用する、単一ユーザー向けのチャットWebアプリケーションです。複数のAIペルソナによるグループチャット、チャットルーム、会話履歴保存、任意のTTS・STT・MCPツール連携に対応しています。関連: scorbo2/TalkWithMe/ローカルAIグループチャット/GitHub...more3minPlay
September 06, 2026OpenMOSS/MOSS-TTS|高品質な音声と効果音を生成するAI|GitHubMOSS-TTS Familyは、音声合成・音声クローニング・多話者対話・リアルタイム音声生成・音声設計・環境音生成を扱うオープンソースAIモデル群です。PyTorchベースの推論に加え、llama.cppとONNX Runtimeを利用したTorch不要の軽量推論や、SGLang-Omni・vLLM-Omniによる高速配信にも対応しています。関連: OpenMOSS/MOSS-TTS/高品質な音声と効果音を生成するAI/GitHub...more3minPlay
September 05, 2026hhguo/MSMC-TTS|高品質な音声合成AI|GitHubMSMC-TTSは、マルチステージ・マルチコードブックVQによる高品質なニューラル音声合成システムの実装です。MSMC-VQ-GANベースのオートエンコーダーで音声表現を学習し、マルチステージ予測器でテキストから音声を合成できます。CSMSCなどの中国語データセットを用いた学習、マルチGPU学習、推論に対応しています。関連: hhguo/MSMC-TTS/高品質な音声合成AI/GitHub...more3minPlay
September 04, 2026adelacvg/ttts|ゼロショット音声合成AI|GitHubDetailTTSは、テキストと参照音声から話者性を保った音声を生成するゼロショット音声合成システムです。VITS系のVQVAEと音声トークナイザーを組み合わせ、英語・中国語・日本語・韓国語に対応し、学習・推論・ファインチューニングを提供します。関連: adelacvg/ttts/ゼロショット音声合成AI/GitHub...more3minPlay
FAQs about Kana & Mari's SoundRepos (Japanese):How many episodes does Kana & Mari's SoundRepos (Japanese) have?The podcast currently has 424 episodes available.