GitHubの音楽・音声AIリポジトリを毎日1本、約2分で紹介。TTS(音声合成)、MIDI、オーディオ処理など、「音」にまつわるオープンソースの注目プロジェクトをKanaとMariが声でナビゲートします。※この番組は日本語でお届けします。Kana と Mari のプロフィールはこちら:Kana – Newbie Esports CasterMari – Newbie Esports Analyst※ 本番組の原稿は生成 AI を用いて自動生成されています。内容には誤りを含む可能性がありますので参考情報としてお楽しみください。
2026年9月29日 · 2:11
AIエージェントをGoogle Meet、Zoom、Microsoft Teamsなどのビデオ会議に音声参加させるAgentCallスキルです。リアルタイム文字起こし、音声応答、アバター表示、画面共有、チャット、スクリーンショットなどを提供し、各種コーディングエージェントと連携して会議中の作業も可能にします。 関連:…
2026年9月28日 · 2:10
Inflect v2は、英語テキストを24kHzの音声波形へ変換するローカルTTSエンジンです。PyTorchによるCPU・CUDA推論、Python API、CLI、長文分割、速度・発話変動・乱数シード制御に対応し、3.96Mと9.36Mパラメータの2モデルを提供します。リポジトリには評価資料やZipVoice・MOSS-TTSとの比較用サーバーも含まれ…
2026年9月27日 · 2:07
yovoiceは、macOSとWindows上で動作するローカル音声生成・音声制作ツールです。音声クローニング、感情や話し方の制御、字幕対応の複数話者プロジェクト、タイムライン編集、WAV書き出しを提供し、デスクトップアプリとCLIの両方でクラウドAPIなしにTTSモデルを実行できます。 関連:…
2026年9月26日 · 2:12
FlashSpeech論文に基づく、効率的なゼロショット音声合成の実装です。AmphionのNaturalSpeech2を基盤に、音声データの前処理、LibriTTSを用いた段階的な学習、推論、音声品質や話者類似度などの評価機能を提供します。ステージ3の実装など、一部の機能は未完成です。 関連:…
2026年9月25日 · 2:10
GPT-SoVITS V2、V2Pro、V2ProPlus向けの高性能な音声合成推論バックエンドです。ストリーミング推論、バッチ処理、字単位タイムスタンプ、音色変換、話者認証などを提供し、CUDA GraphやKVキャッシュ、連続バッチ処理により低遅延・低VRAM動作を実現します。 関連:…
2026年9月24日 · 2:20
Android端末上で音声認識、音声合成、音声区間検出、話者分離、話者埋め込み、ノイズ抑制を実行するオンデバイス音声SDKです。Kotlin SDKとJNIブリッジを通じてspeech-coreおよびONNX Runtimeを利用し、クラウドへデータを送信せず、音声パイプラインやシステム音声入力・TTSサービス、デモアプリを提供します。 関連:…
2026年9月23日 · 2:03
Google Whisperを音声認識とデータ準備に利用し、長時間音声を自動文字起こし・分割してVITS用の日本語音声合成データセットへ変換するプロジェクトです。前処理からVITSの学習、推論、単一話者・複数話者モデルの作成までをColabやJupyter Notebookで実行できます。 関連:…
2026年9月22日 · 2:20
HojoAIが開発する軽量なテキスト音声合成モデルで、中国語と英語の音声を生成します。40M版は15種類のプリセット音声、80M版は数秒の音声を使った話者音声クローンに対応し、ONNX RuntimeによるCPU・GPU推論を提供します。 関連: HojoAI/Hojo-TTS-Light/軽量な音声合成エンジン/GitHub
2026年9月21日 · 1:55
Bert-VITS2 v2.3をAndroid向けに移植し、MNNを使って中国語・日本語・英語および中英混合入力の音声合成を端末上でオフライン実行するプロジェクトです。テキスト前処理、BERT埋め込み、VITS推論、音声再生を備えたデモアプリを提供し、推論機能はAARとして他のAndroidアプリへ組み込めます。 関連:…
2026年9月20日 · 2:13
FunSpeechは、音声認識ASRと音声合成TTSを提供するローカル・プライベート音声サービスです。FastAPI製のAPIゲートウェイと、FunASR、Dolphin、Qwen3-ASR、CosyVoice、Qwen3-TTSなどの独立GPU推論サービスで構成され、Aliyun/OpenAI互換のHTTP…
2026年9月19日 · 2:03
Hermes AgentにAllModels経由の音声合成TTSと音声認識STTを追加するプラグインです。音声ストリーミング、音声検索とプレビュー、モデルや音声の設定、アカウント登録、残高確認、チャージなどをHermesのCLIやTUI、デスクトップアプリから利用できます。 関連:…
2026年9月18日 · 2:00
AdaSpeechを基盤にした、単一話者向けの適応型テキスト音声合成TTSの非公式PyTorch実装です。FastSpeech 2に発話レベル・音素レベルの音響特徴エンコーダを追加し、テキストからメルスペクトログラムを生成します。前処理、学習、評価、推論、TorchScript出力やMelGAN・WaveGlowによる音声変換にも対応しています。 関連:…
2026年9月17日 · 2:14
MNNモデルをAndroid端末上で実行し、OpenAI API風のインターフェースで外部アプリから利用できるサーバーアプリです。テキスト生成、埋め込み、音声認識、オフライン音声合成に対応し、モデルのダウンロード・管理や外部ポート公開を提供します。 関連: sunshine0523/MNNServer/Androidで動くMNN AIサーバー/GitHub
2026年9月16日 · 1:59
VibeFrameは、文章のブリーフからストーリーボード、素材生成、シーン構成、ナレーション、レンダリングまでを行い、完成したMP4動画を作成するCLIおよびMCPサーバーです。Seedance、Runway、Veo、Klingなどの外部生成モデルをユーザー自身のAPIキーで利用し、ドライランと最大費用上限、構造化されたエラーやレビュー機能によってコーディ…
2026年9月15日 · 1:53
音声AI・音響機械学習を、波形処理からTransformer、ASR、音声分類、TTS、実運用パイプラインまで体系的に解説する学習ガイドです。Hugging FaceのデータセットやWhisper、Wav2Vec2、SpeechT5などを例に、データ準備、評価、ファインチューニング、モデル選択の考え方を説明しています。 関連:…
2026年9月14日 · 2:20
NekoSpeakは、Android向けの高性能なオフラインText-to-Speechエンジンです。Pocket-TTS、Piper、Kokoro、Kitten TTSなどのONNXモデルを端末上で実行し、音声クローニング、話者管理、システム全体のTTS連携、適応型ストリーミングを提供します。 関連:…
2026年9月13日 · 2:18
Twilioの電話回線と音声AIサービスを連携し、低遅延で割り込み可能なAI電話発信・応答システムを構築するリポジトリです。音声認識、LLMによる会話制御、音声合成、通話転送・終了、文字起こし表示をFastAPIとStreamlitで提供します。なお、Deepgram・ElevenLabs・OpenAIのAPI変更により、2025年時点ではコードが…
2026年9月12日 · 2:01
Bournemouth Forced Alignerは、音声ファイルと発話テキストを入力として、各音素・単語の発話位置をミリ秒単位で推定する多言語強制アライメントツールです。CUPEニューラルモデルとespeak-ngによる音素化を使い、JSON、Praat TextGrid、メルスペクトログラム向けフレームラベル、音素埋め込みを出力できます。 関連:…
2026年9月11日 · 2:25
ReadAwareは、EPUBやPDFなど多様な形式に対応したローカルファーストの電子書籍リーダーです。読書中のハイライト、メモ、会話をもとに記憶を構築する単一AIエージェントと、機能を拡張できるサンドボックス型プラグインシステムを備えています。 関連: ahpxex/read-aware/AI搭載電子書籍リーダー/GitHub
2026年9月10日 · 2:13
日本語または英語の音声・動画を認識、翻訳し、中国語の字幕や音声へ変換するローカル向けダビングツールです。原音を保持したまま、ASR、翻訳、音声合成、混音を段階的に実行でき、字幕やタイミングを手動校正できます。 関連: EveningStudy/asmr-dubber/音声動画を中国語に吹き替え/GitHub
2026年9月9日 · 2:29
pyVideoTransは、動画や音声の音声認識、字幕生成・翻訳、AI音声合成、吹き替え、音声と映像の同期までを一括して行うオープンソースの動画翻訳ツールです。ローカルモデルと各種オンラインAPIに対応し、GUI、CLI、WebUI、Dockerによる実行環境を提供します。 関連:…
2026年9月8日 · 2:11
Google AI StudioのWebプロトコルを変換し、OpenAI Chat Completions・Responses、Anthropic Messages、Gemini GenerateContent互換のAPIとして提供する高性能プロキシサービスです。複数Googleアカウントのローテーション、ストリーミング、画像・動画・音声生成、Google…
2026年9月7日 · 2:14
TalkWithMeは、ローカルで動作するllama.cppサーバーと接続して利用する、単一ユーザー向けのチャットWebアプリケーションです。複数のAIペルソナによるグループチャット、チャットルーム、会話履歴保存、任意のTTS・STT・MCPツール連携に対応しています。 関連: scorbo2/TalkWithMe/ローカルAIグループチャット/GitHub
2026年9月6日 · 2:28
MOSS-TTS Familyは、音声合成・音声クローニング・多話者対話・リアルタイム音声生成・音声設計・環境音生成を扱うオープンソースAIモデル群です。PyTorchベースの推論に加え、llama.cppとONNX Runtimeを利用したTorch不要の軽量推論や、SGLang-Omni・vLLM-Omniによる高速配信にも対応しています。 関連:…
2026年9月5日 · 2:10
MSMC-TTSは、マルチステージ・マルチコードブックVQによる高品質なニューラル音声合成システムの実装です。MSMC-VQ-GANベースのオートエンコーダーで音声表現を学習し、マルチステージ予測器でテキストから音声を合成できます。CSMSCなどの中国語データセットを用いた学習、マルチGPU学習、推論に対応しています。 関連:…
2026年9月4日 · 2:20
DetailTTSは、テキストと参照音声から話者性を保った音声を生成するゼロショット音声合成システムです。VITS系のVQVAEと音声トークナイザーを組み合わせ、英語・中国語・日本語・韓国語に対応し、学習・推論・ファインチューニングを提供します。 関連: adelacvg/ttts/ゼロショット音声合成AI/GitHub
2026年9月3日 · 2:07
JAMは、歌詞から楽曲を生成する530MパラメータのRectified Flowベース音楽生成モデルです。単語・音素レベルのタイミングや発音 duration、全体の曲長、音声またはテキストによるスタイルを細かく制御でき、推論だけでなく事前学習、教師ありファインチューニング、DPOによる学習にも対応しています。
2026年9月2日 · 2:33
Movie Narratorは、映画情報や映像素材を入力として、LLMで映画 recap(あらすじ紹介)台本を生成し、音声ナレーション、字幕、BGM、映像編集を組み合わせた完成動画を自動生成するPython製ツールキットです。CLIを中心に、16段階のパイプライン、複数候補の比較、参照動画のスタイル模倣、多言語字幕、QA、非同期タスク処理、REST…
2026年9月1日 · 2:14
OpenGuiderは、ユーザーのPC上で実際のUI操作を支援するElectron製のデスクトップAIアシスタントです。チャット、タスク計画・再計画、スクリーンショット解析、座標付きポインター案内、音声入出力、セッション履歴、プラグインおよびブラウザ自動化機能を提供します。複数のLLMプロバイダーやローカルモデルにも対応しています。
2026年8月31日 · 2:08
CC-Beeperは、Claude Codeの実行状況をデスクトップ上に表示するネイティブmacOS向けフローティングページャーです。ローカルHTTPフックで複数セッションを監視し、完了・エラー・権限要求・入力待ちなどの状態表示、権限の自動承認モード、グローバルホットキー、音声入力・読み上げを提供します。
2026年8月30日 · 3:03
wsayは、macOSの「say」に相当するWindows向けのコマンドライン音声合成ツールです。Windows Speech APIを利用してテキストを音声再生し、WAVファイル出力、音声・再生デバイス選択、クリップボード・ファイル・パイプ入力、Speech…
2026年8月29日 · 2:39
Amazon PollyおよびGoogle Cloud WaveNetを利用して、入力したテキストをTwitchなどの配信用音声として読み上げるWebアプリケーションです。React/Gatsby製のフロントエンドで音声・テーマを選択でき、Node.js/Express製のバックエンドがTTS生成、レート制限、ボット対策、利用統計、アクセスログを提供します。
2026年8月28日 · 2:56
audio.cppは、ggmlを基盤とした高性能なネイティブC++音声推論フレームワークです。TTS、音声クローニング、音声変換、ASR、話者 diarization、VAD、音源分離、音楽生成など多数の音声モデルを、CLI・HTTPサーバー・組み込みWebUI・JSONパイプラインからローカル実行できます。複数モデルに共通のランタイムを提供し、CUDAを…
2026年8月27日 · 2:53
OpenReelsは、入力したトピックから、リサーチ、台本作成、音声合成、AI画像・動画・音楽生成、字幕付与、シーン遷移、品質評価までを自動実行し、YouTube Shorts・TikTok・Instagram向けの縦型MP4動画を生成するオープンソースAIパイプラインです。CLIに加えて、リアルタイム進捗表示付きのWeb UI、REST…
2026年8月26日 · 2:42
AivisSpeech Engineは、VOICEVOX ENGINEをベースに開発された日本語音声合成エンジンです。AIVMX形式のStyle-Bert-VITS2系モデルをONNX Runtimeで推論し、VOICEVOX互換のHTTP APIを通じて感情豊かな音声を生成します。
2026年8月25日 · 3:12
GhostCut(国際版ブランド名:Weydub)は、AIを活用した動画・画像のローカライズおよび編集サービスです。OCRによる動画内文字・字幕の除去と翻訳、ASR/TTSによる音声翻訳・吹き替え、動画のリメイク・重複回避、画像翻訳などを提供し、これらの機能をAPI経由で組み合わせて利用できます。リポジトリには主にAPI呼び出し用のPythonサンプルコー…
2026年8月24日 · 2:31
SumatraPDFをベースにした非公式のWindows向け文書ビューア「Sumatra PDF Plus」です。PDF、EPUB、MOBI、DjVu、CBZ/CBRなどを閲覧でき、中国語電子書籍向けの表示改善、オフライン辞書、テーマ切り替え、スマートPDFダークモード、ローカルOCR、TTS朗読などを追加しています。
2026年8月23日 · 2:58
SRT字幕と参考音声をもとに、暖色系の紙背景を使った白板手描きアニメーション動画を制作するためのツールです。字幕解析、分鏡・配图策略の作成、画像領域の注釈編集、流れる筆跡によるMP4レンダリング、複数シーンの結合に対応しています。また、実際のナレーション時間に同期する動的インフォグラフィック制作機能も備えています。
2026年8月22日 · 2:29
Home AssistantのLovelaceダッシュボード向けカスタム通知カード「AlertTicker Card」です。エンティティ状態・属性・テンプレート・デバイスクラスなどを条件に複数のアラートを表示し、豊富なテーマ、アニメーション、TTS、プッシュ通知、グローバルオーバーレイ、カメラ表示、音楽プレーヤー、天気予報、履歴・スヌーズ機能を提供します。…
2026年8月21日 · 3:07
StreamCoreは、AI音声エージェント向けのリアルタイムメディア基盤です。WebRTC/WHIPによる音声通信、NAT traversal、VAD、ターンテイキング、割り込み(barge-in)、セッション管理、ストリーミングSTT・LLM・TTS連携を提供し、エージェントのプロンプトや業務ロジックは外部アプリケーションに委ねます。ブラウザ、モバイル…
2026年8月20日 · 3:12
KKClawは、OpenClawおよびHermes Agentに対応したElectron製のデスクトップAIペットアプリです。流体ガラス球体のアバター、14種類の感情表現、音声合成・音声クローン、字幕、Gateway監視、モデル切り替え、セットアップウィザードなどを提供し、AIに視覚・聴覚的なデスクトップ上の身体性を与えます。
2026年8月19日 · 2:58
floe-guardは、AIエージェントのLLM、音声処理、ツール呼び出しなどの支出をローカルで計測し、設定したUSD予算を超える次の呼び出しを事前にブロックする予算ゲートライブラリです。PythonとTypeScriptに対応し、OpenAI、Anthropic、Gemini、LangChain、LangGraph、CrewAI、LiteLLM、Verc…
2026年8月18日 · 2:58
BlahSTは、Linux上の任意の編集可能なテキストフィールドへ、キーボードショートカットで音声入力できる軽量な音声認識ツールです。whisper.cppまたはwhisperfileによるオフライン・ネットワーク音声認識に加え、多言語翻訳、連続ディクテーション、ローカルLLMとの音声チャット、校正・翻訳、Piperによる音声出力などを提供します。
2026年8月17日 · 3:18
ZhTTSは、中国語テキストをCPU上でリアルタイムに音声合成するTTSデモです。BakerProcessorによる中国語テキスト正規化・ピンイン変換の後、FastSpeech2またはTacotron2でメルスペクトログラムを生成し、MB-MelGANで24kHzのWAV音声へ変換します。Python…
2026年8月16日 · 2:32
AI音声生成・Text-to-Speech(TTS)に関するリソースを体系的にまとめたAwesome Listです。商用クラウドAPI、オープンソースTTSモデル、音声クローニング、研究論文、サンプル、チュートリアルなどを紹介し、用途や特徴、関連リンクを整理しています。実行可能なTTSアプリケーション本体ではなく、情報収集・比較のためのカタログです。
2026年8月15日 · 3:16
Voice Studio by MSRは、複数のオープンソースTTSモデルをローカルで切り替えて利用できるオフラインWebアプリケーションです。ポッドキャスト編集、テキスト読み上げ、Whisperによる音声文字起こし・字幕出力、音声の吹き替え、翻訳、音声クローン、キャッシュ管理などを提供します。
2026年8月14日 · 2:40
Kokoro Webは、ブラウザ上でKokoro音声合成モデルを実行し、入力したテキストを自然な音声へ変換するWebアプリケーションです。音声の選択、再生速度の調整、ストリーミング生成、チャンク単位の再生、一時停止、生成音声のWAVダウンロードに対応しています。WebGPUまたはWASMを利用して推論をクライアント側で実行します。
2026年8月13日 · 2:57
SGLang-Omniは、マルチモーダル、音声、音声合成(TTS)モデル向けのマルチステージ推論・サービングランタイムです。前処理、エンコーダ、自己回帰生成、デコーダ、ボコーダなどを分離して管理し、共有メモリ・NCCL・NIXL・Mooncakeによるステージ間通信と、OpenAI互換APIを提供します。音声生成・ストリーミング・音声認識・話者分離・画像や…
2026年8月12日 · 2:30
Eleven Labs APIを利用して、テキストを音声に変換するNode.js向けパッケージです。音声ファイルへの保存や音声ストリームの取得に加え、音声・モデル・ユーザー情報の取得、音声設定の編集や音声削除などのAPI操作を提供します。
2026年8月11日 · 3:00
Learn2Sing 2.0は、歌唱データを持たない対象話者向けに、歌唱教師のデータから高品質な歌声を合成する音声合成研究の公式実装およびデモページです。拡散モデルによる音響特徴復元と相互情報量制約による話者・歌唱スタイル表現の分離を利用し、学習・推論用スクリプトと生成音声のブラウザ再生デモを提供します。
2026年8月10日 · 2:25
EfficientSpeechは、組み込み機器やCPU上で高速に動作する軽量なニューラル音声合成(TTS)モデルです。テキストを音素列へ変換し、ピラミッド型Transformer/U-Net風のモデルでメルスペクトログラムを生成した後、HiFi-GANボコーダーで音声波形を合成します。学習、推論、WAV出力、ONNXおよびTorchScriptへの変換、L…
2026年8月9日 · 2:44
tts-audiobook-toolは、EPUBやテキストファイルから高品質なオーディオブックを生成する生成AIベースのテキスト音声合成ツールです。複数のTTSモデル、音声クローン、音声認識による生成結果の検証・再試行、音声編集・連結・音量正規化、M4B/FLAC出力に対応しています。生成音声と単語単位のタイミング情報を利用した、同期ハイライト付きの静的ブ…
2026年8月8日 · 2:48
Mix Spaceは、個人ブログやクリエイター向けWebサイトのためのAI対応ヘッドレスCMSスタックを構築するモノレポです。NestJS製コアサーバー、React製管理画面、iOSクライアント、APNsプッシュ通知リレー、テレメトリ収集基盤、および各種共有SDK・CLI・エディタ関連パッケージを提供します。
2026年8月7日 · 2:21
事前学習済みのTTSモデルを利用し、わずか1分程度の音声サンプルで話者適応を行う実験プロジェクトです。約10分のファインチューニングで、Nick Offerman、Kate Winslet、Modern Family出演者などの声を再現する結果を紹介しています。モデルの詳細や実装、事前学習済みモデルは関連リポジトリのDCTTSで提供されています。
2026年8月6日 · 2:59
DurIAN(Duration Informed Attention Network)の実装で、音素ごとの継続時間・アライメント情報を利用したテキスト音声合成(TTS)モデルを提供します。バックボーン音声合成モデルと継続時間予測モデルを同時学習でき、LJSpeechデータセット向けの学習、検証、チェックポイント保存、推論をサポートします。独自データをMon…
2026年8月5日 · 2:38
Resembleの音声生成APIとUnityを連携させるためのUnityプラグインです。生成音声や音素・タイミング情報をUnity内で扱い、音素テーブルを利用したシェーダー制御やBlendShapeによるキャラクターのリップシンクを実現します。サンプルシーンや音声アセットも含まれています。
2026年8月4日 · 2:47
Guided Attentionを用いた深層畳み込みネットワークベースのText-to-Speech(TTS)システムをPyTorchで実装しています。テキストからメルスペクトログラムを生成するText2Melモデルと、メルスペクトログラムから線形スペクトログラムを高解像度化するSSRNモデルの学習・音声合成・データ前処理に対応し、英語(LJ…
2026年8月3日 · 2:31
NobodyWhoは、llama.cppを基盤としてGGUF形式の大規模言語モデルを端末上でオフライン推論するRust製の推論エンジンです。ストリーミングチャット、会話コンテキスト管理、文法ベースのツール呼び出し、埋め込み・再ランキング、画像・音声入力、音声合成およびモデルダウンロードを提供し、Kotlin、Swift、Python、Flutter、Rea…
2026年8月2日 · 3:06
ComfyUI上でVoxCPM2を利用した多言語Text-to-Speech機能を提供するカスタムノードです。音声デザイン、参照音声による可 controllable/ultimate voice cloning、48kHz音声出力、LoRAの読み込みとComfyUI内でのLoRA学習に対応しています。ASRによる参照音声の自動文字起こし、ノイズ除去、モデ…
2026年8月1日 · 2:40
音声基盤モデルの評価を統合的に行うためのオープンソース・フレームワークです。音声理解(ASR/AST/感情認識など)、音声生成(Speech-to-Speech/TTS)、音声コーデック評価を含む複数ベンチマークをまとめ、データセット管理、評価指標の実行、再現実験、断点再開や並列実行まで支援します。
2026年7月31日 · 2:44
EVAは、会話型音声エージェントをエンドツーエンドで評価するためのオープンソースフレームワークです。音声入力から会話の完了度(Accuracy)と対話体験(Experience)を自動採点し、ボット同士の音声対話、ツール実行、検証、メトリクス集計までを一連で行います。航空・医療HR・ITSMなどの企業向けシナリオデータセットや、ノイズ・アクセント・回線劣化…
2026年7月30日 · 2:26
ZAI/GLMのTTS(音声合成)APIを提供するプロキシ/ラッパー系のリポジトリです。Docker、CLI、Home Assistant連携を通じて、智谱TTSの内蔵音色やクローン音色を使った音声合成をローカル環境から利用できるようにしています。
2026年7月29日 · 2:52
TelnyxのAI向け開発支援リポジトリで、AIエージェントやAI-first開発者がTelnyx APIを使いやすくするためのツール群をまとめています。主な内容は、Python/TypeScriptのAgent Toolkit、エージェント向けCLI、Claude…
2026年7月28日 · 2:10
Meta-StyleSpeech / StyleSpeech の PyTorch 実装で、マルチスピーカー対応のテキスト音声合成(TTS)を学習・推論するためのリポジトリです。LibriTTS などのデータセットを前処理し、メタ学習を含む学習、単文・バッチ推論、TensorBoard での可視化を行えます。
2026年7月27日 · 2:37
LocalText2Voice は、長文テキストを AI 音声で読み上げて MP3 のオーディオブックやポッドキャスト風音声を作成するデスクトップアプリです。Piper などのローカル TTS エンジンを中心に、必要に応じて OpenAI / ElevenLabs / Gemini / Azure などのクラウド API…
2026年7月27日 · 2:32
NachoBot は、長時記憶・多模態認識を備えた多プラットフォーム向けの AI 虚拟生命/チャットボット基盤です。Bilibili、Discord、QQ(NapCat)などに対応し、LLM、ASR/VLM、本地TTS、Live2D連携、メッセージ仲介や予約通知などを統合して動作します。
2026年7月25日 · 2:33
Sokuji は、会議や通話中の音声をリアルタイムで双方向翻訳するためのアプリです。Electron デスクトップアプリと Chrome/Edge ブラウザ拡張の両方を提供し、クラウドAPI(OpenAI、Gemini など)と、WASM/WebGPU を使った完全オフラインのローカル推論の両方に対応しています。
2026年7月24日 · 2:34
ReadAny は、デスクトップとモバイル向けのローカルファーストなAI電子書籍リーダーです。RAGチャット、意味検索、ハイライト、TTS、WebDAV同期などを備え、書籍をオフライン中心で管理しながらAIで質問・要約・検索できることを目的としています。
2026年7月23日 · 2:10
OpenLiveは、AIエージェント向けの音声・視覚レイヤーを提供するデスクトップアプリです。ローカル環境で音声入力、音声認識、会話の切り替え、音声合成、カメラ/画面共有、バージインを統合し、Claude CodeやCodexなどのコーディングエージェントとも連携できます。
2026年7月22日 · 2:26
Android向けの画面リアルタイム翻訳アプリです。MediaProjectionやShizukuでスクリーンショットを取得し、端末内/ローカルHTTP/クラウドのOCRで文字認識した後、LLMや機械翻訳で翻訳し、結果を画面上に重ね表示したり音声読み上げしたりできます。ゲーム、漫画、ビジュアルノベルのような画面上テキストの翻訳に特化しています。
2026年7月21日 · 2:31
Transformers、Diffusers、Sentence Transformers、timm と OpenVINO をつなぐ Intel 向け最適化ライブラリです。モデルを OpenVINO IR へ変換し、推論や量子化(INT8/INT4 など)を通じて Intel CPU/GPU/専用アクセラレータ上で高速化することを目的としています。
2026年7月20日 · 2:21
audio.cpp は、ggml 上に構築された高性能な C++ ベースの音声推論フレームワークです。TTS、ASR、音声変換、話者分離、VAD、音楽生成などを共通ランタイムで扱い、CLI・サーバー・WebUI からローカル実行できるようにしています。
2026年7月19日 · 2:11
このリポジトリは、1つのテーマからVox風の紙コラージュ解説・広告動画を自動生成する「agent skill」です。脚本作成、コラージュのキーフレーム生成、モーション付与、音声合成、BGM、字幕焼き込み、ffmpegによる最終合成までをAtlas Cloud APIとローカル環境で一気通貫に実行します。
2026年7月18日 · 2:30
Nanospeechは、PyTorchとMLXで実装されたシンプルで改造しやすいテキスト読み上げ(TTS)システムです。参照音声サンプルから話者の声を合わせる機能を持ち、事前学習済みの英語モデル、CLI、Gradioデモ、学習用スクリプトを備えています。
2026年7月17日 · 2:13
AutoShortsは、長尺のゲームプレイ動画からAIで見どころシーンを抽出し、縦型のショート動画として自動生成するツールです。字幕生成、AI音声ナレーション、GPU加速レンダリング、複数のAIプロバイダ(OpenAI/Gemini/ローカル)対応を備え、TikTok/YouTube Shorts/Reels向けの投稿用クリップを作成します。
2026年7月16日 · 2:27
このリポジトリは、LLMとTTSを組み合わせて有声書・有声ストーリーをブラウザ上で制作するためのWebツールです。脚本の自動分解、感情推定、多角色音声合成、SFX/BGMの自動編成、音声フィルタの挿入、さらに背景画像付きMP4動画の生成までを一括で行えることを目的としています。
2026年7月15日 · 2:30
右下角に常駐するAI虚擬人ウィジェットを、1行の で任意のWebサイトへ埋め込むためのデモ兼実装リポジトリです。Live2D/VRMのキャラクター表示、音声入力(STT)、音声出力(TTS)、口パク、知識ベース検索、任意のWebLLM連携、サイト側API連携をブラウザ中心で提供します。基本は純フロントエンドで動作し、必要に応じてVercelのserverl…
2026年7月14日 · 2:29
Googleの論文「Parallel Tacotron 2」をPyTorchで実装した音声合成(TTS)リポジトリです。テキストからメルスペクトログラムを生成する非自己回帰モデルの学習・評価・推論、データ前処理、TensorBoardログ出力、HiFi-GANなどのボコーダ連携を提供しています。
2026年7月13日 · 2:15
Wyomingプロトコル向けのOpenAI互換プロキシミドルウェアです。Home AssistantなどのWyomingクライアントから、OpenAI互換の音声認識(STT/ASR)と音声合成(TTS)サービスを利用できるようにし、OpenAI公式APIだけでなくSpeaches、LocalAI、Kokoro、Mistral Voxtral、Edge…
2026年7月12日 · 2:18
OrkasVideoStudio は、coding agent から自然言語で動画の合成・編集・生成を指示できる、エージェント向け動画制作ツールキットです。可読で差分可能な `plan.json` を中核に、Compose / Edit / Generate / Auto の4つの制作ラインを CLI と MCP…
2026年7月11日 · 2:31
PDFやEPUB、TXT、HTMLファイルを読み込み、テキスト抽出・整形を行ったうえで、Kokoro TTSを使ってオーディオブック化するGUIアプリです。PDFはTOCやヒューリスティック、スキャンPDFのOCRにも対応し、EPUBは内部構造やTOCを解析して章単位で抽出できます。
2026年7月10日 · 2:10
このリポジトリは、ユーザーが入力したテーマからAIで口述文案を生成し、Pexels/Pixabayの動画素材や音声と組み合わせて短尺の音声付き動画を作成するためのデスクトップアプリです。READMEでは「一句話で专业爆款短视频を生成」と説明されており、設定ファイルを編集して実行する形の動画生成ツールとして提供されています。
2026年7月9日 · 2:06
GGMLベースでTortoise-TTSをC++へ移植した音声合成(TTS)プロジェクトです。CPU/CUDA/一部Metalで動作し、モデルファイルと話者ボイスファイルを読み込んで、コマンドラインから音声を生成します。README上では、音声プロンプトの文字種制限やボイス追加方法も案内されています。
2026年7月8日 · 2:27
PyTorchで実装された、話者条件付きLayer Normalizationと半教師あり学習を用いるクロススピーカー感情転送TTS(Text-to-Speech)モデルのリポジトリです。学習・推論・評価・前処理の一連の処理に対応しており、RAVDESSなどの感情音声データセットを使って、話者と感情を制御した音声合成を行います。
2026年7月8日 · 2:39
CosyVoice2-Ex は、CosyVoice2 を拡張した音声合成(TTS)向けの WebUI/API リポジトリです。事前学習音色の利用、3秒程度の高速音色クローン、自然言語による発話制御、自動音声認識、音色保存、API 提供を行い、Windows / Linux / macOS での利用を想定しています。
2026年7月8日 · 2:14
MioTTSという軽量・高速なTTSモデルの推論用リポジトリで、OpenAI互換APIを持つLLM推論基盤(llama.cpp、Ollama、vLLMなど)をバックエンドとして音声合成を行います。REST APIと簡易WebUIを提供し、参照音声プリセットの登録やBest-of-Nによる品質選択にも対応しています。
2026年7月6日 · 1:52
Home Assistant向けのカスタムTTS統合で、OpenAIの音声合成APIおよびOpenAI互換バックエンドを使ってテキストを音声再生します。複数のTTSプロファイル、音声・モデル・音声形式の選択、ジングル追加、音量正規化、再生前後の音量復元や一時停止/再開など、アナウンス用途の機能が中心です。
2026年7月5日 · 2:00
SyntaSpeechは、IJCAI 2022論文の公式PyTorch実装で、語法情報を取り入れた非自回帰Text-to-Speech(TTS)システムです。句法グラフの構築・エンコードと、多長度の敵対的学習を用いて、韻律や音質を改善しつつ推論を高速化することを目的としています。LJSpeech、Biaobei、LibriTTSに対応し、学習・推論・データ…
2026年7月4日 · 1:49
TacotronのPyTorch実装で、テキストから音声波形を生成するTTS(Text-to-Speech)モデルを学習・推論するためのリポジトリです。LJSpeechデータセットを前提に、テキスト前処理、メル/線形スペクトログラム生成、Tacotron本体の学習、チェックポイント保存、音声合成までを一通り提供しています。
2026年7月3日 · 2:18
DramaClaw は、脚本の取り込みからキャラクター抽出、エピソード設計、台本生成、絵コンテ・初稿画像生成、音声合成、動画編集・書き出しまでを一気通貫で行う、短編ドラマ制作向けのソース公開型パイプラインです。個人クリエイターや小規模スタジオが、自前の環境で“ドラマ工場”を運用できることを目的としており、Freezone(無限キャンバス)やディレクター支援…
2026年7月2日 · 2:07
このリポジトリは、Coqui TTSを使ってペルシア語(Farsi)のテキスト読み上げモデルを学習・微調整・テストするためのサンプルコード集です。GlowTTS、VITS、マルチスピーカーVITSの学習ノートブックや推論例、事前学習済みモデルへのリンクが含まれています。
2026年7月1日 · 2:10
Unreal Engine向けのプラグイン「AzSpeech」で、Microsoft Azure Speech Cognitive Services を統合し、音声認識(Speech-to-Text)と音声合成(Text-to-Speech/SSML)を非同期タスクとして利用できるようにします。さらに、エディタ上で音声データをUSoundWaveとして生成…
2026年6月30日 · 2:09
MelNetという、音声を周波数領域のメルスペクトログラムとして生成する深層生成モデルの実装です。学習用のトレーナーと、チェックポイントから音声をサンプリングしてスペクトログラム・波形・WAVを出力する推論スクリプトが含まれています。KSSやBlizzard、VoxCeleb2向けの設定が用意されており、条件付きTTS生成にも対応しています。
2026年6月29日 · 2:00
Home Assistant向けのカスタムコンポーネント集で、BluetoothスピーカーへTTS(音声合成)を再生するメディアプレーヤーを提供します。さらに、Bluetooth存在検知(device_tracker)と音声再生が同時にBluetoothを奪い合って音切れする問題を避けるため、Bluetoothトラッカーを一時停止・再開できる仕組みも含まれ…
2026年6月28日 · 1:55
このリポジトリは、LLM、音声変換(so-vits-svc/TTS)、Stable Diffusion、プロンプトエンジニアリングなどのAI関連モデル・アプリ・データセット・参考資料を集約したリンク集です。各分野ごとに代表的なサービス、GitHub、論文、Hugging…
2026年6月27日 · 2:13
Raspberry Pi Zero 2W / Pi 5 向けのポケットサイズAIチャットボット端末を構築するリポジトリです。ボタン押下で音声入力し、ASR・LLM・TTSを使って応答するほか、LCD表示、RGB LED、ウェイクワード、画像生成、RAG、プラグイン拡張などに対応しています。
2026年6月26日 · 2:11
TensorVoxは、Windowsデスクトップ向けの軽量なニューラル音声合成(TTS)アプリです。複数のAI音声モデルを読み込み、テキストから音声を生成したり、バッチで音声をデノイズ/リサンプルしたりできます。
2026年6月25日 · 2:04
Vox Box は、OpenAI API 互換の音声認識(speech-to-text)/音声合成(text-to-speech)サーバーです。Whisper、FunASR、Bark、Dia、CosyVoice などのバックエンドモデルを切り替えて利用でき、/v1/audio/speech、/v1/audio/transcriptions、/v1/mode…
2026年6月24日 · 2:05
CoMoSpeechという、テキストから音声・歌声を生成するための拡散モデル/Consistency Modelベースの音声合成リポジトリです。1ステップ生成による高速推論を目指しており、教師モデルの蒸留による学生モデル学習、推論、LJSpeechを用いた学習コードが含まれています。HiFi-GAN вокoder…
2026年6月23日 · 1:45
Arduino向けのText-to-Speech(TTS)ライブラリです。英語の語彙・音素変換ルールと音声データをPROGMEMに保持し、PWMやDAC出力を使ってArduino系ボード上で音声合成を行います。