KittenTTS

わずか15Mのパラメータと25MB未満のサイズを持つオープンソースの超軽量TTSモデルで、GPUなしでCPU上で高品質な音声合成が可能です。

PythonApache-2.0TTS
⭐ GitHubhttps://github.com/KittenML/KittenTTS
15,234
スター数
+1,105
スター増加率
Jun 11, 2026
最終更新
1,914
クリック数

KittenTTS 😻

KittenTTS は、KittenML によって開発されたオープンソースの最先端テキスト読み上げ(TTS)モデルです。わずか1500万パラメータ25MB未満のモデルサイズで高品質な音声合成を実現しており、プロダクションレディなTTSシステムとしては最も軽量な部類に入ります。


🌟 主な特徴

  • 超軽量: モデル全体が25MB未満で、エンタープライズソフトウェアのほとんどのアプリアイコンよりも小さいです。
  • CPU最適化: GPUは不要です。エッジハードウェアやモバイルを含むあらゆるデバイスで効率的に動作します。
  • 高品質な音声: 男性・女性の複数のプレミアムボイスオプションをサポートしています。
  • 高速推論: リアルタイム音声生成のために最適化されています。
  • シンプルなAPI: インストール、モデルのロード、音声生成など、開始に必要なコードは最小限です。

🚀 クイックスタート

インストール

pip install https://github.com/KittenML/KittenTTS/releases/download/0.1/kittentts-0.1.0-py3-none-any.whl

基本的な使い方

from kittentts import KittenTTS

m = KittenTTS("KittenML/kitten-tts-nano-0.2")

audio = m.generate(
    "This high quality TTS model works without a GPU",
    voice='expr-voice-2-f'
)

# 音声を保存
import soundfile as sf
sf.write('output.wav', audio, 24000)

利用可能なボイス

ボイスID 性別
expr-voice-2-m 男性
expr-voice-2-f 女性
expr-voice-3-m 男性
expr-voice-3-f 女性
expr-voice-4-m 男性
expr-voice-4-f 女性
expr-voice-5-m 男性
expr-voice-5-f 女性

🛠 システム要件

GPUに依存せず、Windows、macOS、Linuxなど、ほぼすべてのプラットフォームで動作します。


📋 ロードマップ

  • [x] プレビューモデルのリリース
  • [ ] 完全学習済みモデルウェイトのリリース
  • [ ] モバイルSDKのリリース
  • [ ] Web版のリリース

📊 プロジェクト統計

メトリック
言語 Python
ライセンス Apache-2.0

🔗 リンク


📄 ライセンス

Apache 2.0 License の下でライセンスされています。