KittenTTS 😻
KittenTTS は、KittenML によって開発されたオープンソースの最先端テキスト読み上げ(TTS)モデルです。わずか1500万パラメータと25MB未満のモデルサイズで高品質な音声合成を実現しており、プロダクションレディなTTSシステムとしては最も軽量な部類に入ります。
🌟 主な特徴
- 超軽量: モデル全体が25MB未満で、エンタープライズソフトウェアのほとんどのアプリアイコンよりも小さいです。
- CPU最適化: GPUは不要です。エッジハードウェアやモバイルを含むあらゆるデバイスで効率的に動作します。
- 高品質な音声: 男性・女性の複数のプレミアムボイスオプションをサポートしています。
- 高速推論: リアルタイム音声生成のために最適化されています。
- シンプルなAPI: インストール、モデルのロード、音声生成など、開始に必要なコードは最小限です。
🚀 クイックスタート
インストール
pip install https://github.com/KittenML/KittenTTS/releases/download/0.1/kittentts-0.1.0-py3-none-any.whl
基本的な使い方
from kittentts import KittenTTS
m = KittenTTS("KittenML/kitten-tts-nano-0.2")
audio = m.generate(
"This high quality TTS model works without a GPU",
voice='expr-voice-2-f'
)
# 音声を保存
import soundfile as sf
sf.write('output.wav', audio, 24000)
利用可能なボイス
| ボイスID | 性別 |
|---|---|
| expr-voice-2-m | 男性 |
| expr-voice-2-f | 女性 |
| expr-voice-3-m | 男性 |
| expr-voice-3-f | 女性 |
| expr-voice-4-m | 男性 |
| expr-voice-4-f | 女性 |
| expr-voice-5-m | 男性 |
| expr-voice-5-f | 女性 |
🛠 システム要件
GPUに依存せず、Windows、macOS、Linuxなど、ほぼすべてのプラットフォームで動作します。
📋 ロードマップ
- [x] プレビューモデルのリリース
- [ ] 完全学習済みモデルウェイトのリリース
- [ ] モバイルSDKのリリース
- [ ] Web版のリリース
📊 プロジェクト統計
| メトリック | 値 |
|---|---|
| 言語 | Python |
| ライセンス | Apache-2.0 |
🔗 リンク
📄 ライセンス
Apache 2.0 License の下でライセンスされています。