KittenTTS 😻
KittenTTS 是一個由 KittenML 開發的開源、最先進的文字轉語音 (TTS) 模型。它僅用 1500 萬個參數和 不到 25MB 的模型大小即可實現高品質語音合成,使其成為市面上最輕量級的生產就緒 TTS 系統之一。
🌟 主要功能
- 超輕量級:整個模型不到 25MB,比企業軟體中的大多數應用程式圖示還要小。
- CPU 優化:無需 GPU。可在任何設備上高效運行,包括邊緣硬體和行動裝置。
- 高品質語音:支援多種優質語音選項,涵蓋男性和女性變體。
- 快速推理:針對即時語音生成進行了優化。
- 簡單的 API:入門只需極少的程式碼 — 安裝、載入模型、生成音訊。
🚀 快速入門
安裝
pip install https://github.com/KittenML/KittenTTS/releases/download/0.1/kittentts-0.1.0-py3-none-any.whl
基本用法
from kittentts import KittenTTS
m = KittenTTS("KittenML/kitten-tts-nano-0.2")
audio = m.generate(
"這個高品質的 TTS 模型無需 GPU 即可運行",
voice='expr-voice-2-f'
)
# 儲存音訊
import soundfile as sf
sf.write('output.wav', audio, 24000)
可用語音
| 語音 ID | 性別 |
|---|---|
| expr-voice-2-m | 男 |
| expr-voice-2-f | 女 |
| expr-voice-3-m | 男 |
| expr-voice-3-f | 女 |
| expr-voice-4-m | 男 |
| expr-voice-4-f | 女 |
| expr-voice-5-m | 男 |
| expr-voice-5-f | 女 |
🛠 系統需求
幾乎適用於任何平台 — Windows、macOS、Linux — 無需 GPU。
📋 開發路線圖
- [x] 發布預覽模型
- [ ] 發布完整訓練模型權重
- [ ] 發布行動 SDK
- [ ] 發布網頁版
📊 專案統計
| 指標 | 值 |
|---|---|
| 語言 | Python |
| 授權 | Apache-2.0 |
🔗 連結
📄 授權
根據 Apache 2.0 授權 授權。