KittenTTS 😻
KittenTTS 是由 KittenML 开发的一款开源、最先进的文本转语音(TTS)模型。它仅用 1500 万个参数 和 低于 25MB 的模型大小即可实现高质量的语音合成,使其成为市面上最轻量级的可投入生产的 TTS 系统之一。
🌟 主要特点
- 超轻量级: 整个模型小于 25MB,比企业软件中的大多数应用程序图标还要小。
- CPU 优化: 无需 GPU。可在任何设备上高效运行,包括边缘硬件和移动设备。
- 高质量语音: 支持多种优质语音选项,涵盖男性和女性变体。
- 快速推理: 针对实时语音生成进行了优化。
- 简单 API: 入门所需代码极少 — 安装、加载模型、生成音频。
🚀 快速入门
安装
pip install https://github.com/KittenML/KittenTTS/releases/download/0.1/kittentts-0.1.0-py3-none-any.whl
基本用法
from kittentts import KittenTTS
m = KittenTTS("KittenML/kitten-tts-nano-0.2")
audio = m.generate(
"This high quality TTS model works without a GPU",
voice='expr-voice-2-f'
)
# 保存音频
import soundfile as sf
sf.write('output.wav', audio, 24000)
可用语音
| 语音 ID | 性别 |
|---|---|
| expr-voice-2-m | 男 |
| expr-voice-2-f | 女 |
| expr-voice-3-m | 男 |
| expr-voice-3-f | 女 |
| expr-voice-4-m | 男 |
| expr-voice-4-f | 女 |
| expr-voice-5-m | 男 |
| expr-voice-5-f | 女 |
🛠 系统要求
几乎可以在任何平台 — Windows、macOS、Linux — 上运行,无需 GPU 依赖。
📋 路线图
- [x] 发布预览模型
- [ ] 发布完全训练好的模型权重
- [ ] 发布移动 SDK
- [ ] 发布 Web 版本
📊 项目统计
| 指标 | 值 |
|---|---|
| 语言 | Python |
| 许可证 | Apache-2.0 |
🔗 链接
📄 许可证
根据 Apache 2.0 许可证 授权。