KittenTTS 😻
KittenTTS는 KittenML에서 개발한 오픈 소스 최신 텍스트 음성 변환(TTS) 모델입니다. 1,500만 개의 매개변수와 25MB 미만의 모델 크기로 고품질 음성 합성을 달성하여, 현재 사용 가능한 가장 가벼운 프로덕션 레디 TTS 시스템 중 하나입니다.
🌟 주요 기능
- 초경량: 전체 모델 크기가 25MB 미만으로, 엔터프라이즈 소프트웨어의 대부분 앱 아이콘보다 작습니다.
- CPU 최적화: GPU가 필요 없습니다. 엣지 하드웨어 및 모바일을 포함한 모든 장치에서 효율적으로 실행됩니다.
- 고품질 음성: 남성 및 여성 음성 옵션을 포함한 여러 프리미엄 음성을 지원합니다.
- 빠른 추론: 실시간 음성 생성을 위해 최적화되었습니다.
- 간단한 API: 설치, 모델 로드, 오디오 생성 등 시작하는 데 최소한의 코드가 필요합니다.
🚀 빠른 시작
설치
pip install https://github.com/KittenML/KittenTTS/releases/download/0.1/kittentts-0.1.0-py3-none-any.whl
기본 사용법
from kittentts import KittenTTS
m = KittenTTS("KittenML/kitten-tts-nano-0.2")
audio = m.generate(
"This high quality TTS model works without a GPU",
voice='expr-voice-2-f'
)
# 오디오 저장
import soundfile as sf
sf.write('output.wav', audio, 24000)
사용 가능한 음성
| 음성 ID | 성별 |
|---|---|
| expr-voice-2-m | 남성 |
| expr-voice-2-f | 여성 |
| expr-voice-3-m | 남성 |
| expr-voice-3-f | 여성 |
| expr-voice-4-m | 남성 |
| expr-voice-4-f | 여성 |
| expr-voice-5-m | 남성 |
| expr-voice-5-f | 여성 |
🛠 시스템 요구 사항
GPU 종속성 없이 Windows, macOS, Linux 등 거의 모든 플랫폼에서 작동합니다.
📋 로드맵
- [x] 미리보기 모델 출시
- [ ] 완전 학습된 모델 가중치 출시
- [ ] 모바일 SDK 출시
- [ ] 웹 버전 출시
📊 프로젝트 통계
| 지표 | 값 |
|---|---|
| 언어 | Python |
| 라이선스 | Apache-2.0 |
🔗 링크
📄 라이선스
Apache 2.0 라이선스에 따라 라이선스가 부여됩니다.