Model comparison
All five VibeVoice models side by side — pick the right one for the job.
Realtime-0.5B 0.5B real-time | TTS-1.5B 1.5B flagship | ASR-7B 7B recognition | ASR-Streaming 1.5B / 7B live transcript | ASR-BitNet 1.58 GB edge CPU | |
|---|---|---|---|---|---|
| Task | TTS (stream) | Text-to-Speech | Speech-to-Text | STT (stream) | Speech-to-Text |
| Max length | ~10 min | 90 min | 60 min | continuous | 60 min |
| Speakers | 1 | up to 4 | — | — | — |
| Context | 8K | 64K | 64K | rolling | 64K |
| Streaming text input | check | — | — | — | — |
| Low latency (~300 ms) | check | — | — | ~2.9 s chunk | — |
| Multi-speaker consistency | — | check | — | — | — |
| Timestamps + diarization | — | — | check | check | check |
| Runs without a GPU | — | — | — | — | check |
| Languages | Multi-voice | EN / ZH first | 50+ languages | 10 languages | EN / ZH + |
| Best for | Agent voice | Long podcasts | Transcription | Live captions | On-device |