Specs & numbers
The headline figures behind VibeVoice, plus a full per-model spec table covering all five models.
Frame rate7.5 Hz
Context (TTS/ASR)64 K tokens
Audio output24 kHz
Realtime latency~300 ms
Streaming ASR chunk~2.9 s
Edge build size1.58 GB (CPU)
| Spec | Realtime-0.5B | TTS-1.5B | ASR-7B | ASR-Streaming | ASR-BitNet |
|---|---|---|---|---|---|
| Parameters | 0.5B | 1.5B | 7B | 1.5B / 7B | 1.58 GB |
| Max output | ~10 min | 90 min | 60 min | continuous | 60 min |
| Speakers | 1 | up to 4 | — (recognition) | — (recognition) | — (recognition) |
| Context | 8K | 64K | 64K | rolling | 64K |
| Languages | Multilingual voices | EN / ZH first | 50+ languages | 10 languages | EN / ZH + |
| First latency | ~300 ms | — | — | ~2.9 s / chunk | — |
| Hardware | GPU | GPU | GPU | GPU | CPU (3+ threads) |
| Role | Real-time streaming | Long-form synthesis | Long-form recognition | Live transcription | On-device recognition |