Specs & numbers

The headline figures behind VibeVoice, plus a full per-model spec table covering all five models.

Frame rate7.5 Hz
Context (TTS/ASR)64 K tokens
Audio output24 kHz
Realtime latency~300 ms
Streaming ASR chunk~2.9 s
Edge build size1.58 GB (CPU)
Tokens for 90 minutes of audio
Traditional 50–100 Hz: 135000135000Traditional 50–100 HzVibeVoice 7.5 Hz: 4050040500VibeVoice 7.5 Hz
Parameters by model (billions)
Realtime: 0.5TTS: 1.5Str-1.5B: 1.5Str-7B: 7ASR: 7RealtimeTTSStr-1.5BStr-7BASR
SpecRealtime-0.5BTTS-1.5BASR-7BASR-StreamingASR-BitNet
Parameters0.5B1.5B7B1.5B / 7B1.58 GB
Max output~10 min90 min60 mincontinuous60 min
Speakers1up to 4— (recognition)— (recognition)— (recognition)
Context8K64K64Krolling64K
LanguagesMultilingual voicesEN / ZH first50+ languages10 languagesEN / ZH +
First latency~300 ms~2.9 s / chunk
HardwareGPUGPUGPUGPUCPU (3+ threads)
RoleReal-time streamingLong-form synthesisLong-form recognitionLive transcriptionOn-device recognition