規格與數據
VibeVoice 的關鍵數字,以及涵蓋五個版本的完整規格表。
連續語音取樣率7.5 Hz
脈絡長度 (TTS/ASR)64 K token
音訊輸出取樣24 kHz
即時版首字延遲~300 毫秒
串流辨識輸出間隔~2.9 秒
邊緣版模型大小1.58 GB(CPU)
| 項目 | Realtime-0.5B | TTS-1.5B | ASR-7B | ASR-Streaming | ASR-BitNet |
|---|---|---|---|---|---|
| 參數量 | 0.5B | 1.5B | 7B | 1.5B / 7B | 1.58 GB |
| 最長輸出 | 約 10 分鐘 | 90 分鐘 | 60 分鐘 | 持續不限 | 60 分鐘 |
| 同時語者 | 1 | 最多 4 | —(辨識) | —(辨識) | —(辨識) |
| 脈絡長度 | 8K | 64K | 64K | 滾動視窗 | 64K |
| 主要語言 | 多語語音 | 英・中為主 | 50+ 語言 | 10 種語言 | 英・中等 |
| 首字延遲 | ~300 ms | — | — | 約 2.9 秒/段 | — |
| 硬體需求 | GPU | GPU | GPU | GPU | CPU(3 執行緒起) |
| 定位 | 即時串流 | 長語音合成 | 長音訊辨識 | 即時逐字稿 | 裝置端辨識 |