模型家族

六個開源權重,同一套設計語言。點卡片看完整說明。

5 筆結果

VibeVoice-TTS · 1.5B

長語音多語者合成:單次最長 90 分鐘、最多 4 位語者,音色維持一致。

1.5B90 分鐘4 位語者EN / ZH

VibeVoice-ASR · 7B

長音訊辨識:單次 60 分鐘,輸出「誰、何時、說了什麼」——語者、時間戳與內容。

7B60 分鐘50+ 種語言64K

VibeVoice-Realtime · 0.5B

輕量即時串流:首字延遲約 300 毫秒,支援串流文字輸入,可穩定生成約 10 分鐘。

0.5B~300 ms串流多語

VibeVoice-ASR-Streaming · 1.5B / 7B

音訊還在進來時就邊聽邊轉寫「誰說了什麼」,約每 2.9 秒吐出一段文字。

1.5B / 7B串流10 種語言2026 / 09

VibeVoice-ASR-BitNet · CPU

把 ASR 模型從 4.62 GB 壓到 1.58 GB——幾條 CPU 執行緒就跑得比即時還快,不需要 GPU。

1.58 GB純 CPURTF < 12026 / 07