開源長語音 AI 模型家族
VibeVoice 用 7.5 Hz 連續語音 tokenizer 與「next-token diffusion」架構,單次最長可生成 90 分鐘、最多 4 位語者的自然語音。目前六個開源權重涵蓋長語音合成、即時語音、長音訊與串流辨識,以及純 CPU 的邊緣推論。
模型家族
六個開源權重,同一套設計語言。點卡片看完整說明。
版本比較
VibeVoice 五個版本並列比較——依任務挑對的那一個。
技術架構
7.5 Hz tokenizer 加上 next-token diffusion:VibeVoice 如何把 90 分鐘音訊塞進 64K 脈絡——以及這套設計後來如何延伸到串流與純 CPU。
規格與數據
VibeVoice 的關鍵數字,以及涵蓋五個版本的完整規格表。
語音合成對比
VibeVoice 與常見及開源 TTS 模型的並列比較。屬概略、非窮盡的整理——各方強項依使用情境而異。
語音辨識對比
VibeVoice-ASR 與 FunASR、Whisper 的並列比較——開源語音辨識並排看。已納入串流版與 CPU 版。
即時語音對比
低延遲串流語音——VibeVoice-Realtime 對比 OpenAI 最新即時模型與 CosyVoice 2。
社群評價
評測與社群怎麼說,以及它和其他方案的對比。以下為網路公開評價的非官方彙整,點卡片看細節與出處。
應用場景
長篇、多語者合成解鎖了單句 TTS 難以勝任的工作流——2026 年的辨識版本再補上即時與裝置端的應用。
發展時間軸
從首次 TTS 發表,到帶語者標註的串流辨識——以及一個純 CPU 就跑得動的版本。
限制與負責任 AI
VibeVoice 做不到什麼、需要什麼,以及如何負責任地使用。可用搜尋快速跳到問題。
社群生態與安全
社群把 VibeVoice 包成了 ComfyUI 節點、桌面應用、API 伺服器與原生移植。這裡整理有哪些,以及在你執行它們之前該確認什麼。數據擷取於 2026 年 9 月;點卡片看細節與 repo 連結。
資源與連結
官方原始碼、權重、線上體驗與延伸閱讀。可依類別篩選或搜尋。