VibeVoice-TTS · 1.5B
長語音多語者合成:單次最長 90 分鐘、最多 4 位語者,音色維持一致。
六個開源權重,同一套設計語言。點卡片看完整說明。
5 筆結果
長語音多語者合成:單次最長 90 分鐘、最多 4 位語者,音色維持一致。
長音訊辨識:單次 60 分鐘,輸出「誰、何時、說了什麼」——語者、時間戳與內容。
輕量即時串流:首字延遲約 300 毫秒,支援串流文字輸入,可穩定生成約 10 分鐘。
音訊還在進來時就邊聽邊轉寫「誰說了什麼」,約每 2.9 秒吐出一段文字。
把 ASR 模型從 4.62 GB 壓到 1.58 GB——幾條 CPU 執行緒就跑得比即時還快,不需要 GPU。