限制與負責任 AI

VibeVoice 做不到什麼、需要什麼,以及如何負責任地使用。可用搜尋快速跳到問題。

可以商用嗎?
官方定位為研究與開發用途。未經進一步的安全與品質測試,不建議直接用於商業部署。
支援哪些語言?
依模型而定。TTS 以英文、中文最穩定,其他語言較不穩。離線版 ASR 原生支援 50+ 種語言,但串流版收斂到 10 種(中、英、法、德、義、日、韓、葡、俄、西)。Realtime 則內建多語語音(德、法、義、日、韓、荷、波、葡、西)與 11 種英文風格音色。
有防濫用機制嗎?
有——模型內建不可察覺的浮水印以標記 AI 生成,並鼓勵加上可聽見的聲明。使用時都應主動揭露音訊為 AI 生成。
硬體需求是什麼?
TTS 方面,1.5B 模型可在 RTX 4070 Ti(12GB)以 BF16 執行;全品質峰值約 14GB VRAM。在 A100 40GB 上,90 分鐘合成約需 8–12 分鐘,實時因子(RTF)約 0.1×。辨識則已經不一定需要 GPU:BitNet 版只有 1.58 GB,三條 CPU 執行緒就能達到實時因子小於 1。
可以邊講邊轉寫嗎?
可以,2026 年 9 月起支援。VibeVoice-ASR-Streaming(1.5B 與 7B)每收到一個音訊區塊就吐出一段帶語者標註的文字,不必等錄音結束。不過節奏要老實看待:官方權重採用約 2.9 秒的區塊搭配約 0.5 秒前瞻,所以它是即時逐字稿,而非零延遲。
新模型有第三方評測嗎?
串流版目前還沒有。微軟自家技術報告指出 7B 串流模型在五組評測集上的平均 WER/CER 最低,並在 13 項語者標註設定中的 12 項取得最佳或並列最佳——但那是作者自己的數據。建議當成起點,用自己的音訊實測。
能做重疊對話或背景音樂嗎?
不行。它無法合成同時重疊的發話、背景音樂或音效——架構是為乾淨、依序的對話而調校。
情緒控制做得到嗎?
僅支援基本情緒。超出簡單語氣的細緻情緒控制有限。
為什麼 2025 年 9 月一度下架?
微軟因濫用疑慮暫時移除了 TTS 程式碼。權重仍留在 Hugging Face,存取狀態隨時間有所變動。
授權是什麼?
MIT 授權。
有什麼風險?
高品質合成語音可能被用於假冒、詐騙或散布不實資訊。請揭露 AI 生成內容、查核轉寫結果,並避免誤導性的應用。