發展時間軸

從首次 TTS 發表,到帶語者標註的串流辨識——以及一個純 CPU 就跑得動的版本。

  1. 2025 年 8 月 25 日

    TTS 開源發表

    VibeVoice-TTS 首次亮相:單次最長 90 分鐘、最多 4 位語者。此研究後獲 ICLR 2026 Oral 接受。

  2. 2025 年 9 月 5 日

    TTS 程式碼下架

    微軟發現有違背原始用途的使用方式後,將 TTS 程式碼自 repo 移除。模型權重仍保留在 Hugging Face。

  3. 2025 年 12 月 3 日

    Realtime-0.5B 開源

    即時語音合成模型發表,可接收串流文字輸入,長段落生成依然穩定。

  4. 2025 年 12 月 16 日

    Realtime 語者擴充

    實驗性語者包加入九種語言的多語音色(德、法、義、日、韓、荷、波、葡、西)與 11 種英文風格音色。

  5. 2026 年 1 月 21 日

    ASR 開源發表

    統一的語音辨識模型發表:單次 60 分鐘,結構化輸出「誰、何時、說了什麼」,支援 50+ 種語言。隨後再補上 finetune 程式碼與 vLLM 推論。

  6. 2026 年 3 月 6 日

    ASR 併入 Transformers

    VibeVoice-ASR 隨 Hugging Face Transformers 發布,可像其他模型一樣直接呼叫。

  7. 2026 年 3 月 12 日

    ASR 進入 Azure AI Foundry Labs

    模型進入 Microsoft Foundry,不必自行架設就能探索與測試。

  8. 2026 年 7 月 23 日

    ASR-BitNet 擺脫 GPU

    異質量化把 ASR 從 4.62 GB 壓到 1.58 GB,三條 CPU 執行緒即可達到實時因子小於 1。隨附 VibeASR.cpp 推論引擎。

  9. 2026 年 9 月 3 日

    ASR-Streaming 發表

    家族最新成員:1.5B 與 7B 兩種尺寸,音訊還在進來時就邊聽邊轉寫「誰說了什麼」,支援 hotword 與 10 種語言。