發展時間軸
從首次 TTS 發表,到帶語者標註的串流辨識——以及一個純 CPU 就跑得動的版本。
- 2025 年 8 月 25 日
TTS 開源發表
VibeVoice-TTS 首次亮相:單次最長 90 分鐘、最多 4 位語者。此研究後獲 ICLR 2026 Oral 接受。
- 2025 年 9 月 5 日
TTS 程式碼下架
微軟發現有違背原始用途的使用方式後,將 TTS 程式碼自 repo 移除。模型權重仍保留在 Hugging Face。
- 2025 年 12 月 3 日
Realtime-0.5B 開源
即時語音合成模型發表,可接收串流文字輸入,長段落生成依然穩定。
- 2025 年 12 月 16 日
Realtime 語者擴充
實驗性語者包加入九種語言的多語音色(德、法、義、日、韓、荷、波、葡、西)與 11 種英文風格音色。
- 2026 年 1 月 21 日
ASR 開源發表
統一的語音辨識模型發表:單次 60 分鐘,結構化輸出「誰、何時、說了什麼」,支援 50+ 種語言。隨後再補上 finetune 程式碼與 vLLM 推論。
- 2026 年 3 月 6 日
ASR 併入 Transformers
VibeVoice-ASR 隨 Hugging Face Transformers 發布,可像其他模型一樣直接呼叫。
- 2026 年 3 月 12 日
ASR 進入 Azure AI Foundry Labs
模型進入 Microsoft Foundry,不必自行架設就能探索與測試。
- 2026 年 7 月 23 日
ASR-BitNet 擺脫 GPU
異質量化把 ASR 從 4.62 GB 壓到 1.58 GB,三條 CPU 執行緒即可達到實時因子小於 1。隨附 VibeASR.cpp 推論引擎。
- 2026 年 9 月 3 日
ASR-Streaming 發表
家族最新成員:1.5B 與 7B 兩種尺寸,音訊還在進來時就邊聽邊轉寫「誰說了什麼」,支援 hotword 與 10 種語言。