長篇多語者的真突破
評測普遍認為單次 90 分鐘、4 語者長對話是真正的躍進。
評測與社群怎麼說,以及它和其他方案的對比。以下為網路公開評價的非官方彙整,點卡片看細節與出處。
11 筆結果
評測普遍認為單次 90 分鐘、4 語者長對話是真正的躍進。
普遍讚賞 MIT 開源、可自架,免去訂閱與隱私疑慮。
Hacker News 社群肯定其音色一致性與對話自然度。
AllAboutAI 調查:67% 技術使用者認為其表現力優於 Chatterbox-TTS。
HN 有使用者指出幾乎每句語調都怪,帶機械感的調變。
有人認為相較數年前驚艷,但以今日標準仍嫌不夠出彩。
評測一致指出:英/中為主,無法處理重疊發話、背景音樂或音效。
串流版 ASR 沒有發布文,目前也還沒有第三方評測。
據微軟技術報告,7B 版 MOS 勝過 ElevenLabs v3 與 Gemini TTS。
長篇與成本勝出;ElevenLabs 的精緻度與語言廣度仍領先。
長對話一致性更好;F5 的單句音質仍受稱讚。