
AI 摘要
- 微軟推出首款自研即時串流語音轉錄模型 MAI-Transcribe-2-Streaming,延遲僅 100 毫秒且支援 60 種語言。
- 同步更新 MAI-Voice-2.1 與高反應速度的 MAI-Voice-2.1-Flash 兩款文字轉語音模型。
微軟旗下 AI 部門 Microsoft AI(MAI)正式發佈首款自研即時串流語音轉錄模型 MAI-Transcribe-2-Streaming,將自研語音辨識技術全面延伸至低延遲即時串流場景。新模型主打接收音訊後僅需約 100 毫秒即可開始輸出初步轉錄結果,並支援動態修正,讓語音代理人可在使用者話音未落時即刻展開推理與工具調用。與此同時,微軟亦同步更新旗下語音合成產品線,推出 MAI-Voice-2.1 與針對低延遲環境最佳化的 MAI-Voice-2.1-Flash,建構完整的語音辨識與生成解決方案。
MAI-Transcribe-2-Streaming:兼顧極速與高準確度的即時轉錄技術
微軟 MAI-Transcribe-2-Streaming 定位於高即時性語音應用,例如語音助理、即時字幕以及即時語音輸入。模型支援多達 60 種語言,並具備持續自動語言偵測功能。在運作架構上,系統會在音訊傳入時同步產生可持續修正的部分轉錄內容,隨後續語意逐步確立最終文字。
根據獨立評測機構 Artificial Analysis 的即時串流語音辨識評測數據,MAI-Transcribe-2-Streaming 在「最終轉錄」與「部分轉錄」的準確度項目中雙雙奪得第一名,並在綜合準確度與延遲的評估中位居前段,展現出高度競爭力。

MAI-Voice-2.1 與 MAI-Voice-2.1-Flash:跨語言聲音合成新升級
除了轉錄模型,微軟更新了文字轉語音產品線,推出 MAI-Voice-2.1 及低延遲版本 MAI-Voice-2.1-Flash。兩款模型均支援 23 種語言及 26 個地區,具備跨語言輸出能力,能在不同語種間維持說話者的音色特徵,同時支援僅需數秒參考音訊即可完成聲音複製。
- MAI-Voice-2.1:著重於語音品質與自然度表現,專門面向內容創作、專業配音及長篇語音生成需求。
- MAI-Voice-2.1-Flash:專為語音助理、智慧客服等高並發、高即時性情境最佳化,擁有更快的生成速度與更低的成本結構。
全新 MAI 語音系列模型規格與售價比較
| 模型名稱 | 主要定位與特色 | 支援語言與地區 | 計費方式與售價 |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | 即時串流語音轉錄、約 100 毫秒超低延遲、動態修正 | 60 種語言(含持續自動語言偵測) | 今年底前優惠價每小時音訊 0.54 美元 |
| MAI-Voice-2.1 | 高品質文字轉語音、強調自然度、跨語言聲音複製 | 23 種語言、26 個地區 | 每 100 萬字元 22 美元 |
| MAI-Voice-2.1-Flash | 低延遲文字轉語音、快速回應、大規模即時客服 | 23 種語言、26 個地區 | 每 100 萬字元 15 美元 |
Reference Link : ithome.com.tw




