微軟正式發表 MAI-Transcribe-2-Streaming 首款自研即時串流語音轉錄模型 同步推出 MAI-Voice 系列更新

BlueSky

AI 摘要

  • 微軟推出首款自研即時串流語音轉錄模型 MAI-Transcribe-2-Streaming,延遲僅 100 毫秒且支援 60 種語言。
  • 同步更新 MAI-Voice-2.1 與高反應速度的 MAI-Voice-2.1-Flash 兩款文字轉語音模型。

微軟旗下 AI 部門 Microsoft AI(MAI)正式發佈首款自研即時串流語音轉錄模型 MAI-Transcribe-2-Streaming,將自研語音辨識技術全面延伸至低延遲即時串流場景。新模型主打接收音訊後僅需約 100 毫秒即可開始輸出初步轉錄結果,並支援動態修正,讓語音代理人可在使用者話音未落時即刻展開推理與工具調用。與此同時,微軟亦同步更新旗下語音合成產品線,推出 MAI-Voice-2.1 與針對低延遲環境最佳化的 MAI-Voice-2.1-Flash,建構完整的語音辨識與生成解決方案。

MAI-Transcribe-2-Streaming:兼顧極速與高準確度的即時轉錄技術

微軟 MAI-Transcribe-2-Streaming 定位於高即時性語音應用,例如語音助理、即時字幕以及即時語音輸入。模型支援多達 60 種語言,並具備持續自動語言偵測功能。在運作架構上,系統會在音訊傳入時同步產生可持續修正的部分轉錄內容,隨後續語意逐步確立最終文字。

根據獨立評測機構 Artificial Analysis 的即時串流語音辨識評測數據,MAI-Transcribe-2-Streaming 在「最終轉錄」與「部分轉錄」的準確度項目中雙雙奪得第一名,並在綜合準確度與延遲的評估中位居前段,展現出高度競爭力。

MAI-Voice-2.1 與 MAI-Voice-2.1-Flash:跨語言聲音合成新升級

除了轉錄模型,微軟更新了文字轉語音產品線,推出 MAI-Voice-2.1 及低延遲版本 MAI-Voice-2.1-Flash。兩款模型均支援 23 種語言及 26 個地區,具備跨語言輸出能力,能在不同語種間維持說話者的音色特徵,同時支援僅需數秒參考音訊即可完成聲音複製。

  • MAI-Voice-2.1:著重於語音品質與自然度表現,專門面向內容創作、專業配音及長篇語音生成需求。
  • MAI-Voice-2.1-Flash:專為語音助理、智慧客服等高並發、高即時性情境最佳化,擁有更快的生成速度與更低的成本結構。

全新 MAI 語音系列模型規格與售價比較

模型名稱主要定位與特色支援語言與地區計費方式與售價
MAI-Transcribe-2-Streaming即時串流語音轉錄、約 100 毫秒超低延遲、動態修正60 種語言(含持續自動語言偵測)今年底前優惠價每小時音訊 0.54 美元
MAI-Voice-2.1高品質文字轉語音、強調自然度、跨語言聲音複製23 種語言、26 個地區每 100 萬字元 22 美元
MAI-Voice-2.1-Flash低延遲文字轉語音、快速回應、大規模即時客服23 種語言、26 個地區每 100 萬字元 15 美元

Reference Link : ithome.com.tw

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles