AI 摘要
- Meta 發布 Muse Voice Transcribe 即時音訊模型。
- 模型支援 70 種以上語言。
- 模型可辨識 20 位以上講者。
Meta 旗下人工智慧研發部門 Meta Superintelligence Labs(MSL)於 2026 年 9 月 2 日發布即時音訊感知模型 Muse Voice Transcribe。這款模型是 Muse Spark 模型家族的新成員,主打低延遲語音轉錄,並在單一架構中整合語音辨識、講者辨識與語句結束判斷。

Muse Voice Transcribe 目前已登陸 Mac 平台,亦可透過 API 接入。Meta 表示,模型訓練涵蓋 70 種以上語言,並支援同一段語音中的跨語種切換。
單一模型整合三項即時音訊功能
過往語音轉文字流程通常需要串接多套工具,分別處理語音辨識、講者分離及語句結束判斷。Muse Voice Transcribe 則以單一模型處理即時串流語音辨識、講者辨識(Diarization)及語句結束判斷(Endpointing)。
模型可轉錄超過一小時的長音檔,並能在單一音訊中區分 20 位以上講者。當偵測到講者切換時,系統會直接在輸出加入 <|start_of_turn|> 及相應的 Speaker Tag,無需額外後處理。

串流字錯率達 3.1%
根據 Artificial Analysis 的速度與準確度測試,Muse Voice Transcribe 在串流狀態下的最終轉錄字錯率(WER)為 3.1%。模型偵測到講者完成發言後,約需 0.16 秒即可產生最終文字。
同一組英文測試中,Muse Voice Transcribe 的表現如下:
| 模型 | 轉錄字錯率(WER) | 延遲時間 |
|---|---|---|
| Meta Muse Voice Transcribe | 3.1% | 0.16 秒 |
| ElevenLabs Scribe v2 Realtime | 3.6% | 0.15 秒 |
| OpenAI GPT Live Transcribe | 3.9% | 0.84 秒 |
| Google Gemini 3.5 Transcribe Live | 4.0% | 0.41 秒 |
| Soniox v5 Real-Time | 4.5% | 0.05 秒 |
上述數據反映不同模型在速度與準確度之間的取捨,實際效果仍會受到語言、音質、講者數量及使用情境影響。

自適應延遲平衡速度與準確度
即時語音轉文字的一項核心難題,是在快速輸出與正確理解之間取得平衡。Muse Voice Transcribe 採用「自適應延遲」(Adaptive Delay)技術,將音訊以每 80 毫秒一段的方式切片分析。
模型會根據目前收到的音訊內容,判斷是否已有足夠資訊輸出文字。面對較難辨識的詞彙時,系統會延長聆聽時間以取得更多上下文;遇到辨識度較高的詞彙時,則會較快輸出結果。
訓練方面,模型結合強化學習,將字詞錯誤率獎勵與延遲獎勵以乘法方式整合,讓系統不會過度偏重速度或準確度。

支援跨語種切換,中文以簡體輸出為主
Muse Voice Transcribe 的訓練涵蓋 70 種以上語言,發布階段已完成 25 種語言驗證,包括中文、日文、法文、西班牙文、印地語及越南語。
模型支援句子中間或句子之間的跨語言切換(Code-switching)。不過,現階段中文輸出主要以簡體中文為主。
在講者辨識方面,模型已於 AMI-IHM、AMI-SDM 及 VoxConverse 等公開資料集進行測試,即時串流講者辨識錯誤率平均為 17.5%。來源指出,其表現優於多款離線處理系統。

Mac、Muse Code 與 API 均可使用
目前使用 Muse Voice Transcribe 主要有三種方式。Mac 用戶可免費下載 Meta AI for Mac,並在 macOS 按住 Fn 鍵啟動全域語音打字;開發者亦可透過 Muse Code 使用,或經由 Meta Model API 接入。
API 定價為每 1,000 音訊分鐘 3 美元,換算每小時約 0.18 美元。至於模型在不同語言、嘈雜環境及多人對話中的實際表現,仍需視具體使用情境評估。
Reference Link : ezone.hk




