Meta 發布 Muse Voice Transcribe 即時語音模型 支援70+語言可分辦20位講者聲紋

BlueSky

AI 摘要

  • Meta 發布 Muse Voice Transcribe 即時音訊模型。
  • 模型支援 70 種以上語言。
  • 模型可辨識 20 位以上講者。

Meta 旗下人工智慧研發部門 Meta Superintelligence Labs(MSL)於 2026 年 9 月 2 日發布即時音訊感知模型 Muse Voice Transcribe。這款模型是 Muse Spark 模型家族的新成員,主打低延遲語音轉錄,並在單一架構中整合語音辨識、講者辨識與語句結束判斷。

Muse Voice Transcribe 目前已登陸 Mac 平台,亦可透過 API 接入。Meta 表示,模型訓練涵蓋 70 種以上語言,並支援同一段語音中的跨語種切換。

單一模型整合三項即時音訊功能

過往語音轉文字流程通常需要串接多套工具,分別處理語音辨識、講者分離及語句結束判斷。Muse Voice Transcribe 則以單一模型處理即時串流語音辨識、講者辨識(Diarization)及語句結束判斷(Endpointing)。

模型可轉錄超過一小時的長音檔,並能在單一音訊中區分 20 位以上講者。當偵測到講者切換時,系統會直接在輸出加入 <|start_of_turn|> 及相應的 Speaker Tag,無需額外後處理。

串流字錯率達 3.1%

根據 Artificial Analysis 的速度與準確度測試,Muse Voice Transcribe 在串流狀態下的最終轉錄字錯率(WER)為 3.1%。模型偵測到講者完成發言後,約需 0.16 秒即可產生最終文字。

同一組英文測試中,Muse Voice Transcribe 的表現如下:

模型轉錄字錯率(WER)延遲時間
Meta Muse Voice Transcribe3.1%0.16 秒
ElevenLabs Scribe v2 Realtime3.6%0.15 秒
OpenAI GPT Live Transcribe3.9%0.84 秒
Google Gemini 3.5 Transcribe Live4.0%0.41 秒
Soniox v5 Real-Time4.5%0.05 秒

上述數據反映不同模型在速度與準確度之間的取捨,實際效果仍會受到語言、音質、講者數量及使用情境影響。

自適應延遲平衡速度與準確度

即時語音轉文字的一項核心難題,是在快速輸出與正確理解之間取得平衡。Muse Voice Transcribe 採用「自適應延遲」(Adaptive Delay)技術,將音訊以每 80 毫秒一段的方式切片分析。

模型會根據目前收到的音訊內容,判斷是否已有足夠資訊輸出文字。面對較難辨識的詞彙時,系統會延長聆聽時間以取得更多上下文;遇到辨識度較高的詞彙時,則會較快輸出結果。

訓練方面,模型結合強化學習,將字詞錯誤率獎勵與延遲獎勵以乘法方式整合,讓系統不會過度偏重速度或準確度。

支援跨語種切換,中文以簡體輸出為主

Muse Voice Transcribe 的訓練涵蓋 70 種以上語言,發布階段已完成 25 種語言驗證,包括中文、日文、法文、西班牙文、印地語及越南語。

模型支援句子中間或句子之間的跨語言切換(Code-switching)。不過,現階段中文輸出主要以簡體中文為主。

在講者辨識方面,模型已於 AMI-IHM、AMI-SDM 及 VoxConverse 等公開資料集進行測試,即時串流講者辨識錯誤率平均為 17.5%。來源指出,其表現優於多款離線處理系統。

Mac、Muse Code 與 API 均可使用

目前使用 Muse Voice Transcribe 主要有三種方式。Mac 用戶可免費下載 Meta AI for Mac,並在 macOS 按住 Fn 鍵啟動全域語音打字;開發者亦可透過 Muse Code 使用,或經由 Meta Model API 接入。

API 定價為每 1,000 音訊分鐘 3 美元,換算每小時約 0.18 美元。至於模型在不同語言、嘈雜環境及多人對話中的實際表現,仍需視具體使用情境評估。

Reference Link : ezone.hk

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles