Google Gemini 3.5 Transcribe 登場:支援 85 種語言與三位說話者辨識

BlueSky

AI 摘要

  • Google 發表 Gemini 3.5 Transcribe 語音轉文字模型。
  • 模型支援 85 種語言與最多三位說話者辨識。
  • Gemini 3.5 Transcribe 已透過 API 開放公開預覽。

Google 正式發表專為語音轉文字設計的語音模型 Gemini 3.5 Transcribe,主打降低背景雜音干擾、提升專業術語與複雜詞彙的辨識準確度。根據 Google 提供的數據,模型在非串流環境下的平均詞錯誤率(WER)為 2.6%,即時串流辨識環境則為 4.0%。

目前 Gemini 3.5 Transcribe 已率先導入 macOS 平台的 Gemini 應用程式,以及 Android 平台 Gboard 鍵盤的 Rambler 語音輸入功能。開發者也能透過 API 建構語音智慧體、即時轉錄工具與其他語音處理工作流。

針對自然口語設計的語音辨識功能

Google 表示,Gemini 3.5 Transcribe 的設計重點,是更準確捕捉使用者自然說話時的節奏與語意。模型可辨識自訂詞彙,也能支援使用者以語音下達指令,並進一步完成相關任務。

自動修正與過濾贅字

模型能過濾「嗯」、「啊」等口語填充詞,並在前後文語意不一致時進行自我修正,讓轉錄內容更接近整理後的文字,而非單純逐字記錄。

自動處理文字格式

在輸出文字時,Gemini 3.5 Transcribe 可自動補上標點符號、段落換行與數字格式,藉此降低後續人工潤稿與校對的工作量。

支援跨模型協作

模型具備任務委派機制,能將文件深度分析、程式碼除錯或圖像生成等較複雜工作交由其他 Gemini 系列模型處理,形成語音輸入與多模態模型協作的工作流。

強化噪音環境與關鍵資訊辨識

在吵雜街道或具有回音的會議室等環境中,Gemini 3.5 Transcribe 強調提升抗噪能力。模型也針對長串訂單編號、郵遞區號等英數字混合內容加強辨識權重,以降低關鍵資料漏字或誤判的情況。

支援 85 種語言與說話者標記

Gemini 3.5 Transcribe 目前支援 85 種語言,並具備地區口音與方言辨識能力。針對預先錄製的會議或訪談音訊,模型最多可辨識三位不同說話者,將語音歸屬至對應發言者,並附加時間戳記,方便製作逐字稿。

開發者與企業也能匯入自訂詞彙表,用於處理產業專有名詞、品牌代號與縮寫等內容。這項功能可讓模型依照特定使用情境調整辨識範圍。

目前開放 API 公開預覽

開發者目前可透過 Google AI Studio,以及 Google Antigravity 中的 Gemini API,以公開預覽(Public Preview)形式呼叫 Gemini 3.5 Transcribe。Google 列出的應用方向包括語音助理智慧體、會議即時字幕與通話後分析系統。

一般使用者目前可在 Android 與 macOS 平台體驗相關功能。Google 另計畫將 Gemini 3.5 Transcribe 整合至 Chrome,讓使用者未來能在網頁輸入框中直接啟動語音輸入。不過,Chrome 整合目前仍屬於預計推出的功能,實際開放時間尚未公布。

功能導入仍須留意使用情境

從目前公布的資訊來看,Gemini 3.5 Transcribe 已涵蓋即時串流、預錄音訊、多語言辨識與自訂詞彙等場景,但 API 仍處於公開預覽階段。此外,說話者辨識功能針對預先錄製的音訊,最多支援三位說話者;企業在導入會議、客服或通話分析流程前,仍需依照實際音質、語言與專業詞彙需求進行測試。

Reference Link : techbang.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles