Google 發表 Gemini 3.8 Live 與 Extended Thinking 語音模型,支援即時影音與多步驟推理

BlueSky

AI 摘要

  • Google 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款語音模型。
  • Extended Thinking 版本專為多步驟推理設計,在語音對話品質評比中位列第一。
  • 兩款模型已透過 Gemini API、Google AI Studio 及企業版開始推出。

Google 發表兩款全新語音對話模型

Google 正式推出 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking 兩款語音對話模型,目標是大幅強化人工智慧在即時推理與自然語音互動方面的能力。兩款模型針對不同應用場景與複雜度進行設計,為開發者、企業用戶及一般消費者提供更具效率的語音代理支援。

Gemini 3.8 Live:規模化應用與視覺接地

Gemini 3.8 Live 的定位聚焦於規模化應用與成本效益的平衡。在功能方面,該模型結合深度對話理解與流暢的自然互動,並具備視覺接地(Visual Grounding)能力,可即時處理視覺輸入,讓使用者在對話過程中直接透過畫面傳遞情境資訊。

此外,Gemini 3.8 Live 能自動偵測並在對話中切換 97 種語言,同時支援在背景執行工具與 API 呼叫,確保對話流程不被中斷。

Gemini 3.8 Live Extended Thinking:高複雜度多步驟推理

Gemini 3.8 Live Extended Thinking 專為需要複雜推理的任務所設計,具備強化的多步驟推理能力。其核心機制為「同時思考與說話」,在處理複雜非同步任務時,模型能提供口語進度說明,或透過早期口語提示自然回應使用者,同時在背景默默執行工具與 API 呼叫,維持對話的流暢度。

在效能表現上,Extended Thinking 版本在多項基準測試中取得高分,於語音對話品質指數評比中位列第一,並具備優異的代理任務執行能力。

SynthID 數位浮水印保障內容可信度

所有由 Google 語音產品所生成的音訊內容,皆會透過 SynthID 技術加入數位浮水印,使生成音訊可被辨識,以降低虛假資訊帶來的風險。

推出時程與存取管道

兩款模型已自發布日起逐步向各界推出,存取管道依用戶類型有所不同:

  • 開發者:可透過 Gemini API 與 Google AI Studio 進行存取與建置。
  • 企業用戶:可在 Gemini Enterprise 中使用預覽版本。
  • 一般使用者:將陸續在 Search Live、Gemini Live 以及 Google Workspace 訂閱方案中體驗相關功能。

Reference Link : techbang.com

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles