
AI 摘要
- Google 於 Gemini Enterprise 平台為 Gemini 3.8 Live 推出 Live Avatar 虛擬形象技術。
- 該功能支援 97 種語言即時語音對話並提供唇形同步動態。
- 所有生成的音訊與影像均嵌入 SynthID 浮水印以供檢驗辨識。
Google 近日宣布為其多模態模型生態導入全新視覺形象技術,在 Gemini Enterprise 平台上的 Gemini 3.8 Live 正式推出「Live Avatar」功能。這項技術旨在讓企業級 AI 代理(Agents)具備近乎實時的視覺呈現能力,透過同步的語音與面部動態,縮短用戶與虛擬助理之間的互動距離。
多模態即時互動:唇形同步與跨語言穩定性
Google 在官方網誌中指出,真實人際對話本質上涵蓋傾聽、觀察、說話及面部表情等多模態要素。Live Avatar 能夠在接收到使用者的視覺與音訊輸入後,近乎同步地生成相對應的 AI 語音和臉部畫面,在理解意圖的同時完成輪流對話(turn-taking)。

在視覺生成表現方面,Live Avatar 具備以下核心技術特點:
- 唇形同步與自然神態:系統能依據語音內容精準對齊唇形,並展現流暢的面部表情動態。
- 多語言切換穩定性:支援在多達 97 種語言之間無縫切換,官方強調過程不會降低畫面解析度或產生視覺偏離(visual drift)。
- 後端工具整合:得益於 Gemini 模型的推理能力,Live Avatar 可以在維持前端順暢交談的狀態下,於背景即時觸發外部工具並檢索數據,執行複雜任務。
企業客製化形象與 SynthID 水印安全機制
針對商業應用情境,Live Avatar 旨在提升數位客服與諮詢體驗的親和力。為滿足企業品牌識別需求,該功能允許企業提供高畫質參考圖片,讓 AI 依照特定的品牌風格或角色設定生成專屬虛擬人物。不過,該客製化形象功能目前僅優先開放予取得白名單資格(allowlisting)的企業客戶使用。
為了兼顧內容真實性與安全治理,Google 亦在 Live Avatar 輸出流程中導入透明度機制。所有生成的音訊與影像串流均會直接嵌入 SynthID 數位浮水印,確保第三方系統與演算法能可靠檢測並標記該內容由 AI 生成。
Reference Link : inews.hket.com




