OpenAI 推出 GPT-Live 語音模型:可邊聽邊說,並適時插話回應

OpenAI 近日推出新一代語音模型 GPT-Live 系列,主打更接近真人的連續式對話體驗。不同於必須等使用者完整說完才能回應的傳統語音系統,GPT-Live 採用雙向架構,能在生成語音的同時持續處理使用者輸入,並自行判斷應該回應、短暫等待或繼續聆聽。

OpenAI 已開始向全球 ChatGPT 使用者推出 GPT-Live-1 與 GPT-Live-1 mini 兩個版本,並表示很快會在 API 中提供 GPT-Live 存取。根據 OpenAI 的說法,目前 ChatGPT 語音對話已由 GPT-Live 驅動。

雙向架構讓對話不再完全依賴回合切換

在實際對話中,GPT-Live 可以使用「對」、「嗯」及「了解」等簡短回應,讓使用者知道模型正在聆聽;當使用者需要整理思緒時,模型也能保持安靜等待。使用者可以在模型說話時插話、暫停思考,或要求 GPT-Live 放慢語速,互動方式不再侷限於「使用者說完、模型再回答」的固定流程。

OpenAI 同時重新製作了 9 種各具特色的聲音,讓使用者在語音互動時有更多選擇。GPT-Live 也能支援即時翻譯等需要連續理解上下文的語音應用。

從串接模型到連續式語音處理

早期的 AI 語音系統多採串接式架構,依序使用多個模型完成一輪對話。以 ChatGPT 過去的語音功能為例,系統需要先以語音轉文字模型轉錄內容,再交由大型語言模型產生回應,最後透過文字轉語音模型輸出聲音。

這種方式雖然能結合不同模型的能力,但資訊可能在模型之間傳遞時流失,也可能增加延遲,導致回應較為生硬。ChatGPT 進階語音模式則進一步採用回合式語音模型,在單一模型內處理並生成音訊,降低延遲並改善流暢度。

然而,回合式模型仍須等待使用者停止說話後才開始回應。由於系統通常依靠靜音判斷一輪對話是否結束,短暫停頓或背景噪音可能被誤判為說話結束,造成模型在不自然的時間點插話。

GPT-Live 的雙向架構則讓模型不再把每則訊息視為彼此獨立的回合,而是在輸出內容的同時持續處理新的語音輸入,並判斷應該繼續說話或回到聆聽狀態。這項設計有望改善語音對話的節奏與即時性,但實際體驗仍取決於模型判斷、網路連線及使用環境等因素。

複雜任務可轉交其他模型處理

當使用者要求網路搜尋、深入推理或處理較複雜的問題時,GPT-Live 會在幕後將任務轉交給其他先進模型,例如 GPT-5.5。待相關結果準備完成後,系統再把資訊帶回語音對話中,讓使用者不必手動切換模型或離開目前的交談流程。

這種分工方式可讓 GPT-Live 專注於即時聆聽、語音生成與對話節奏,同時借助其他模型處理需要搜尋或較長推理流程的工作。不過,來源內容未進一步說明模型切換的觸發條件、延遲表現或不同版本之間的能力差異。

OpenAI 強調語音安全機制

在安全控制方面,當 ChatGPT 偵測到可能產生不安全的輸出時,系統會引導 GPT-Live 提供更安全的回應,或顯示額外的安全訊息與資源;在風險較高的情況下,則可能結束語音對話。

針對涉及自我傷害的對話,OpenAI 表示已將 ChatGPT 的支援流程調整為適用於語音互動,包括提供經專家審核的求助專線。這顯示語音模型除了需要處理辨識與回應品質,也必須因應即時對話在安全判斷上的特殊挑戰。

語音 AI 競爭持續升溫

OpenAI 指出,每週有超過 1.5 億人透過語音及聽寫等功能與 ChatGPT 對話。隨著使用者逐漸以口語方式取得資訊、練習語言或尋求協助,語音互動的自然程度與反應時機將成為 AI 助理的重要競爭條件。

GPT-Live 若能改善模型等待、插話與理解對話節奏等問題,將進一步提升 ChatGPT 在日常語音互動中的實用性,也可能加劇 OpenAI 與 Google Gemini Live 等服務之間的競爭。不過,模型在不同語言、口音、背景噪音及高風險情境下的實際表現,仍有待推出後持續觀察。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles