OpenAI 於 8 月 9 日為 ChatGPT 推出新一代 Voice 語音模式,核心採用 GPT-Live 模型,主打更自然、流暢的即時對話體驗。此次更新除改善語音互動方式,也將語音助理的使用範圍延伸至桌面端的 Work 與 Codex,讓使用者可以透過語音處理文件、試算表、簡報、PDF、本機專案與程式碼等工作。
全雙工架構改善語音互動
新版 Voice 導入全雙工(Full-duplex)架構,讓系統能在使用者說話時同步聆聽與回應,藉此降低過去語音助理因誤判停頓而提前插話的情況。系統也可能在聆聽過程中加入「嗯哼」、「對」等簡短語氣詞,讓對話節奏更接近自然的人與人交流。
面對需要深入推理或查詢的複雜問題時,GPT-Live 可以維持語音對話的進行,同時在背景將相關任務交由其他模型處理。使用者亦能在對話期間查看逐字稿,並在需要時切換至文字輸入模式,以保留原有上下文。
Android、iOS 與網頁版全面支援
根據 OpenAI 說明,GPT-Live 已成為 ChatGPT Voice 的預設體驗,支援 Android、iOS 及網頁版。不同方案可使用的模型如下:
| 使用者類型 | 可使用模型 |
|---|---|
| ChatGPT Pro、Plus 與 Go 付費用戶 | GPT-Live-1 |
| 免費用戶 | GPT-Live-1 mini |
使用者只需點擊輸入框最右側的語音圖示,首次使用時授予麥克風權限即可開始對話。啟動後,介面會顯示專屬浮動視窗;使用者也能在設定中切換語言與 AI 嗓音,並調整模型的智慧程度。
語音功能延伸至 Work 與 Codex
此次更新的另一項重點,是將語音功能帶到桌面版的 Work 與 Codex。使用者可透過語音啟動任務、追蹤專案進度,並協同處理文件、試算表、簡報、PDF、本機專案及程式碼。
這項整合顯示,OpenAI 正嘗試讓 ChatGPT 的語音功能從日常問答,延伸至更具連續性的工作流程。使用者不必完全依賴文字輸入,即可在部分專業任務中以口語方式提出需求或追蹤執行狀態。
涉及高敏感操作仍須手動確認
為降低 AI 誤操作可能造成的影響,OpenAI 表示,若語音指令涉及付款、寄送訊息或變更權限等具備實質後果的高敏感操作,系統不會自動執行,仍會要求使用者逐步進行手動確認。
這項設計將語音互動的便利性與高風險操作的人工審核區隔開來,避免單純的語音誤判直接造成不可逆或具外部影響的結果。
目前仍不支援螢幕與視訊分享
GPT-Live 雖然擴充了即時語音與桌面工作流程,但目前尚不支援螢幕分享及視訊分享功能。若需要使用相關功能,使用者仍可前往設定,手動切換回舊版語音模式。
整體而言,這次更新的重點不只在於改善語音辨識與回應的自然程度,也包括讓 ChatGPT 能在更複雜的情境中維持對話、處理背景任務並協助執行工作。不過,實際使用範圍仍會受到模型方案、功能支援狀態及高風險操作確認機制等條件限制。




