⚡ 站長快讀:核心重點
- 文章屬性:科技冷知識 / 規格解析
- 核心結論:GPT-Live 是 OpenAI 2026 年 7 月 8 日推出的新一代語音模型,用「全雙工」架構讓 ChatGPT 語音能一邊聽你說、一邊回話,並把深度推理外包給背後的前沿模型。
- 適用對象:所有用 ChatGPT 語音、對 AI 對話體驗好奇的人
📌 快速答案
一句話答案:GPT-Live 全雙工語音是 OpenAI 讓 AI 能同時聽與說的新架構,取代舊的「你講完它才答」模式,能自然插話、即時翻譯,並把複雜問題交給 GPT-5.5 在背景處理。
🔍 故事的起點
你有沒有過這種經驗:跟 ChatGPT 用語音聊天,話講到一半停頓想一下,它就急著插嘴回答;或者你想打斷它、換個問題,卻得等它把整段話講完?這種「一人講、一人聽、輪流來」的僵硬感,正是舊版語音模式的天花板。
2026 年 7 月 8 日,OpenAI 發布了 GPT-Live,官方形容它是「讓跟 AI 說話更像真正對話」的新一代語音模型(來源:OpenAI 官方公告)。它一次推出兩個版本——GPT-Live-1 與 GPT-Live-1 mini——當天起向全球 ChatGPT 使用者陸續開放。這篇就用白話拆解:GPT-Live 到底改了什麼、「全雙工」是什麼意思,以及它對台灣使用者的實際影響。
🧪 原理拆解
舊方法的兩個天花板
要懂 GPT-Live 的突破,得先看它取代了什麼。根據 OpenAI 官方說明,過去的語音 AI 有兩種做法。
第一種是串接式(cascaded):最早的 ChatGPT 語音把三個模型串在一起——先用語音轉文字(STT)把你的話變成文字,再用大型語言模型產生回答,最後用文字轉語音(TTS)念出來。這讓我們第一次能「用講的」跟前沿模型對話,但代價是資訊會在模型之間流失,回應又慢又生硬。
第二種是回合制(turn-based),也就是先前的 ChatGPT 進階語音模式(Advanced Voice Mode):它把處理與生成收進單一模型,延遲更低、更順,但仍是「一回合一回合」運作——模型必須等你停止說話才回應。而且因為它靠「靜音」來判斷你講完了沒,一個短暫停頓或背景雜音,都可能被誤判成「換你了」,於是它就在不該插話的時候插話(來源:OpenAI 官方)。
「全雙工」到底是什麼
GPT-Live 的核心改變,是建立在全雙工(full-duplex)架構上。官方的定義很直接:它能「同時聽與說」。
用生活化的比喻:舊模式像對講機(walkie-talkie),同一時間只能有一方按著講;全雙工則像正常的電話通話,兩邊可以同時出聲、自然打斷。技術上,GPT-Live 不是處理一則一則分開的訊息,而是一邊持續接收輸入、一邊持續生成輸出,每秒能做出很多次互動決策:該說話、繼續聽、暫停、打斷,還是去呼叫工具(來源:OpenAI 官方)。
這帶來幾個實際感受:它會用「嗯嗯」「對」這類短語表示有在聽;你停下來思考時,它會等你,而不是急著跳進來;你要它安靜聽,它就安靜。OpenAI 也把 ChatGPT 裡的九種聲音為 GPT-Live 重新調校過。
深度工作「外包」給前沿模型
第二個關鍵設計,是 OpenAI 把「負責即時互動的 GPT-Live」和「負責深度工作的模型」拆開了。
當一個問題需要網路搜尋、更深的推理或更 agentic 的能力時,GPT-Live 會把這個任務委派(delegate)給另一個模型,同時繼續跟你維持對話的流暢。官方明確指出,發表當下 GPT-Live 背後用的是 GPT-5.5;隨著之後推出更新的前沿模型,GPT-Live 會持續替換背後使用的模型(來源:OpenAI 官方)。換句話說,語音層可以保持不變,而它的「大腦」能不斷升級。
在 ChatGPT 裡,你還能自己選推理強度:Instant 求快、Medium 與 High 則讓它多花時間思考。想深入了解 OpenAI 目前的前沿模型檔位怎麼分,可以參考站內這篇 GPT-5.6 Sol Terra Luna 怎麼選。

即時翻譯:全雙工最有感的應用
因為能同時聽與說,GPT-Live 解鎖了一個很實用的能力:即時翻譯。它可以在你還在講的時候就同步把翻譯「串流」出來,而不是等你講完一整句才開始翻(來源:OpenAI 官方)。
不過這裡要誠實提醒:根據科技媒體 TechCrunch 在發表會現場的觀察,示範印地語即時翻譯時,模型帶著明顯的美式口音,講出來的印地語聽起來偏生硬、有點書面腔。OpenAI 說新模式針對「最多人使用的語言」做了優化,但沒有具體列出是哪些語言(來源:TechCrunch)。所以繁體中文的實際體驗如何,還是得自己開來試試看。
不只會講,也會「秀」給你看
新的 ChatGPT 語音體驗還多了視覺回應:講到天氣、股票、運動賽事這類主題時,它能直接在畫面上顯示豐富的資訊卡片。語音模式也持續支援搜尋、記憶、圖片與檔案上傳(來源:OpenAI 官方)。
💡 總結:冷知識延伸
站長我覺得 GPT-Live 最值得玩味的,不是「它變聰明了」,而是那個「委派」的架構思路——把「即時反應」和「深度思考」拆成兩層。這其實很像人類對話:你跟朋友聊天時,嘴上「嗯、對、然後呢」不會停,但腦袋同時在後台認真想事情。OpenAI 等於把這個分工搬進了系統設計。
官方也把話講得更遠:他們認為語音有機會成為操作電腦、處理長時間 agentic 工作的「主要介面」。TechCrunch 引述 ChatGPT 語音產品負責人 Atty Eleti 的說法,他自己散步時曾跟語音功能聊上 30 到 40 分鐘(來源:TechCrunch)。這個方向對不方便盯螢幕的情境——開車、做家事、走路通勤——特別有想像空間。
如果你對「本地、免上傳」的語音處理更有興趣,可以看站內 Whisper 語音轉文字教學;想把 ChatGPT/Claude 這類工具用得更順,也可以參考 Claude Reflect 教學。
❓ 常見問題
Q:GPT-Live 是免費的嗎?我要另外付費嗎?
依 OpenAI 官方說明,GPT-Live 正逐步向全球 ChatGPT 使用者開放,涵蓋 iOS、Android 與 ChatGPT.com。其中 GPT-Live-1 會成為 Go、Plus、Pro 使用者的 ChatGPT 語音預設模型;GPT-Live-1 mini 則會成為免費(Free)使用者的預設,取代目前的進階語音模式(來源:OpenAI 官方)。所以免費用戶也用得到,只是預設走的是 mini 版。
Q:它跟原本的「進階語音模式」差在哪?
最大差別是「全雙工」。進階語音模式是回合制——要等你講完才回;GPT-Live 能同時聽與說,可以被自然打斷、會等你思考,還能把難題丟給 GPT-5.5 在背景處理再把結果帶回對話(來源:OpenAI 官方)。你仍可切回舊的標準或進階語音模式繼續使用。
Q:發表當下有哪些功能還沒到位?
根據官方,發表初期 GPT-Live 在 ChatGPT 裡還不支援搭配視訊或螢幕分享,OpenAI 表示正在開發中。另外它針對部分語言可能有非母語口音或流暢度不足的情況。開發者與企業的 API 存取則是「即將推出」,官方開放表單讓有興趣者登記通知(來源:OpenAI 官方)。
📎 參考資料來源
📖 第一級|廠商官方:
- Introducing GPT-Live — OpenAI — 2026-07-13 查證
📖 第二級|權威技術媒體:
