精華筆記

· @aihub.tw

AI

OpenAI GPT-Live:全雙工即時語音,邊聽邊講更像真人

原片講者:OpenAI

0:00 / 0:00

你有沒有過這種經驗:跟語音助理講話,得先講完一整句,停頓一下,等它「輪到我」才開口回你?那種一問一答、像對講機的節奏,其實一點都不像跟真人聊天。OpenAI 在 2026 年 7 月 8 日推出的 GPT-Live,想解決的就是這件事——讓 AI 能一邊聽你講、一邊回話,不用乖乖排隊等你講完。

這次一次出兩個版本:GPT-Live-1 和更輕量的 GPT-Live-1 mini,先從 ChatGPT 的語音功能上線,取代原本的進階語音模式。

全雙工是什麼?為什麼是重點

先講白話。過去的語音 AI 大多是「半雙工」:你講、它聽,你停、它回,兩邊輪流,中間常有那種尷尬的空檔。GPT-Live 走的是 全雙工(full-duplex)——它可以同時處理「聽你講的」跟「自己要講的」,兩件事平行進行。

實際上會有什麼差別?幾個很具體的點:

  • 你講到一半想插話、想改口,它會停下來聽你,不會硬把自己那段講完。
  • 它會像真人一樣「嗯嗯」「對啊」地搭腔,讓你知道它有在聽。
  • 你在想事情、停頓幾秒,它不會急著插話填空,而是安靜等你。

這些聽起來是小細節,但正是這些細節,決定了一段對話「像不像真人」。OpenAI 也說,在真人盲測裡,GPT-Live-1 和 mini 版都比舊的進階語音模式更受偏好。

抗噪更穩、也更聰明

官方特別點出兩個能力。

第一個是 背景抗噪(Background Robustness)。就算你走在吵雜的街上、旁邊有人在講話,它也能鎖定你的聲音,不會被背景噪音亂觸發、亂插話。這對「邊走邊講」的實際使用場景很關鍵——你總不會每次都在安靜的錄音室裡對它說話。

第二個是 更聰明(Improved Intelligence),而它的做法蠻聰明的:GPT-Live 本身負責「即時對話」,遇到需要深度推理、查資料的難題時,會在背景把任務交給更強的模型(發布時是 GPT-5.5)去算,同時嘴上還是繼續跟你聊,用「我幫你查一下喔」這類自然的過場話把答案接回來。

這樣設計的好處是:講話的體感跟背後的推理能力被拆開了。之後 OpenAI 想升級「腦袋」,不用把整個語音體驗打掉重練。

能拿來做什麼?

對一般使用者來說,最直接的就是 ChatGPT 的語音對話變得更順、更能打斷、更像在跟一個人聊天。這次也一起更新了語音音色,並支援即時翻譯。

但更值得留意的是它背後代表的方向——一個能自然插話、抗噪、又聰明的即時語音模型,幾乎就是為這些場景量身打造的:

  • 客服:能被打斷、能即時回應,不用聽完一整段罐頭語音。
  • 即時口說練習:語言學習時,能自然對話、隨時糾正。
  • 語音 agent:讓 AI 用「講話」而不是「打字」幫你辦事。

要提醒一件事:GPT-Live 目前是 ChatGPT 內的功能,發布時還沒有開放 API。OpenAI 說會「很快」帶到 API,開發者可以先到官方表單登記候補。所以如果你是想串進自己產品的開發者,現階段能上線的還是既有的 Realtime API,GPT-Live 就先當作「值得盯著的下一步」。

小結

GPT-Live 沒有炫技型的新功能,它做的是把「跟 AI 講話」這件事,從對講機變成聊天。全雙工、抗噪、背後接更強的模型——三件事湊起來,讓語音 AI 又往「像真人」靠近了一步。接下來就看 API 什麼時候開放,以及有多少產品願意把「打字」換成「開口講」。

#AI工具#OpenAI#語音AI#即時語音

原片來源:https://openai.com/index/introducing-gpt-live/

← 回所有文章