正在把公司電話客服系統,從「先轉文字、AI 想答案、再念出來」的三段式架構,換成聽起來更聰明的語音系統
傳統語音 AI 的做法,是先把你說的話轉成文字(STT (Speech-to-Text)把你講的話即時轉換成文字的技術),交給文字模型想答案,再把答案轉回聲音(TTS (Text-to-Speech)把文字唸出來、變成語音的技術)。這種「聽→想→說」分成三段接力的做法,每次交接都要花時間,所以你一開口打斷它,系統常常反應不過來,甚至要從頭處理一次。
GPT-Live-1 是 OpenAI 新推出的語音模型,直接把「聽」跟「說」放進同一個模型裡處理,官方稱這種能力叫全雙工 (full-duplex)講話的同時也能聽、也能隨時被打斷,不用等對方講完整句。因為聽跟說是同一個腦袋在處理,它可以邊聽你講話邊準備回應,你中途打斷,它能像真人一樣立刻停下來接話,不必重跑一次三段式流程。
遇到比較燒腦的問題,GPT-Live-1 也不用自己硬扛,而是可以把深度思考丟給後端的文字模型處理,這叫推理委派 (reasoning delegation)語音模型只負責聽和說,遇到複雜判斷就把「怎麼想」的部分丟給另一個更擅長思考的文字模型或工具處理。它還支援電話語音閘道 (telephony support)讓語音 AI 能直接透過一般電話線路撥打或接聽電話,而不只是在網頁上對話,代表可以直接做成能打電話訂位、處理客服來電的語音機器人。