客戶抱怨現有的AI電話客服「聽你講完才開始想、想完才回話」,顧客常常講到一半就不耐煩掛掉
Google 這次一口氣發布兩款「語音代理能用講話的方式跟你來回互動、還能順便幫你操作其他工具或查資料的AI」模型:一般版 Gemini 3.8 Live,以及進階版 Gemini 3.8 Live Extended Thinking。兩者的重點不是「聊天更會接話」,而是能做到 近即時幾乎沒有明顯延遲,你講完幾乎馬上有回應,不用乾等好幾秒 的對話體驗,而且能一邊講話、一邊在背景默默把你交代的任務(例如查資料、呼叫某個工具)做完,不用中斷對話。
一般版 Gemini 3.8 Live 主打便宜、能大量部署,同時支援 視覺定位讓AI看得懂鏡頭前的畫面,並把畫面內容跟你正在講的話對上,而不是只聽聲音,可以在對話中途自動偵測並切換 97 種語言,你不用手動選語言、講中文夾英文它也能跟上。進階版 Extended Thinking 則是為複雜任務設計,特色是「邊推理邊講話」——先用「讓我查一下…」這類口語提示讓你知道它在處理,再用類似講解進度的方式,一步一步告訴你多步驟背景任務做到哪了,不會讓你對著空氣乾等。
官方也附上了具體的 基準測試業界公認、用來公平比較不同AI模型能力的一套考題和分數 成績:Extended Thinking 在 Artificial Analysis 的「語音對語音品質指標」拿下全球第一(82.6分),在代理任務完成度測試 τ-Voice 上是 68.6%,在 Sierra 的銀行業客服測試 τ-Voice-banking 上是 35.1%,推理類測試 Big Bench Audio 則拿下 97.7%,同時價格仍算有競爭力;一般版 Gemini 3.8 Live 則在使用者偏好度測試 Speech Agent Arena 拿下第二名,主打的是便宜好用。這些模型也已經開放給 Agora、LangChain、LiveKit、Pipecat、Vercel 等開發平台串接使用。