📍 真實場景
電商公司的後端工程師,負責維護客服系統
老闆要求評估導入語音客服機器人取代部分真人客服,同時 KPI 要求成本不能超支
😖 卡住的地方:現有的語音助理常常「聽不懂就當機」,或是要等好幾秒才回話,顧客體驗差,想找更流暢、更會處理複雜問題的方案
💡 讀完你會知道 Google 這次推出的兩款語音 AI 有什麼差異,以及今天就能做的三個評估動作
⚡ 一句話講清楚
Google 這次一口氣推出兩款新的語音代理(Voice Agent)能用語音跟你對話、還能主動幫你完成任務的AI程式,不只是回答問題而已,分別是主打便宜好用的 Gemini 3.8 Live,以及主打燒腦任務的 Gemini 3.8 Live Extended Thinking。差異在於後者會一邊推理(Reasoning)AI在回答前,先在心裡一步一步拆解問題、想清楚邏輯的過程一邊講話,不會讓你等到不耐煩。
這兩款模型都具備即時語音處理(Real-time Speech Processing)AI能在你講話的同時就開始理解、幾乎沒有延遲,像真人對話一樣的能力,還能自動偵測、切換 97 種語言,甚至能一邊聊天一邊在背景默默執行API 呼叫(API Call)程式向遠端服務發送請求,取得資料或觸發某個動作,例如叫它去查天氣、訂機票,等於它可以先接話穩住你,再默默把事情辦好。
對工程師來說,重點是這兩款模型都能直接透過 Gemini Live API 串接,不用自己從頭訓練語音模型,LangChain、LiveKit 這些常見的開發平台也都已經支援,等於是拿現成料理包直接上菜,能省下大量前期開發時間。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 一邊推理一邊講話聽起來很潮,但這是不是也代表回答品質跟回答速度的取捨,被悄悄轉嫁到了你的荷包上?
Extended Thinking 能一邊思考一邊講話,是為了不讓使用者乾等,但推理越深、算力消耗通常越高,官方公告雖強調維持極具競爭力的價格,言下之意是:若你的產品有大量需要深度推理的請求,帳單很可能不會維持在便宜模型的量級。評估時要把「回應流暢度」跟「單次請求成本」放在同一張表格上比較,不能只看demo好不好用就下決定。
🔭 支援 97 種語言中途自動切換,對多語言產品是加分,但會不會也是隱藏的品質地雷?
自動偵測語言切換,代表系統要在毫秒等級內判斷這句話是否已經換語言,遇到中英夾雜、方言腔調、或顧客只是講錯一個字這種邊界情況,誤判率會直接影響體驗。導入前建議先設計一組刻意混雜語言的測試腳本,而不是預設官方展示的乾淨範例就等於你真實用戶的輸入樣態。