🚨 AI-LECTURER 快訊速報|2026-09-16|5 分鐘速讀

🚨 Google一次發兩款即時語音AI:一款省成本、一款拼推理,你的語音客服該升級了嗎

取材:Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(Google DeepMind Blog)|完整課同日跟進,見書架
📍 真實場景
小美,幫電商品牌接案顧語音客服機器人的一人接案者

客戶抱怨現有的AI電話客服「聽你講完才開始想、想完才回話」,顧客常常講到一半就不耐煩掛掉

😖 卡住的地方:現在的語音客服卡在「聽 → 轉文字 → 丟給AI想 → 轉回語音」這種一段一段接力的做法,每一段接力都在浪費使用者等待的時間,而且沒辦法一邊回話一邊去查資料或執行動作
💡 讀完你就能判斷:你現在用的語音客服方案是不是已經落後,以及該去哪裡查兩款新模型的實測分數和定價來評估要不要換

⚡ 一句話講清楚

Google 這次一口氣發布兩款「語音代理能用講話的方式跟你來回互動、還能順便幫你操作其他工具或查資料的AI」模型:一般版 Gemini 3.8 Live,以及進階版 Gemini 3.8 Live Extended Thinking。兩者的重點不是「聊天更會接話」,而是能做到 近即時幾乎沒有明顯延遲,你講完幾乎馬上有回應,不用乾等好幾秒 的對話體驗,而且能一邊講話、一邊在背景默默把你交代的任務(例如查資料、呼叫某個工具)做完,不用中斷對話。

一般版 Gemini 3.8 Live 主打便宜、能大量部署,同時支援 視覺定位讓AI看得懂鏡頭前的畫面,並把畫面內容跟你正在講的話對上,而不是只聽聲音,可以在對話中途自動偵測並切換 97 種語言,你不用手動選語言、講中文夾英文它也能跟上。進階版 Extended Thinking 則是為複雜任務設計,特色是「邊推理邊講話」——先用「讓我查一下…」這類口語提示讓你知道它在處理,再用類似講解進度的方式,一步一步告訴你多步驟背景任務做到哪了,不會讓你對著空氣乾等。

官方也附上了具體的 基準測試業界公認、用來公平比較不同AI模型能力的一套考題和分數 成績:Extended Thinking 在 Artificial Analysis 的「語音對語音品質指標」拿下全球第一(82.6分),在代理任務完成度測試 τ-Voice 上是 68.6%,在 Sierra 的銀行業客服測試 τ-Voice-banking 上是 35.1%,推理類測試 Big Bench Audio 則拿下 97.7%,同時價格仍算有競爭力;一般版 Gemini 3.8 Live 則在使用者偏好度測試 Speech Agent Arena 拿下第二名,主打的是便宜好用。這些模型也已經開放給 Agora、LangChain、LiveKit、Pipecat、Vercel 等開發平台串接使用。

🏃 快速上手三步(今天就能做)

1
查價格與分數到 ai.google.dev 的 Gemini API 文件頁面,找「Gemini 3.8 Live」與「Gemini 3.8 Live Extended Thinking」兩個模型代號的語音定價,對照上面提到的 82.6 分(語音品質)、35.1%(銀行客服任務完成度)這些分數,跟你現在用的語音客服方案比一比,值不值得換。
2
動手測語言自動切換如果你有 Google AI Studio 帳號,開一個新的 Live API 對話,故意中英文夾雜著講話,看它是不是真的不用你手動選語言,就能在 97 種支援語言之間自動接話——這是這次公告特別強調的新能力。
3
判斷你現在的方案是不是「三段式」老架構問清楚你現在用的(或打算導入的)語音客服廠商,走的是原生 Live API(可以邊執行背景任務邊講話、邊推理邊回應),還是傳統「語音轉文字 → 丟給文字模型想 → 再轉回語音」的三段接力做法。判斷標準很簡單:如果對方講到一半明顯停頓、或沒辦法邊查資料邊講話,就是還在用舊架構,這正是這次新模型要解決的痛點。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 「邊推理邊講話」聽起來很厲害,但這在系統設計上要付出什麼代價?
要做到嘴巴講話跟腦袋思考同時進行,代表系統得把「規劃下一步要做什麼」跟「把話講出口」拆成兩條可以並行跑的路徑,這樣使用者才不用乾等。但風險也在這裡:如果後面想清楚的內容跟前面已經講出去的話對不上,AI要嘛硬凹圓過去、要嘛得中途改口認錯——這種容錯度在客服這種對話裡還好,但放到銀行客服(τ-Voice-banking)這種一句話講錯就可能是金錢糾紛的場景,工程上就得多一層「講話前先確認不會被後面推翻」的保險機制,而這一層保險本身就是額外的複雜度跟延遲成本。
🔭 Google 同時推「便宜版」跟「拼智力版」,而不是直接出一款全能模型,這代表什麼樣的產品策略?
這是很清楚的「分層」打法:大部分對話其實很簡單(問營業時間、查訂單狀態),用便宜的一般版 3.8 Live 撐量就好;只有少數真的複雜的任務(banking 這種需要多步驟推理跟精準度的場景)才動用貴的 Extended Thinking。這對開發者的實際影響是:你的系統不能只接一顆模型就了事,而是要在應用層自己做「路由判斷」——先用便宜模型接住對話,判斷夠複雜再轉給貴的模型接手。這會讓架構多一道判斷邏輯,但換來的是大幅省成本;值不值得做這件事,取決於你的對話裡有多少比例真的複雜到需要動用貴模型。