🚨 AI-LECTURER 快訊速報|2026-07-22|5 分鐘速讀

🚨 Google發布Gemini 3.6 Flash:同款任務省17%輸出token,還多一顆資安專用模型

取材:Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber(Google DeepMind Blog)|完整課同日跟進,見書架
📍 真實場景
剛用 Gemini API 幫小型新創架設AI客服機器人的技術負責人

他讓AI客服自己判斷問題、查資料庫、呼叫好幾個工具才回覆客人,最近月底核帳單時嚇了一跳

😖 卡住的地方:同一個問題,AI常常要繞好幾輪對話、呼叫好幾次工具才能答對,每繞一圈都在燒token,老闆一直問「這個月帳單怎麼又漲了」
💡 讀完你就能判斷這次升級能不能真的幫你省錢,還是要再觀望

⚡ 一句話講清楚

Google這次一口氣發布三顆新模型,主角是接替3.5 Flash的「3.6 Flash」。它是主打代理式工作流(Agentic workflow)讓AI自己拆解任務、決定要呼叫哪些工具、一步一步做完,而不是你問一句它答一句的主力機種。這次改款的重點不是「變得更聰明」,而是「變得更省」:官方測出同樣任務用掉的輸出tokenAI產生回答時計費的最小單位,AI講的每個字或字的一部分都要另外算錢比舊版少了17%,某些測試項目甚至省下65%。

為什麼省token這麼重要?因為代理式工作流是一步步來的:AI要思考、呼叫工具、看結果、再思考,每一輪都要花token。根據官方公布的基準測試(Benchmark)用同一套固定題目去測不同AI模型,方便直接比較誰強誰弱的成績單,3.6 Flash完成同樣任務所需的思考步驟和工具呼叫次數都變少了,等於少繞幾圈路就把事情辦完,帳單自然變薄。官方同時也調降了牌價(每百萬輸入token 1.5美元、輸出token 7.5美元),等於「跑得更省、油價還更便宜」。

除了主力款,這次還多了兩顆專用款:一顆是3.5 Flash-Lite,犧牲一點能力換取速度和成本,官方測出每秒能吐出350個token,適合要求「秒回」的場景;另一顆是3.5 Flash Cyber,專門訓練來抓程式漏洞、搭配Google自家的資安工具CodeMender使用,不是給一般聊天或客服用的。

🏃 快速上手三步(今天就能做)

1
查你現在用哪顆模型打開你串接Gemini API的後台設定或程式碼,搜尋模型名稱字串(通常寫在類似 model="gemini-3.5-flash" 的設定裡),確認你現在跑的是舊版3.5 Flash,還是已經有升級選項可用。
2
挑一個真實案例做新舊對比找一個你的AI客服或agent最近答得慢、呼叫工具次數特別多的真實對話,分別用舊的3.5 Flash和新的3.6 Flash各跑一次,比對API回傳裡的usage(token用量)欄位,看輸出token是否真的省了將近17%。
3
換模型前先核對定價頁到Google AI Studio或Vertex AI的定價頁面,確認3.6 Flash的正式牌價(每百萬輸入token 1.5美元、輸出token 7.5美元)是否已在你的帳號地區生效,並記得這是「單價沒降多少、但用量變少」的組合,不能只看單價高低就下定論。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 官方講的17%省token,是模型變聰明,還是單純話變少?
官方數據把兩種效果混在一起算:一種是AI推理效率真的變高(少繞路就找到答案),另一種只是模型輸出變得比較「惜字如金」(reduced verbosity)。工程上要注意——如果你的系統有依賴AI輸出的詳細格式或說明文字去做後續解析,話變少可能會讓既有的解析規則跟著壞掉。升級前該做的是拿真實案例跑回歸測試,而不是看到「省17%」就直接切換。
🔭 為什麼資安任務要另外訓練一個Cyber模型,而不是讓3.6 Flash自己來?
抓漏洞、寫安全修補程式的錯誤成本比一般聊天高很多——改錯一行code可能引入新漏洞。Google選擇用「小而專」的模型搭配專屬的CodeMender agent做針對性訓練,而不是靠一個通才模型硬撐。這反映一個趨勢:任務風險夠高、夠垂直的時候,細分專用模型仍然划算,不是所有場景都該丟給同一顆大模型處理。