🚨 AI-LECTURER 快訊速報|2026-07-22|5 分鐘速讀

🚨 Google灑出Gemini 3.6 Flash:更省token、更快,你的AI agent該換代了

取材:Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber(Hacker News(AI 高人氣))|完整課同日跟進,見書架
📍 真實場景
阿凱,32歲,接案的AI agent開發者,靠幫小型電商客戶做自動化客服/進貨助理維生

阿凱上個月才用Gemini 3.5 Flash幫客戶做了一個會自己查庫存、寫回覆、呼叫出貨API的agent,這個月一看帳單嚇一跳——原本估的成本因為agent一直重複思考、來回呼叫工具,實際花費超出報價快一倍。

😖 卡住的地方:agent要完成一件事得繞好幾圈(想一下、查一下、再想一下),每一圈都在燒token,客戶只肯付當初報的價錢,多出來的成本全部自己吸收。
💡 讀完這篇,你可以馬上把手上的agent換成新模型測一次,看這次帳單能不能止血。

⚡ 一句話講清楚

Google在這篇公告發布了三支新模型:主力款「Gemini 3.6 Flash」、更陽春的「Gemini 3.5 Flash-Lite」,還有專門抓資安漏洞的「Gemini 3.5 Flash Cyber」。三支的共同賣點都是同一件事:讓代理式工作流程(agentic workflow)讓AI不只回一次話,而是自己拆解任務、反覆思考、呼叫工具,一步步把事情做完的運作方式花更少錢、跑更快。

重點在「3.6 Flash」:官方說它比上一代3.5 Flash少吃17%的輸出tokenAI讀懂或吐出文字時切成的最小計費單位,讀進來的字和吐出來的字都要分開付費,在DeepSWE這種寫程式的基準測試(benchmark)用同一組固定題目考不同模型,比較誰表現比較好的「模擬考」裡甚至省到65%;官方解釋是因為它想事情繞的推理步驟(reasoning steps)AI在給出最終答案前,自己在背後規劃、嘗試、修正的每一個中間動作變少了,同一件事少繞幾圈就做完,價格也調降到每百萬輸出token 7.5美元。

「3.5 Flash-Lite」主打速度,每秒能吐出350個token,是目前這個等級最快的;「3.5 Flash Cyber」則反其道而行——把資安抓漏這種高風險任務切出來,交給一個專精、搭配Google自家「CodeMender」修補代理程式的小模型去做,而不是丟給什麼都會一點的通用模型。

🏃 快速上手三步(今天就能做)

1
打開你正在用的Gemini API後台(ai.google.dev 或 Vertex AI 主控台),把上個月跑agent的用量報表叫出來,記下輸入/輸出token各花了多少。
2
把程式裡呼叫模型的名稱從 gemini-3.5-flash 改成 gemini-3.6-flash(要的是速度就用 gemini-3.5-flash-lite),拿同一組任務跑一次,比對輸出token數量和回應時間有沒有真的下降。
3
用新價格(3.6 Flash:輸入每百萬token 1.5美元、輸出7.5美元)重算一次同樣的用量,跟舊帳單比出百分比差異再決定要不要正式切換;如果你的agent本來就要繞很多圈(工具呼叫、重試特別多),這次的降幅通常會更明顯。

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 官方的17%、65%省token數字,能直接當作你會省多少嗎?
這些數字是Gemini 3.6 Flash跟自家3.5 Flash比較的結果,不是跟其他家模型比,而且65%只出現在DeepSWE這一項寫程式測試裡,17%才是比較有代表性的平均值。實際換模型後務必拿自己agent真正在跑的任務重新量一次,不能直接套用官方的百分比。
🔭 為什麼資安任務要切成獨立的Cyber模型,而不是讓主力模型全能?
把資安抓漏、修代碼這種容錯率低的任務切給一個專精、搭配CodeMender代理程式把關的小模型,反映一個常見的架構取捨:通用模型在高風險領域的可靠度不夠,與其賭它每次都答對,不如用小而專精的模型加上明確的代理流程把不確定性收斂到可控範圍。這也提示agent架構未來會更常見「一個任務一個專用模型」而不是單一模型打天下。