AI-LECTURER 速報課|2026-07-22|約 25 分鐘

Gemini 3.6 Flash 省下17%輸出token:幫你的AI代理算一筆省錢帳

取材:Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber(Hacker News(AI 高人氣))
📍 真實場景
陳威,33歲,一間電商客服外包公司的技術負責人

他維護一套AI代理系統,專門幫客服人員自動寫信回覆客戶的退換貨問題,一天要跑好幾千次

😖 卡住的地方:月初看到API帳單又漲了,老闆問能不能換新模型省錢,但他不知道『輸出token減少17%』這種官方數字,換算成新台幣到底能省多少,講不出具體數字說服老闆
💡 這堂課教你怎麼用Google官方公布的定價和效率數字,自己動手算出換模型後一個月能少花多少錢,拿著算出來的數字去跟老闆或自己交代

🧭 這到底是什麼(白話版)

Google在最近一次發布中,一口氣推出三款新的Gemini Flash系列模型:3.6 Flash、3.5 Flash-Lite,以及專攻資安的3.5 Flash Cyber。這些都屬於「Flash」等級——比頂規的Pro模型小一點、跑得快一點、也便宜一點,專門設計給需要大量重複呼叫AI的場景使用。

這次發布鎖定的對象,是正在打造「代理工作流程(agentic workflow)讓AI自己規劃步驟、連續呼叫工具、把一整串任務從頭到尾自動做完的運作方式,不是你一句一句慢慢問」的開發者與企業。這類應用最痛的地方,往往不是AI夠不夠聰明,而是每次呼叫要花多少tokenAI計費的最小單位,你送進去的字跟AI吐出來的字,都會被切成一塊一塊的token來計費、要等多久(延遲(latency)從你發出請求,到AI回應你的這段等待時間)。

3.6 Flash是這次的主力款,官方在基準測試(benchmark)用同一組題目去考不同模型,方便比較誰表現好的標準化測驗上量到,它比前代3.5 Flash平均少花17%的輸出token就能做完同樣的事,某些測驗甚至少到65%,同時編程、知識型工作、多模態(multimodal)不只處理文字,連圖片、程式碼這些不同形式的資料都看得懂、也答得出來的能力表現都更好。3.5 Flash-Lite則主打「更快更省」,每秒能吐出350個token,專門給要大量、頻繁呼叫AI的代理系統用。

至於3.5 Flash Cyber,是特化給資安任務用的模型,而且刻意搭配Google自家的程式碼資安代理CodeMender一起發布——意思是,做資安不能只靠模型本身聰明,還要有代理幫忙實際執行、查核。官方也順帶預告,更高階的3.5 Pro還在跟合作夥伴測試中,而下一代Gemini 4已經啟動了「至今最雄心勃勃的預訓練」。

🎯 為什麼值得你花時間

省的不是「打折」,是「講話精簡」17%的token減少,代表模型完成同樣任務用更少字數、更少工具呼叫,這跟單純降價不一樣——效率跟價格是兩筆分開、卻同時對你有利的帳。
跑越多次,差異被放大越多偶爾呼叫個幾次AI,17%沒什麼感覺;但像客服信件草稿這種一天跑幾千次的代理系統,17%乘上龐大的呼叫量,月底帳單的差距就會很明顯。
資安不能只靠單一模型撐場3.5 Flash Cyber刻意跟CodeMender代理綁在一起發布,說明資安任務做得好不好,取決於模型加代理架構加查核流程的整體設計,不是模型參數越大就越安全。

⚙️ 它是怎麼運作的

1
同一件事,用更少字講完面對同樣的多步驟任務,3.6 Flash傾向用更少的回合、更少的工具呼叫(tool calls)AI在完成任務過程中,呼叫外部功能(像是執行程式碼、查資料)的次數就做完,反映在平均17%、部分測驗甚至到65%的輸出token下降。
2
價格跟著效率一起往下調Google把新定價(每百萬input token 1.5美元、每百萬output token 7.5美元)直接跟這次的效率提升綁在一起,讓「用得少」加上「算得便宜」兩件事疊加在一起發生。
3
把不同任務分給不同等級的模型做3.6 Flash做重一點的工作,3.5 Flash-Lite搶快搶量,還在測試中的3.5 Pro則留給更吃重的推理任務,有點像把車隊分成快遞車跟貨櫃車,各司其職。
4
資安任務多配一顆「專用引擎」加一個助手3.5 Flash Cyber不是單打獨鬥,而是被設計成跟CodeMender這個抓程式碼漏洞的代理一起運作:模型負責判斷,代理負責實際執行與查核。
5
順便替下一代模型鋪路官方同時預告Gemini 4已經啟動預訓練,這次Flash系列在效率上的打磨,某種程度也是在為下一世代模型的技術路線先做驗證。
三款新模型速覽
模型主打定位關鍵數字備註
3.6 Flash主力工作模型:編程、知識工作、多模態輸出token比3.5 Flash平均少17%(部分測驗到65%);DeepSWE 49% vs 37%;MLE Bench 63.9% vs 49.7%定價:輸入1.5美元/百萬token,輸出7.5美元/百萬token
3.5 Flash-Lite最快、最省的3.5等級模型每秒輸出350個token(依Artificial Analysis Index)主打大量、高頻率的代理呼叫場景
3.5 Flash Cyber專攻資安任務的模型搭配CodeMender資安代理一起運作靠模型加代理架構組合出前沿等級的資安表現

🛠️ 動手做:幫你的AI代理任務算一筆省錢帳

  1. 想一下你(或你觀察到)的AI代理任務,平均每次大概要輸出多少token。不確定精確數字沒關係,先抓個概略值,例如客服回信草稿這種任務,大概是幾千到上萬token。
  2. 想一下這個任務一個月大概會執行幾次。例如一天處理50封信,一個月大概是1,500次。
  3. 把這兩個數字填進下面的計算機裡。
  4. 按下「算給我看」,你會看到:單靠3.6 Flash宣稱的17%輸出token節省、並套用官方公布的每百萬token 7.5美元定價,一個月大約能少花多少錢、一年又是多少。
  5. 把算出來的數字寫下來(或截圖存起來),這就是你這堂課的動手成果——一組你能拿去跟老闆或自己交代的具體省錢依據。
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 Google為什麼一次推出三款「檔次」不同的Flash模型,而不是升級成一個大雜燴模型?
因為服務對象的成本敏感度不一樣:有人在乎品質但可以接受慢一點(3.6 Flash),有人在乎的是海量、高頻率呼叫下的速度與便宜(3.5 Flash-Lite)。分層部署能讓整體擁有成本降到最低,概念上有點像CDN分層快取——不是每個請求都要用最貴的那一顆。
🔭 為什麼官方特別強調『輸出token減少17%』,而不是只講『模型變聰明了』?
在代理工作流程裡,成本結構是token數乘以呼叫次數乘以單價。模型『變聰明』如果換算不出token量的下降,對要規模化部署代理系統的人來說是無感的。這代表Google在優化對的KPI——每個任務的總成本——而不是單純堆高benchmark分數。
🔭 3.5 Flash Cyber為什麼要跟CodeMender這個代理綁在一起講,而不是單獨賣一顆模型?
資安任務的成功率,從來不是模型單點能力決定的,而是模型加工具鏈加驗證流程的整體設計。這反映『代理架構』跟『模型』要一起優化,單純換一顆更強的模型,不會自動讓系統變安全。
🔭 Gemini 4現在才說『剛啟動預訓練』,為什麼不直接給發布時間?
預訓練是模型開發中最燒資源、風險也最高的階段,結果好壞要等訓練跑完才知道。官方選擇低調預告而不給確切期程,是在管理市場期待,避免做出到時候兌現不了的承諾。

📝 隨堂考(點選答案,立即回饋)

Q1. 根據文章,3.6 Flash相較3.5 Flash,在Artificial Analysis Index上平均減少多少輸出token?
✅ 文章說明整體平均約減少17%,65%是像DeepSWE這類特定測驗中觀察到的最高個案數字,不是全面平均值。
Q2. 3.5 Flash-Lite最主打的賣點是什麼?
✅ 官方標明它是最快、最省的3.5等級模型,每秒可輸出350個token,專為大量代理呼叫設計。
Q3. 3.5 Flash Cyber要真正發揮資安效果,靠的是什麼組合?
✅ 文章明確提到,成功的資安應用需要模型跟代理基礎設施仔細協調,3.5 Flash Cyber是搭配CodeMender一起發布的。
Q4. 若某個代理任務原本每月要輸出200萬(2,000,000)個token,換成3.6 Flash後省下17%,大約省下多少個token?
✅ 2,000,000乘以17%等於340,000,也就是約34萬個token,這是純粹靠效率提升省下來的量,還沒算進價格本身的效果。
Q5. 關於Gemini 4,文章透露了什麼進度?
✅ 文章只說Gemini 4已經開始最雄心勃勃的一次預訓練,並未提到發布時間或定價方式。

🃏 翻牌記憶卡(先想答案,再點開對答)

3.6 Flash的定位點我翻面
主力工作模型,編程、知識工作、多模態都更強,還比3.5 Flash省17%輸出token
3.5 Flash-Lite的定位點我翻面
最快最省的3.5等級模型,每秒輸出350個token,專為大量代理呼叫設計
3.5 Flash Cyber搭配了誰點我翻面
搭配CodeMender程式碼資安代理,組合出前沿等級的資安任務表現
3.6 Flash的定價點我翻面
每百萬input token 1.5美元,每百萬output token 7.5美元
DeepSWE分數對比點我翻面
3.6 Flash 49%對上3.5 Flash 37%,顯示更精準、更少亂改程式碼
Gemini 4現況點我翻面
官方證實已啟動至今最雄心勃勃的預訓練,但未提供發布時間

✅ 離開前自測(全勾=這課真的學會了)

0%