📍 真實場景
陳威,33歲,一間電商客服外包公司的技術負責人
他維護一套AI代理系統,專門幫客服人員自動寫信回覆客戶的退換貨問題,一天要跑好幾千次
😖 卡住的地方:月初看到API帳單又漲了,老闆問能不能換新模型省錢,但他不知道『輸出token減少17%』這種官方數字,換算成新台幣到底能省多少,講不出具體數字說服老闆
💡 這堂課教你怎麼用Google官方公布的定價和效率數字,自己動手算出換模型後一個月能少花多少錢,拿著算出來的數字去跟老闆或自己交代
🧭 這到底是什麼(白話版)
Google在最近一次發布中,一口氣推出三款新的Gemini Flash系列模型:3.6 Flash、3.5 Flash-Lite,以及專攻資安的3.5 Flash Cyber。這些都屬於「Flash」等級——比頂規的Pro模型小一點、跑得快一點、也便宜一點,專門設計給需要大量重複呼叫AI的場景使用。
這次發布鎖定的對象,是正在打造「代理工作流程(agentic workflow)讓AI自己規劃步驟、連續呼叫工具、把一整串任務從頭到尾自動做完的運作方式,不是你一句一句慢慢問」的開發者與企業。這類應用最痛的地方,往往不是AI夠不夠聰明,而是每次呼叫要花多少tokenAI計費的最小單位,你送進去的字跟AI吐出來的字,都會被切成一塊一塊的token來計費、要等多久(延遲(latency)從你發出請求,到AI回應你的這段等待時間)。
3.6 Flash是這次的主力款,官方在基準測試(benchmark)用同一組題目去考不同模型,方便比較誰表現好的標準化測驗上量到,它比前代3.5 Flash平均少花17%的輸出token就能做完同樣的事,某些測驗甚至少到65%,同時編程、知識型工作、多模態(multimodal)不只處理文字,連圖片、程式碼這些不同形式的資料都看得懂、也答得出來的能力表現都更好。3.5 Flash-Lite則主打「更快更省」,每秒能吐出350個token,專門給要大量、頻繁呼叫AI的代理系統用。
至於3.5 Flash Cyber,是特化給資安任務用的模型,而且刻意搭配Google自家的程式碼資安代理CodeMender一起發布——意思是,做資安不能只靠模型本身聰明,還要有代理幫忙實際執行、查核。官方也順帶預告,更高階的3.5 Pro還在跟合作夥伴測試中,而下一代Gemini 4已經啟動了「至今最雄心勃勃的預訓練」。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 Google為什麼一次推出三款「檔次」不同的Flash模型,而不是升級成一個大雜燴模型?
因為服務對象的成本敏感度不一樣:有人在乎品質但可以接受慢一點(3.6 Flash),有人在乎的是海量、高頻率呼叫下的速度與便宜(3.5 Flash-Lite)。分層部署能讓整體擁有成本降到最低,概念上有點像CDN分層快取——不是每個請求都要用最貴的那一顆。
🔭 為什麼官方特別強調『輸出token減少17%』,而不是只講『模型變聰明了』?
在代理工作流程裡,成本結構是token數乘以呼叫次數乘以單價。模型『變聰明』如果換算不出token量的下降,對要規模化部署代理系統的人來說是無感的。這代表Google在優化對的KPI——每個任務的總成本——而不是單純堆高benchmark分數。
🔭 3.5 Flash Cyber為什麼要跟CodeMender這個代理綁在一起講,而不是單獨賣一顆模型?
資安任務的成功率,從來不是模型單點能力決定的,而是模型加工具鏈加驗證流程的整體設計。這反映『代理架構』跟『模型』要一起優化,單純換一顆更強的模型,不會自動讓系統變安全。
🔭 Gemini 4現在才說『剛啟動預訓練』,為什麼不直接給發布時間?
預訓練是模型開發中最燒資源、風險也最高的階段,結果好壞要等訓練跑完才知道。官方選擇低調預告而不給確切期程,是在管理市場期待,避免做出到時候兌現不了的承諾。
📝 隨堂考(點選答案,立即回饋)
Q1. 根據文章,3.6 Flash相較3.5 Flash,在Artificial Analysis Index上平均減少多少輸出token?
✅ 文章說明整體平均約減少17%,65%是像DeepSWE這類特定測驗中觀察到的最高個案數字,不是全面平均值。
Q2. 3.5 Flash-Lite最主打的賣點是什麼?
✅ 官方標明它是最快、最省的3.5等級模型,每秒可輸出350個token,專為大量代理呼叫設計。
Q3. 3.5 Flash Cyber要真正發揮資安效果,靠的是什麼組合?
✅ 文章明確提到,成功的資安應用需要模型跟代理基礎設施仔細協調,3.5 Flash Cyber是搭配CodeMender一起發布的。
Q4. 若某個代理任務原本每月要輸出200萬(2,000,000)個token,換成3.6 Flash後省下17%,大約省下多少個token?
✅ 2,000,000乘以17%等於340,000,也就是約34萬個token,這是純粹靠效率提升省下來的量,還沒算進價格本身的效果。
Q5. 關於Gemini 4,文章透露了什麼進度?
✅ 文章只說Gemini 4已經開始最雄心勃勃的一次預訓練,並未提到發布時間或定價方式。