🎓 AI-LECTURER 週末主題課|2026-07-26|約 150 分鐘(可分次讀)

AI 代理人的兩張臉:省錢分工,也能找出資安漏洞

彙整本週素材:Exploit brokers pay $500k for WordPress 、Show HN: Cactus Hybrid: We taught Gemma 、Claude Cookbook、Introducing Gemini 3.6 Flash, 3.5 Flash-、Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.、Kimi K3 Is Competitive with Fable; Kimi
📍 真實場景
在小公司負責行銷企劃的雅婷,平常靠 AI 聊天機器人寫文案、整理資料

她在新聞上同時看到『AI 代理人自己找出網站漏洞、賺進 50 萬美元懸賞』,以及 Google、Kimi 等公司不斷推出『更省更快』的新模型,兩則消息對不起來,只覺得世界變化太快

😖 卡住的地方:看不懂『混合式模型』『代理人』『路由』這些新詞,不知道這些技術進展跟自己每天用的 AI 工具有什麼關係,也擔心 AI 這麼強會不會被拿去做壞事
💡 這門課帶她一路看懂:AI 為什麼開始學會『知道自己不會』、廠商為何拼命推出小模型、開發者怎麼把這些模型組成真正做事的代理人,以及這股力量強到能挖資安漏洞時,對她的工作與資安意識代表什麼
第 1 單元|是什麼:AI 開始學會『知道自己可能答錯』

🧭 本單元白話講

這系列要拆解的,是AI代理人的兩張臉:一張臉負責省錢分工,把工作丟給剛好夠用的模型就好;另一張臉則負責更深的任務,甚至能挖出資安漏洞。要看懂省錢分工這張臉,得先搞懂一件事:怎麼讓手機上那顆小小的AI模型,自己知道『我這次可能答錯了』?

答案來自一間叫Cactus的公司,他們幫Google的小模型Gemma 4 E2B(可以想成是縮小版、能塞進手機裡跑的AI)動了一個手腳:訓練它學會替自己打分數。原文提到,他們在模型檔案(原文用checkpoint稱呼,你可以把它想成是訓練好、可以直接拿來用的AI大腦存檔)裡塞進了探針(probes)藏在模型裡面、專門負責幫每次回答打分數的小機制,不是額外叫另一個AI來評分,而是模型自己內建的能力,每次回答完都會順便給自己打一個0到1之間的信心分數(confidence)AI對這次自己的回答有多少把握的數字,愈接近1代表愈有把握,愈接近0代表愈可能是亂猜的

這個信心分數不是模型自己在答案文字裡亂寫一句『我不太確定』,而是用結構化的資料格式回傳,方便寫程式的人直接用程式去判斷、去做決定。原文給的邏輯很簡單,幾乎就是一句話:信心分數如果低於0.85,就把同一個問題轉交給雲端更強的大模型重新回答一次;如果分數夠高,手機自己回答的答案就直接採用,完全不用連網、不用把問題傳到遠端伺服器。

這樣設計圖的是什麼?是同時把裝置端(on-device)直接在你手上的手機或電腦執行,不用把資料傳出去給遠端伺服器運算的『快、省錢、保護隱私』,跟雲端大模型的『準、但慢、還要花錢連網』這兩種好處兜在一起。原文的基準測試(benchmark)一套固定的考題,專門用來比較不同AI模型表現好壞的標準測驗數字很直接:在ChartQA(看圖表回答問題)這類任務裡,手機上的Gemma 4 E2B混合式模型只要把15%到20%比較沒把握的問題轉交雲端,整體表現就能追上完全跑在雲端的Gemini 3.1 Flash-Lite模型——換句話說,八成以上的問題,手機自己就搞定了。

這正是省錢分工這張臉的雛形:不是每個問題都動用最貴、最強的AI,而是先讓便宜、私密、快速的小模型上場,只有在它自己承認『沒把握』的少數時刻,才把工作轉交給更貴的大模型。下一單元會接著問:為什麼整個業界現在都在拼命把模型做小、做快,而不是反過來一路把模型做大?

⚙️ 脈絡拆解

1
手機先自己試著回答使用者問問題時,先由手機裡的小模型Gemma 4 E2B自己嘗試回答,不用等雲端,速度快、也不用把問題傳出去。
2
同時偷偷幫自己打分數回答的同時,模型內建的信心探針會給這次答案打一個0到1的信心分數,這是模型訓練時就學會的能力,不是額外呼叫別的AI來評分。
3
分數夠高就直接用如果信心分數夠高(原文的示範門檻是0.85),就直接把手機自己回答的答案顯示給使用者,整個過程都留在裝置端,沒有資料離開手機。
4
分數不夠就轉交雲端重答如果分數低於門檻,系統會把同一個問題重新送給更強的雲端大模型(例如Gemini 3.1 Flash-Lite)處理一次,用比較貴、比較慢但比較準的方式,換取正確答案。
5
使用者全程無感切換不管這次是手機自己答的,還是轉交雲端答的,使用者看到的都只是最終答案,不需要自己判斷這次是誰在回答。
不同任務中,手機模型只要轉交多少比例給雲端,就能追上純雲端大模型的表現
測試項目(考的是什麼)任務類型需要轉交雲端的比例
ChartQA看圖表回答問題15–20%
MMBench看圖片回答問題30–35%
MMLU-Pro各科知識問答45–55%

🔍 程式碼漫遊(點有 ● 的行看白話講解)

混合式AI聽起來很厲害,但決定『要不要轉交雲端』的邏輯,原文示範用的就是一句最簡單的if判斷

if confidence < 0.85:
💬 如果剛剛那個信心分數低於0.85(滿分是1),就代表這次手機自己回答的把握不夠
answer = ask_a_bigger_model(prompt)
💬 那就把同一個問題,重新丟給雲端更強的大模型回答一次,用answer把新答案蓋過去

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 如果把0.85這個信心門檻調得更高,例如調到0.95,會發生什麼事?
門檻愈高,代表手機對自己愈沒信心也要轉交,結果是更多問題會被送到雲端,答案品質會更接近純雲端大模型,但也代表更常需要連網、回應變慢、雲端費用變高;反過來把門檻調低,雖然省錢又快,但手機在勉強有把握的情況下也會硬答,答錯的風險就會提高。這個信心門檻本質上就是在『答得準』跟『省錢省時間』這兩件事中間找一個可以接受的平衡點,而不是有一個絕對正確的數字。

📝 隨堂考(點選答案,立即回饋)

Q1. 根據原文,Cactus讓Gemma 4 E2B 混合式模型多了哪個關鍵能力?
✅ 原文提到「we ship probes inside the checkpoint that score every answer with a confidence between 0 and 1」,重點不是把模型變大,而是讓模型多一個『自評信心』的能力。
Q2. 在ChartQA(看圖表回答問題)這項測試中,Gemma 4 E2B混合式模型只要把多少比例的問題轉交雲端,就能追上雲端大模型Gemini 3.1 Flash-Lite的表現?
✅ 原文表格顯示,ChartQA只要轉交15–20%的問題給雲端、其餘由手機自己回答,整體表現就能跟純雲端模型打平,代表大多數問題手機自己就能搞定。
第 2 單元|為何現在發生:為什麼大家都在拼命推出更小更快的模型

🧭 本單元白話講

上一講我們看到 AI 開始具備『知道自己可能答錯』的能力,這聽起來像是模型變聰明的故事。但這一講要說的,其實是另一半的故事:光是聰明還不夠,如果要把這些能力真的搬進日常運作、每天要跑成千上萬次的自動化任務,還得夠快、夠便宜才養得起。2026 年 Google 一口氣端出三款新的 Gemini Flash 模型,正是想解決這個問題。

Google 在發表文章裡說得很直白:想把 AI 組裝成能真正做事的代理式工作流程讓 AI 自己規劃步驟、決定該呼叫哪些工具,一步步把整個任務做完,而不是你問一句它才答一句的開發者,最在乎的不是模型有多厲害,而是三件事——tokenAI 處理文字時用來計費與計速的最小單位,可以想成是一小塊一小塊被拆開的文字,輸入越長、模型想得越多,消耗的 token 就越多用量夠不夠省、回應夠不夠快(延遲從你發出請求到 AI 給出回應之間要等待的時間要低)、還有結果夠不夠穩定可靠。原因很現實:一個代理人做一件任務,往往要在背後偷偷呼叫模型好幾十次甚至上百次,每次呼叫慢一點、貴一點,乘上這麼多次之後,時間和帳單都會被狠狠放大。

這次 Google 沒有推出一個『什麼都要最強』的巨無霸,而是把工作拆成三份分工:3.6 Flash 是扛主力工作的模型,負責寫程式、知識工作和多模態任務,主打『比上一代更省又更準』;3.5 Flash-Lite 專攻極速與便宜,是同等級裡跑最快的版本,每秒能吐出 350 個 token;3.5 Flash Cyber 則是專門為資安任務打造的模型,搭配一套叫做 CodeMender 的專用代理架構,專門去揪程式碼裡的安全漏洞。三款模型各司其職,而不是每次都硬派最貴的模型上場。

數字上最直接的證據是效率與價格。根據 Artificial Analysis Index 的測試,3.6 Flash 平均比上一代 3.5 Flash 少耗 17% 的輸出 token,在部分高強度的程式測試(DeepSWE)裡甚至省下多達 65%;每個輸出 token 的單價也更低。定價上,3.6 Flash 是每百萬輸入 token 1.5 美元、每百萬輸出 token 7.5 美元,比舊版更便宜,直接讓『跑一次代理任務』的整體成本降下來。換句話說,同一筆預算,現在能讓代理人多跑好幾輪任務。

這正是『為什麼現在』的答案:當 AI 不再只是回答單一問題,而是要被大量、重複地部署去自動完成工作時,決定勝負的關鍵從『誰的模型最強』悄悄轉移成『誰能用最少的錢和時間把工作做完』。這也解釋了為什麼整個產業這陣子都在拼命推出更小、更快的模型版本,而不是只顧著把旗艦模型越做越大。

⚙️ 脈絡拆解

1
痛點:代理人養得起,才跑得動當 AI 要一步步自己執行任務,常常一次任務背後就要偷偷呼叫模型幾十次,只要每次呼叫慢一點、貴一點,乘起來的時間和帳單都會被放大,這是開發者最頭痛的地方。
2
解法:不做巨無霸,改做分工三兄弟Google 這次沒有只推出一個更強的旗艦模型,而是端出 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber 三款,各自負責『主力工作』『極速便宜』『專攻資安』,讓開發者依任務挑合適的模型。
3
數字驗證:更省 token、價格更低3.6 Flash 平均少耗 17% 輸出 token,部分測試省下 65%,定價也調降到每百萬輸出 token 7.5 美元,直接壓低了『跑一次代理任務』的成本。
4
資安任務也交給輕量模型處理3.5 Flash Cyber 搭配專門的 CodeMender 代理架構,顯示連程式碼資安檢測這種精細工作,也開始能靠『輕量模型 + 專用代理』的組合來完成,而不必動用最頂級的模型。
Gemini Flash 家族三款新模型分工
模型主打特色適合場景
3.6 Flash主力工作馬,少耗 17% 輸出 token,部分任務省下高達 65%,單價更低日常寫程式、知識工作、多模態任務
3.5 Flash-Lite3.5 級距中最快,每秒可吐出 350 個 token需要極速回應、大量重複呼叫的代理任務
3.5 Flash Cyber專攻資安,搭配 CodeMender 代理架構程式碼資安檢測與修補

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 Google 同時發布『更聰明』的 3.6 Flash 和『更陽春』的 3.5 Flash-Lite,不會互相打架嗎?
不會,因為兩者鎖定的是不同戰場。3.6 Flash 拚的是『同樣品質下更省更快』,適合需要深度思考的主力任務;3.5 Flash-Lite 拚的是『能用就好、但快到極致又便宜到極致』,適合大量重複、對品質要求沒那麼高的自動化呼叫。當一個代理人要完成一件複雜工作,常常會混用不同等級的模型分工——簡單的步驟丟給便宜快速的版本,關鍵判斷才交給更強的版本,這正是文中提到『規模化代理式工作流程』的實際做法。
🔭 為什麼專攻資安的 3.5 Flash Cyber 特別值得注意?
因為它不是單靠模型本身厲害,而是『模型 + 專用代理架構(CodeMender)』搭配出來的成果。文中強調,成功的資安應用需要模型和代理基礎架構精心協同運作,而不是丟一個聰明模型就了事。這也預告了下一講要談的重點:開發者怎麼把這些又快又省的模型,組裝成真正會做事、甚至會抓漏洞的代理人。

📝 隨堂考(點選答案,立即回饋)

Q1. 根據文中資料,3.6 Flash 平均比 3.5 Flash 省下多少比例的輸出 token?
✅ 文中指出根據 Artificial Analysis Index,3.6 Flash 平均比 3.5 Flash 少耗 17% 的輸出 token;65% 是在 DeepSWE 這類特定高強度測試中觀察到的最高情況,不是平均數字;350 其實是 3.5 Flash-Lite 每秒能吐出的 token 數,跟省下的比例無關。
Q2. 為什麼『代理式工作流程』特別在乎模型的速度與 token 效率,而不是只看誰最聰明?
✅ 文中提到打造正式環境代理人的開發者需要更高的 token 效率、更低的延遲與更穩定的表現,原因是代理人執行任務時往往要多步驟、多次呼叫模型,些微的效率差距會在重複呼叫後被放大成顯著的成本與時間差異。
第 3 單元|怎麼運作:開發者如何把這些模型組裝成真正會做事的代理人

🧭 本單元白話講

上一堂提到,大家搶著推出更小更快的模型,是因為便宜的模型才撐得起大量分工。這一堂要往下一層看:開發者實際上是怎麼把這些模型「組裝」成真正會動手做事的代理人?答案藏在兩份資料裡——一份是 Anthropic 整理的 Claude 開發食譜,教你怎麼幫AI裝上手腳;另一份是 Kimi K3 與 Fable 5 的實測比較,告訴你分工要怎麼分才划算。

先看「怎麼讓AI真的會動手做事」。Claude 開發食譜裡第一招叫 Programmatic tool calling(程式化工具呼叫)讓AI直接寫一段程式碼去呼叫工具,而不是每講一句話就要停下來等一次回覆,省下大量來回溝通的時間與費用。想像你請一個助理去辦十件事,若每辦一件就回頭跟你確認一次,會很慢;但若你讓助理自己寫好整份待辦清單再一次執行,效率就高很多。

第二招是解決「工具太多、AI不知道要挑哪一個」的問題。當一個代理人手上有成千上萬個工具(例如串接各種公司內部系統),逐一比對說明書會很慢。食譜裡用的是 語意搜尋(embeddings)不是比對關鍵字文字一模一樣,而是比對「意思相不相近」,讓AI能在大量選項中快速鎖定最符合需求的那一個,讓工具查找像是「猜到你在想什麼」一樣快。第三招則是 自動壓縮記憶(context compaction)AI在長時間對話或工作時,會自動把之前講過的內容摘要濃縮,避免因為「記得的東西太多」而卡住或忘記重點,這對需要跑很久的代理人任務特別重要,畢竟沒有人希望AI工作到一半突然「失憶」。

光有「會用工具、記得住事情」的骨架還不夠,真正要做到「省錢又好用」,還得靠模型之間的分工。這就是 Kimi K3(開源)與 Fable 5(Anthropic旗下)那份實測比較要講的事:兩邊在約一千個真實代理人任務上對戰,涵蓋修程式碼bug、跑終端機操作、演算法題、多語言程式、法律任務五大類。乍看之下兩者打成平手——光是修bug這項,K3拿92.4%、Fable拿92.6%,差距小到可以說是平手。

但拆開來看,兩者其實各有專精:K3在數學符號運算、開發工具、還有需要長時間盯著終端機操作的任務(像是破解壓縮檔的雜湊值、抓漏洞)上特別強,甚至做到了幾項Fable完全做不到的任務;Fable則是在網頁與資料視覺化、以及多語言程式(尤其Java、Python、C++)的廣度上領先。研究團隊甚至算出一種叫『Oracle routing(先知式路由)』的理論上限——假設有一個全知的裁判,每次都能把任務丟給剛好最便宜又能做對的模型,結果顯示K3在72%到96%的任務裡都會被選中。

這告訴我們,開發者組裝代理人不是「選一個最強的模型死用到底」,而是先用像PTC、語意搜尋、記憶壓縮這些技巧幫AI裝好「能做事的骨架」,再靠像Oracle routing這樣的分工邏輯,把不同類型的任務分給真正擅長的模型去做——這才是「多模型協作分工」的實際做法。

⚙️ 脈絡拆解

1
裝上工具呼叫能力先讓AI能用程式碼直接呼叫工具(PTC),不用每講一步就停下來等確認,減少來回溝通的時間與費用。
2
解決工具太多的問題用語意搜尋,讓AI在成千上萬個工具裡,靠「意思相近」快速找到對的那一個,而不是逐一比對關鍵字。
3
撐住長時間運作自動壓縮對話記憶,避免代理人跑到一半因為記得太多東西而卡住或忘記重點。
4
混搭多個模型分工不是只選一個最強模型,而是依任務類型(像修bug、跑終端機、多語言)分別交給擅長的模型去做。
5
用資料驗證分工效果透過像Oracle routing這樣拆解任務類型的實測,確認分工確實比單用一個模型更划算。
Kimi K3 與 Fable 5 在不同任務類型的表現對比
任務類型誰比較強說明
SWE(真實程式碼修bug)頭條數字打平(K3 92.4% vs Fable 92.6%)但拆開來看:K3強在數學符號運算與開發工具,Fable強在網頁與資料視覺化
Terminal(長時間終端機操作)K3較強K3破解了Fable完全做不到的任務,例如壓縮檔雜湊、加密分析、抓漏洞
多語言程式撰寫Fable較廣Fable在Java、Python、C++表現較好,K3在JavaScript、Rust打平

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 如果Kimi K3和Fable 5整體分數幾乎打平,為什麼開發者還要花力氣把任務分給不同模型,而不是省事直接選一個用到底?
因為『整體打平』只是把所有任務的分數平均起來看,一旦拆開任務類型,兩者的強項差很多——K3擅長終端機操作和數學符號運算,Fable擅長網頁、資料視覺化與多語言廣度。文中的Oracle routing試算顯示,如果能精準地把任務分給對的模型,K3會在72%到96%的任務裡雀屏中選,這代表『分工』能榨出比單用一個模型更高的品質、也更省錢的結果。這也呼應上一堂提到大家拼命做更小更快的模型——因為有了分工,便宜的模型不必樣樣精通,只要在自己擅長的地方夠強就有用武之地。

📝 隨堂考(點選答案,立即回饋)

Q1. 根據Claude開發食譜,如果一個AI代理人手上有上千個工具可以用,開發者通常怎麼解決『AI不知道該挑哪個工具』的問題?
✅ 食譜裡的『Tool search with embeddings』就是用語意向量做動態工具發現,讓AI能在大量工具中快速鎖定對的一個,不必逐一比對說明書。
Q2. 從Kimi K3與Fable 5的比較數據來看,下列哪一個描述最符合實情?
✅ 文中提到頭條數字看起來像打平(例如修bug任務K3拿92.4%、Fable拿92.6%),但拆開後可看到K3在終端機操作、數學符號運算上突出,Fable則在網頁、資料視覺化與多語言廣度上領先。
第 4 單元|對你的意義:當代理人夠聰明,連資安漏洞都挖得到

🧭 本單元白話講

上一關我們看到開發者怎麼把一顆顆模型接上工具、記憶和分工流程,組裝成真正會「做事」的代理人。這一關要問的是:這種會做事的代理人,做出來的事究竟有多驚人?答案藏在一則真實資安研究裡——有人只花 25 美元,就讓 AI 自己找出一個價值上看 50 萬美元的 WordPress 資安漏洞。

這位研究者用的是 GPT-5.6 Sol Ultra,這顆模型不久前才解出一道知名的困難數學題。他發現 OpenAI 公開了當初用來解題的提示詞(prompt),心想「能解出這麼難的數學題,應該也能拿來挖資安漏洞」,於是把提示詞改寫,貼到 WordPress 的原始碼上,交代 AI「同時開最多 4 個代理人、連續工作至少 6 小時」,目標是找出一條能從pre-auth(未授權觸發)不用帳號密碼、不必登入,攻擊者從外部就能直接觸發的弱點,危險程度最高一路打到RCE(遠端代碼執行)駭客不需要碰到你的機器,就能透過漏洞直接在你的伺服器上下指令、跑程式,等同整台機器被遠端接管的完整攻擊鏈。

這串提示詞厲害的地方,不是叫 AI「亂試」,而是幫它訂了一套研究紀律:先廣泛嘗試各種攻擊面(輸入解析、檔案上傳、序列化、競爭條件等),把每個代理人正在嘗試的「路數」分類記錄下來;如果太多代理人擠在同一種路數,就主動把一部分人改派去探索還沒人碰過的角落,也不能因為某條路線「看起來最像有戲」就讓它獨占資源。換句話說,這群代理人不是各自亂槍打鳥,而是背後有一個類似「研究主管」的邏輯在動態調度。

最後這套流程真的挖出一條完整可用的漏洞鏈,價值最高可達 50 萬美元的漏洞仲介(exploit broker)專門付費收購資安漏洞情報的公司,資安研究者找到漏洞後可以賣給他們換取獎金懸賞。研究團隊沒有馬上公開細節,而是先讓 WordPress 使用者有時間升級修補;就在這段緩衝期間,另外兩組研究團隊 Calif 和 Hacktron 也各自獨立重現了同一條攻擊鏈——代表這不是巧合或運氣,而是同一種能力已經散布在不只一個地方。

同一時間,Google 也推出了專門的資安版模型「3.5 Flash Cyber」,搭配自家的程式碼修補代理人 CodeMender 一起運作,目標是讓防守方也能用又快又省錢的 AI 自動抓漏洞、補漏洞。這代表一件事:能挖漏洞的 AI 不再是特例或意外,而正在變成資安攻防雙方都會配備的標準工具。

對你來說,這不是要你去學怎麼駭入網站,而是要建立一個新的資安意識:以前「找到一個嚴重漏洞」可能要靠頂尖專家花好幾週;現在只要任務說明夠清楚、提示詞設計得夠有紀律,AI 代理人幾小時、幾十塊美金就能做到接近的事。這股力量用在防守方就是自動抓漏洞、自動修補;一旦落到惡意一方,就是攻擊門檻大幅降低。這正是「AI 代理人的兩張臉」——省錢分工的效率工具,同時也是資安攻防的新變數。

⚙️ 脈絡拆解

1
借用解數學題的思路研究者發現 OpenAI 公開了讓 GPT-5.6 解出高難度數學難題的提示詞,猜測同一套「深度自主研究」方法,也可能適用於挖資安漏洞。
2
下達任務與規則把提示詞改寫成資安任務:鎖定 WordPress 原始碼,要求 AI 只靠讀程式碼分析(不准查 changelog 或上網比對修補紀錄),同時開到 4 個代理人,連續工作至少 6 小時。
3
動態調度多代理人AI 主動把代理人分成不同「研究路線」,像是檔案上傳、序列化、競爭條件等,定期檢查有沒有太多代理人擠在同一條路線,並把資源挪去還沒人探索的角落。
4
找到攻擊鏈、先不公開最終串出一條從未授權到遠端執行指令的完整攻擊鏈,價值上看 50 萬美元;團隊選擇先讓社群修補,緩衝幾天後才公開細節。
5
防守方也用同一套邏輯Google 幾乎同時推出專攻資安的 3.5 Flash Cyber 模型,搭配 CodeMender 代理人,讓防守方也能用類似的自動化能力去抓漏洞、補漏洞。
同一種能力,兩種用法
角色用的 AI目的
資安研究者(本案例)GPT-5.6 Sol Ultra + 多代理人提示詞自主分析 WordPress 原始碼,挖出價值 50 萬美元的漏洞鏈
Google 防守方工具3.5 Flash Cyber + CodeMender自動找出程式碼中的漏洞並協助修補
獨立驗證團隊 Calif、Hacktron各自重現同一漏洞鏈證明這種挖漏洞能力已不是單一團隊的偶然結果

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 如果挖漏洞只要 25 美元、幾小時,資安產業的「門檻」代表什麼意思?
過去找出一個嚴重漏洞往往需要頂尖資安專家投入數週經驗與直覺;這個案例顯示,只要任務說明夠精確、有紀律地調度多個代理人,這種深度分析能力可以被「打包」進一份提示詞裡重複使用。這代表挖漏洞的門檻不是消失,而是從「找得到頂尖人才」轉移成「寫得出精準的任務說明與調度規則」——這對防守方是好消息(可以低成本自查),但對還沒跟上腳步的中小型網站,也代表攻擊者的成本同樣在下降。
🔭 Google 同時推出攻防兩用的資安模型,這說明了什麼趨勢?
3.5 Flash Cyber 被設計成搭配 CodeMender 這種「修補」代理人使用,說明業界已經預期資安會變成一場自動化速度賽:漏洞被 AI 找出來的速度,必須被修補的速度追上,否則差距就是攻擊者的機會窗口。這也呼應本案例中研究團隊選擇「先通報、緩衝幾天再公開」的做法——在 AI 讓找漏洞變快的世界裡,「公開的時機」本身也變成一種資安判斷。

📝 隨堂考(點選答案,立即回饋)

Q1. 關於這個案例中 AI 挖漏洞的做法,下列何者正確?
✅ 提示詞明確要求 AI「從第一原理分析程式碼」,禁止用 changelog 或上網比對修補版本的方式取巧,而且同時開到 4 個代理人分頭探索不同攻擊面、動態調度資源,而不是單一代理人硬幹或靠比對版本差異。
Q2. 關於「漏洞仲介(exploit broker)」與這次事件的處理方式,下列敘述何者正確?
✅ 文中提到團隊選擇延後公開,讓防守方有時間先升級,而 Calif 和 Hacktron 兩組研究者也在這段期間各自獨立重現了完整攻擊鏈,顯示這種挖漏洞能力已經不只一人掌握。漏洞仲介收購的是有效、可驗證的漏洞情報,懸賞金額可達 50 萬美元,並非僅限已被實際利用過的漏洞。

✅ 離開前自測(全勾=這課真的學會了)

0%