Cloudflare 公開了一套「技能包」(skill),讓原本只會寫程式的 AI 代理(agent)能自己判斷、自己動手執行任務的AI程式,不只是被動回答問題搖身一變成資安稽核員。以前要找程式裡的安全漏洞,得靠人類資安工程師一行一行盯著程式碼看信任邊界在哪裡;現在你可以派一群 AI 代理分工去做同一件事,而且流程被拆成六個固定步驟:偵查、地毯式搜尋、候選驗證、寫成結構化報告、獨立查核、最後產出報告。
這套流程最特別的地方在「候選驗證」跟「獨立紀錄查核」這兩關:每個 AI 代理找到的疑似漏洞,都必須交給另一個「完全沒看過原始發現過程」的全新代理去試著推翻它,推不倒才算數。這樣設計是為了避免同一個 AI 自問自答、自己肯定自己剛才的判斷——這種現象常被稱為 幻覺(hallucination)AI很有自信地講出聽起來合理、但其實站不住腳的結論,在資安稽核這種「抓到才算數、抓錯會浪費工程師時間」的場景特別致命,因此報告最後只分三種標籤:confirmed(有完整證據鏈)、needs_validation(還有未解決的疑點)、rejected(已被推翻)。
🔭 為什麼要把「找漏洞」跟「驗證漏洞」拆成兩個互不知情的 AI 代理,而不是讓同一個代理自己找完自己驗?
這是在防止 AI 對自己的發現球員兼裁判。同一個代理如果自己找到疑似漏洞又自己判定成立,容易順著前面的推理繼續往下確認自己是對的,導致誤報(false positive)被一路放大進最終報告。改派一個完全沒看過原始推理過程的全新代理去試著推翻候選,等於內建了一道跟人類資安團隊「發現者、複審者分離」一樣的交叉查核機制,寧可少報也不亂報,這對要花工程師時間去追查每一條報告的公司來說,省下來的成本很可觀。