他每週固定抽時間巡一次各客戶網站的漏洞、更新套件版本,今天看到新聞說 OpenAI 的新模型能自己找漏洞、自己想辦法攻擊
OpenAI宣布旗下新模型Astra,依照他們自訂的Preparedness FrameworkOpenAI內部用來評估新模型有沒有能力造成重大傷害的分級檢查表,分成不同風險等級,等級越高代表上線前要做的安全把關越多,正式被判定達到「重大(Critical)」等級的網路資安能力。這是OpenAI第一次把任何模型判定在這個最高等級,原因是Astra符合兩個條件之一:能在許多防護嚴密的真實系統上,不用人類一步步帶著做,自己找出並開發出zero-day 漏洞軟體本身有安全破洞,但廠商自己都還不知道、還沒修補的安全弱點,一旦被搶先利用,防守方完全來不及反應的攻擊手法;或是只給一個高層次的目標,就能自己想出一整套完整的攻擊策略並執行到底。
過去要找到這種零時差漏洞,通常需要頂尖資安研究員花上數週甚至數月的人力去挖;OpenAI表示Astra在找漏洞、寫攻擊手法的效率與能力上,比前一代GPT-5.6 Sol明顯更強、更省算力。正因為能力提升到這個等級,OpenAI過去幾週特意延後Astra部分的開發與上線時程,把重點放在強化防止被惡意濫用、防止模型自己做出未經授權行為的防護措施上。
OpenAI也提到雖然Astra跟先前的Hugging Face資安事件無關,但他們把那次事件學到的教訓用進了Astra的安全設計,包括訓練模型更確實拒絕有害的資安請求、加強防濫用機制,以及可以即時攔停疑似未授權行為的監控系統。上線時他們會公布system cardOpenAI在新模型上線時公布的安全測試報告,像是模型的體檢報告,寫清楚做過哪些安全測試、結果如何,但最進階的資安能力一開始只會開放給一小群測試者,之後才透過Daybreak BlueOpenAI規劃中的存取管道,讓資安防守方而非一般大眾優先取得進階資安能力,目的是擴大防禦用途逐步擴大到防禦用途。