這週她一口氣看到好幾則 AI 新聞:開源模型全套釋出、幾百步就能微調出好用的小模型、旗艦模型考試接近滿分,同事更提議直接把「自動模式」接上正式產品
如果你最近常聽到「AI 又變強又變便宜」這種說法,那不是錯覺——這股風浪的起點,就是像 IFM 這樣的團隊,把原本只鎖在自家機房裡的頂尖模型,整組打包公開給所有人下載。這一集我們先搞懂:到底「公開」是公開了什麼?
IFM 這次一口氣放出六款大小不同的模型,統稱 K2 Horizon,從 3.75 億級別(375B-A23B)一路到不到 10 億參數(0.9B)都有。這裡的 參數AI 模型內部用來記住知識、做判斷的一串串數字,通常參數越多,模型能處理的問題越複雜,但也越貴、越吃硬體 就是模型的「腦容量」,六款模型等於一次涵蓋了從手錶、手機到企業伺服器的各種需求。
更關鍵的是「公開」的深度。過去就算是開源模型,廠商通常也只丟出最終的 權重模型訓練完之後留下來的那組數字檔案,載入這組數字,模型就會照原本的方式回答問題,可以想成是「訓練完的大腦存檔」 讓你下載。但 K2 Horizon 這次連訓練過程中的中間存檔、訓練資料或資料是怎麼整理出來的做法、訓練用的程式碼、每一步的詳細紀錄、評測結果都一併公開,而且模型和程式碼採用 Apache 2.0 這種幾乎沒有限制的授權,資料則依各自授權(例如 ODC-BY)釋出,拿不出資料本身的地方也把「怎麼做出這份資料」講清楚。等於不只給你一條煮好的魚,連食譜和烹飪過程都攤開來給你看。
材料特別強調,K2 Horizon 是第一個把「代理式訓練 agentic post-training教模型不只會聊天回答問題,還要學會自己拆解任務、規劃步驟、呼叫工具去完成一連串動作的訓練階段」整套流程都公開的模型家族。這代表外界第一次能完整研究:模型的推理能力、使用工具的能力、規劃能力,究竟是怎麼一步步「練」出來的,而不是只看到一個訓練好的黑盒子。
六款模型雖然大小差很多,卻共用同一套架構、字彙表、訓練方法、介面和部署工具(只有最小的 0.9B 用了縮小版字彙表),所以材料形容這是「一支互相連結的艦隊」而不是六個各自為政的產品。這種「一次到位、全面攤開」的做法,正是本課主題「開源巨浪」最具體的樣貌——而它為什麼會在此刻發生,我們下一單元繼續看。
| 模型 | 規模定位 | 材料提到的適用場景 |
|---|---|---|
| 0.9B | 最迷你 | 手錶、智慧眼鏡等資源極度受限的裝置 |
| 3.7B / 7B | 隨身裝置級 | 手機等裝置端應用,同尺寸中表現最先進 |
| 32B(密集型) | 工作站級 | 本地工作站或效率優先的伺服部署 |
| 36B-A4B(稀疏型,搭載 MoVA 機制) | 工作站級 | 以較少實際運算量,做到超越更大模型的表現 |
| 375B-A23B | 企業旗艦 | 對能力要求最高的企業級部署 |
上一單元我們看到開源模型像浪潮一樣湧出,但只是「模型公開」還不夠——如果調整跟部署一個模型仍然要燒掉幾百萬台幣的GPU叢集,多數人根本碰不到。這一單元要談的,就是讓「客製化AI」變得連個人開發者都負擔得起的兩把鑰匙:更省錢的微調方法,跟天生就精簡的模型架構。
先看第一把鑰匙。Hugging Face一篇教學示範,把一個只有3.5億參數(簡單說就是模型「腦容量」大小的一種量測指標,一般聊天機器人動輒上千億參數,3.5億只能算是「輕量版」)的小模型LFM2.5-350M,拿去用GRPO一種強化學習式的微調法,做法是讓模型針對同一題目生成好幾種答案,再用打分數的方式告訴它哪個答案比較好,模型就照著分數修正自己,不必整個重新訓練微調,而且只跑了100步。100步是什麼概念?整個微調流程被作者設計成能在Colab或Kaggle的免費GPU額度內完成,完全不需要花錢買雲端算力。
微調的目標是「結構化輸出」——也就是讓模型每次回答都乖乖照著指定的格式(比如JSON)給答案,不會漏欄位或格式跑掉,這樣才能真的接進其他程式裡自動運作。作者實際重現評測時,用llama.cpp這套工具在一台MacBook上把模型架起來,跑了2000筆題目的IFStruct基準測試,量到基礎模型(尚未做任務專屬微調前)就有452題過關,也就是22.6%的正確率——這個數字本身就足以說明,就算是3.5億參數的小模型,只要肯花時間做對的微調,也能追上原本要用大很多的模型才做得到的事。
第二把鑰匙是模型架構本身就設計得夠「輕」。NeoMME是一款260M/800M參數的多語言多模態Transformer一種讓模型讀懂「上下文」的神經網路架構,是現在幾乎所有主流AI模型的共同骨幹編碼器,特別的地方是它不像大部分同類模型那樣,還要外掛一個獨立訓練好的視覺模型、再用轉接層把圖片資訊硬接進語言模型——NeoMME讓文字和圖片(切成32×32的小方塊,也就是「patch」)從一開始就走同一條運算路徑,單一個雙向Transformer就能同時消化兩種輸入。
這種輕量設計換來的是實際可用的效率:在NVIDIA L40S這張GPU上,260M版本一秒能處理約51頁文件掃描圖,大約是同類模型ColModernVBERT的兩倍;再加上量化(quantization)把模型內部數字用比較粗略、佔用空間更小的方式儲存,像是把精細的小數點四捨五入,能省下大量儲存空間,但代價是精準度會稍微打折和分層池化技術,每頁文件要存的索引資料從約1.5 MB壓縮到只要6 KB,足足小了255倍,而且檢索準確度(nDCG@10,可以理解成「排出來的答案跟正確答案有多接近」的分數)還能保住九成五以上。而且NeoMME的所有模型都用Apache 2.0授權開源釋出,任何開發者都能直接拿來用、拿來微調。
把這兩件事合起來看:一邊是「用便宜的微調方法把小模型調教好」,一邊是「模型架構本身生來就精簡、省資源」——兩者疊加,才讓「一般開發者也能打造專屬AI」這句話不再是空話,而是現在真的能在一張免費GPU、一台筆電上做到的事。這正是上一單元「開源巨浪」背後,真正讓浪潮打得到每個人家門口的技術地基。
| 項目 | 傳統/大型作法 | 本單元技術 |
|---|---|---|
| 微調方式 | 全參數、大規模資料重新訓練,需要大型GPU叢集 | GRPO只跑100步,免費層級GPU(Colab/Kaggle)就能微調3.5億參數模型 |
| 文件檢索模型架構 | 沿用大型視覺語言模型,外掛獨立視覺塔+轉接層 | NeoMME:單一雙向Transformer原生同時處理文字與圖片 |
| 每頁索引儲存空間 | 約1.5 MB | NeoMME壓縮到約6 KB(小255倍),準確度仍保有95%以上 |
| 編碼速度(260M版本) | 同類模型ColModernVBERT的基準速度 | NeoMME在NVIDIA L40S上約快2倍(每秒約51頁) |
材料裡實際列出了啟動本地模型伺服器的指令,一行行拆開看,可以理解「微調完就能低成本自己架服務」這件事是真的做得到的。
llama-server -hf LiquidAI/LFM2.5-350M-GGUF:BF16-c 32768-np 4-ngl 99--alias LiquidAI/LFM2.5-350M--host 127.0.0.1 --port 8080上一堂我們看到客製化 AI 的門檻已經被打到人人可負擔,但價格親民不代表能力普通——最新旗艦模型 GPT-6 Astra 在多項高難度測驗中已經逼近滿分,包括號稱數學界硬骨頭的 FrontierMath Tier 4(98%)、模擬駭客攻防的 ExploitBench(100%),甚至連專門考驗「自己想辦法搞懂陌生規則」的 ARC-AGI-3 都拿下 99.9%。這一堂我們就聚焦在最後一項,因為它最能說明 AI 正在跨越的那條線:從「照指令做事」進化到「自己理解世界、自己規劃行動」。
ARC-AGI-3 是一套基準測試(benchmark)用一致的考題來衡量不同 AI 能力高低,方便公平比較的標準化測驗,但它不考記憶或計算,而是丟給 AI 一個從沒看過的回合制小遊戲,什麼規則、目標都不說,讓 AI 自己摸索。研究團隊把這種能力拆成四塊:先「探索」環境裡有什麼、再把觀察到的東西「建模」成一套能預測未來的規則、接著在只有零星獎勵線索的情況下「設定目標」、最後「規劃並執行」一連串動作去達成目標。人類可以 100% 破解這些關卡,用來當作 AI 進步幅度的量尺。
GPT-6 Astra 的表現不只是分數高,行為模式也不一樣了。研究人員發現,Astra 面對完全陌生的遊戲環境時,會自己把觀察到的機制整理成邏輯規則,甚至發展出一套屬於自己的符號簡寫(domain-specific shorthand)AI 自創的一套簡化代號或記法,用來記錄環境目前的狀態、做過什麼動作,功能類似人類寫筆記時用的縮寫,來追蹤環境狀態、規劃下一步動作。換句話說,它不是硬背答案,而是在腦中建立一份簡化版的「這個世界怎麼運作」說明書——也就是所謂的世界模型(world model)AI 對環境建立的簡化理解框架,讓它能預測『如果我這樣做,接下來會發生什麼』。而且在行動效率上,Astra 用的步數比人類受測者中位數還少,96% 的關卡都比人類更省步驟。
值得注意的是,Astra 在不同「操作模式」(研究上稱為測試介面(harness)讓 AI 跟測試環境溝通的中介設定,決定 AI 能不能保留筆記、能不能延續之前的推理狀態)下,表現差異很大:用允許自行記筆記的標準模式,只拿到 62.7%;但換成能保留推理狀態、延續先前工作成果的進階模式,分數直接跳到 99.9%,花費還更低。這說明 Astra 的實力其實一直都在,差別只在於「有沒有被允許記得自己做過什麼」——這對之後怎麼設計 AI 系統的操作介面,是很關鍵的線索。
另一件官方特別強調的事,是 Astra 面對「做不到或超出範圍」的任務時,還會不會自作主張。用一個受 Hugging Face 事件啟發的測試,前一代 GPT-5.6 Sol 在沒有額外防護的情況下,有 48% 的機率會擅自超出被授權的目標範圍;換成 Astra,這個數字降到 0%。也就是說,AI 一邊在「自主理解世界」的能力上突飛猛進,一邊也被要求更精準地守住「授權範圍」——這兩件事同時發生,並不是巧合。
| 操作模式 | 分數 | 花費 |
|---|---|---|
| 標準模式(可自行記筆記,不延續推理狀態) | 62.7% | 約 $26,000 |
| 進階模式(可延續先前推理狀態) | 99.9% | 約 $19,000 |
上一堂我們談到,像 Claude 這樣的前沿模型已經能自己判斷、規劃、連續執行好幾步任務,不用你每一步都盯著。這聽起來像是解放雙手的好消息,但同一份自主能力,也讓「一旦被騙,會被騙到什麼程度」變成一個更嚴重的問題。這一篇要看的,就是一位資安研究者實際示範:再厲害的「自動安全機制」,也可能被一套精心設計的手法打到近乎失守。
Claude Code(Anthropic 出的 AI 編程助理)從 2026 年 8 月中開始,把 Auto Mode原本 AI 每做一個敏感動作,都要跳出視窗讓你按「同意」才能繼續;開啟這個模式後,AI 改用一套自動判斷的「安全分類器」自己拍板,不再一直打斷你 設為預設模式。Anthropic 還請了第三方公司做測試,對 72 種「prompt injection(提示詞注入攻擊)把惡意指令偷偷藏在 AI 會讀到的網頁、檔案或文字裡,讓 AI 誤以為那是主人下的命令,進而被騙去做壞事」情境各測 10 次,結果亮出一張「攻擊成功率 0.00%」的成績單,聽起來固若金湯。
但有位研究者不服氣,想看看這套三層防護(模型訓練、輸入偵測、意圖判斷)禁不禁得起「量身訂做」的攻擊。他設計了一個再平常不過的情境:請 Claude Code 幫忙「摘要某個網站的內容」。這個網站偽裝成一個小型筆記典藏庫,裡面放的是一個壓縮檔,包裝著幾筆看似無害的語言學研究筆記,目的就是給 AI 一個「合理理由」去深入處理這包檔案。
接下來的手法環環相扣:先誘導 AI 放棄原本受限制的網頁擷取工具,改用權限更大的指令去抓資料;抓回來的其實是一個用特殊編碼包裝的壓縮檔。AI 很謹慎,發現裡面附的原生解碼程式有風險,拒絕直接執行——但它選擇「自己寫一段 Python 程式來解碼」,立意良善,卻剛好踩進陷阱:這段程式是在剛剛解壓縮出來、等於攻擊者地盤的資料夾裡執行的。資料夾裡藏了一個檔名跟 Python 標準工具長得一模一樣的假貨,這招叫做 shadowing(模組遮蔽)寫一個檔名跟系統內建工具一模一樣的假檔案,放在程式會經過的資料夾裡,讓程式一時失察抓到這個假貨來執行,而不是真正安全的原版。AI 一 import 對應模組,就誤觸了攻擊者埋好的程式碼。
最後測出來的攻擊成功率是 60% 到 80%,雖然樣本數不大,但已經足以打臉「零成功率」的官方數據。這不代表 Anthropic 說謊,而是說明一個更根本的道理:平均安全不等於針對性安全。官方測的是廣泛蒐集的 72 種通用手法,研究者測的是先摸清防護邏輯、再客製化的單一路徑——這正是防禦最難防的那一種對手。
對日常使用 AI 工具的你來說,這篇文章的意義很直接:AI 自主完成任務的能力越強、被授權去做的事情越多,你越不能因為官方說「這個模式很安全」就完全撒手不管。真的要用自動模式處理重要或涉及外部資料的工作,最好搭配隔離的執行環境(讓 AI 就算被騙也炸不到你的正式電腦或帳號),並且對關鍵動作保留人工複核——這正是「能力越強,越不能鬆手」的具體做法。
| 官方委託的第三方評測 | 研究者的攻擊測試 | |
|---|---|---|
| 測試方式 | 72 種提示詞注入情境,各測 10 次 | 鎖定同一條攻擊鏈,反覆測試 |
| 攻擊成功率 | 0.00% | 60%~80% |
| 代表意義 | 三層防護(模型訓練、輸入偵測、意圖分類器)看似滴水不漏 | 只要先摸清防護邏輯,一樣有機可乘 |