📍 真實場景
阿凱,獨立接案的客服系統工程師,正在幫一家電商客戶維護退貨申訴用的 AI agent
他把 agent 過去處理成功與失敗的案例整理成一大份「注意事項清單」,每次都整包塞進提示詞裡,想讓 agent 越用越聰明
😖 卡住的地方:上個月客戶為了省錢,把底層模型從大型旗艦模型換成一顆較小的開源模型,同一份注意事項清單原封不動塞進去,agent 表現不但沒變好,錯誤率反而上升,阿凱一度懷疑是新模型比較笨
💡 這篇文章會告訴阿凱:問題不在模型笨,而在「記憶劑量」沒有跟著模型強弱調整——這課教他怎麼幫不同能力的 agent,配出剛剛好的記憶劑量
🧭 這到底是什麼(白話版)
這篇文章講的是一種讓 AI agent「越用越聰明」的技術,叫做代理記憶(agentic memory)讓 AI agent 把過去做過的任務經驗整理起來,之後遇到類似任務時可以拿出來參考的機制 。做法很直覺:agent 做完一個任務後,把「這次哪裡做對、哪裡做錯」整理成一份筆記,下次執行類似任務時,就把這份筆記塞進提示詞裡讓它讀。聽起來像是餵越多筆記,agent 就該越強,對吧?
文章的研究團隊測了 8 種不同能力的模型後發現,事情沒這麼簡單。他們用一套叫 ALTK-Evolve 的方法,讓 agent 自己從過去執行任務留下的軌跡(trajectory)agent 執行一個任務時,從接收指令、思考、呼叫工具到給出結果的完整過程紀錄,就像一份「工作錄影帶」 中,萃取出可重複使用的準則清單(guideline set)從過去成功與失敗經驗中整理出來的一條條建議,例如「遇到 A 情況要先做 B」「C 這種做法容易出錯」 ,再把這份清單放回提示詞給 agent 參考。整個過程完全不需要重新訓練模型(不用調整模型的權重(weights)模型內部用來決定輸出的數字參數,重新訓練模型就是在調整這些數字 ),也不需要人工標註對錯,agent 自己就能生出這份筆記。
但研究發現一個違反直覺的事實:準則清單不是「開了就有效」的功能開關,而是要按模型強弱「抓劑量」的東西。同一份清單,餵給強模型是補品,餵給弱模型卻可能變成噪音,讓它更迷惘、表現反而變差。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 如果「準則清單」對每個模型都要客製劑量,前端到底該怎麼決定要塞多少?
文章給的答案不是靠感覺,而是先分類:模型有沒有還沒用完的能力餘裕(headroom)、上下文視窗夠不夠大、任務分布跟訓練時像不像。這代表在正式上線前,要先用小規模測試把模型「歸類」——是屬於吃得下整份清單的強模型,還是容易被塞爆的弱模型——而不是一套記憶策略打天下。這正是資深工程師常講的「先量測、再優化」,而不是先上線再說。
🔭 為什麼「準則變多,表現變差」這件事會發生?弱模型是笨,還是清單本身有問題?
文章的解讀是「被淹沒(drowned)」——不是模型笨,而是它的有效上下文利用能力模型在很長的提示詞裡,實際能穩定注意到、正確運用其中哪些資訊的能力,通常比它「能塞進多少字」要小得多 比強模型差,塞進太多規則後,重要的核心規則反而被稀釋、找不到重點。這是一個很經典的工程取捨:資訊量與訊噪比是兩回事,資料多不代表訊號強,弱模型更需要「先篩選再餵」而不是「全都要」。
🔭 「飽和模型(GLM-5)給再多準則都沒用」——這代表準則清單這條路對它沒用了嗎?
文章很誠實地說「飽和」只是描述觀察到的現象,不是已證實的原因——可能是模型本來就已經逼近這批任務的天花板、可能是準則沒打中它真正會犯錯的地方、也可能是它根本沒把準則用上。資深工程師看到這種「沒效果」的結果,不會直接下結論「這條路沒用」,而是會先區分是「上限到了」還是「瞄準錯了」,這兩種情況的下一步行動完全不同——前者該換更強的模型,後者該換一批更精準的準則。
🔭 為什麼「用檢索」會同時是最準又最便宜的選項,這是不是有點太好了?
答案在於:檢索省下的不是「準確度換取的成本」,而是「雜訊換取的成本」——挑出跟這次任務相關的規則,等於同時降低了 token 用量,也降低了不相關規則造成的干擾,兩件事是同一個動作的兩個結果,不是互相拉扯的取捨。再加上文章提到的提示詞快取(prompt caching)把常用、不常變動的提示詞內容預先處理過並存起來,之後重複用到同一段內容時不用重新計算,能大幅降低反覆使用同一份準則清單的成本 ,代表在正式環境中,就算是強模型要用的「完整版」清單,也不會因為每次都重新處理整份清單而變得昂貴。
📝 隨堂考(點選答案,立即回饋)
Q1. 根據這篇文章,「代理記憶」(agentic memory)指的是什麼?
把過去執行任務的完整逐字對話紀錄整段複製貼上給 agent 看
從 agent 過去的軌跡中萃取出來的準則清單(策略、該避開的錯誤、特殊狀況處理方式)
重新訓練模型,把過去的資料變成新的權重
幫 agent 加裝一個外部資料庫,儲存所有使用者的個資
✅ 文章明確說「記憶」不是「重播過去的逐字紀錄」,而是從過去軌跡中萃取出來的準則清單,且完全不需要調整模型權重。
Q2. 強模型(如 DeepSeek-V3.2)跟弱模型(如 gpt-oss-120b)在準則清單的最佳用法上,有什麼差異?
兩者都應該給越多準則越好,沒有差別
強模型該給完整清單,弱模型該給核心規則加上按需檢索
強模型不需要任何準則,弱模型才需要
準則清單只對開源模型有效,對商用模型無效
✅ 文章實測顯示,強模型有餘裕吸收完整清單(含邊緣案例)表現最好;弱模型塞太多反而被淹沒,用「核心加檢索」效果更好,還更省 token。
Q3. 文章提到 GLM-5 屬於「飽和模型」,這代表什麼?
GLM-5 已經被證實無法從任何形式的記憶中受益
研究團隊觀察到給它準則清單沒有明顯效果,但背後原因(天花板、準則沒對到痛點、或沒有效運用)還沒有定論
GLM-5 的參數量太大,導致記憶功能故障
飽和是指模型的 token 用量已經超過上限
✅ 文章特別強調「飽和」這個標籤只是描述觀察到的現象,不是已證實的原因,可能有多種解釋,仍在釐清中。
Q4. 為什麼「核心準則加按需檢索」對 gpt-oss-120b 來說,同時是最準又最便宜的選項?
因為檢索到的規則剛好跟任務相關,同時減少雜訊干擾,也減少了不必要的 token 用量
因為檢索功能本身有額外的模型加速效果
因為 gpt-oss-120b 的上下文視窗太小,塞不下完整清單,只能被迫用檢索
因為檢索版本用的是不同的底層模型
✅ 文章指出,挑選相關的準則同時降低了 token 花費,也降低了不相關規則造成的干擾,這兩件事是同一個動作帶來的雙重好處,不是互相拉扯的取捨。
Q5. 文章的核心結論「記憶是劑量、不是開關」,具體來說是什麼意思?
記憶功能一旦打開就會一直生效,不需要調整
該給 agent 多少準則、給什麼樣的準則,要依照模型的能力強弱來調整,不是有或沒有的二選一
記憶只對超大型模型有效,中小型模型完全不該使用
劑量指的是模型呼叫 API 的次數上限
✅ 文章反覆強調『the right dose differs by model tier』——不是要不要給記憶的二分法問題,而是給多少、給哪些,要依模型量身調整的連續問題。