AI-LECTURER 速報課|2026-08-20|約 26 分鐘

記憶不是塞越大越好:AI Agent 的「記憶劑量」怎麼配,才不會讓小模型被淹沒?

取材:How Much Memory Does Your Agent Actually Need?(Hugging Face Blog)
📍 真實場景
阿凱,獨立接案的客服系統工程師,正在幫一家電商客戶維護退貨申訴用的 AI agent

他把 agent 過去處理成功與失敗的案例整理成一大份「注意事項清單」,每次都整包塞進提示詞裡,想讓 agent 越用越聰明

😖 卡住的地方:上個月客戶為了省錢,把底層模型從大型旗艦模型換成一顆較小的開源模型,同一份注意事項清單原封不動塞進去,agent 表現不但沒變好,錯誤率反而上升,阿凱一度懷疑是新模型比較笨
💡 這篇文章會告訴阿凱:問題不在模型笨,而在「記憶劑量」沒有跟著模型強弱調整——這課教他怎麼幫不同能力的 agent,配出剛剛好的記憶劑量

🧭 這到底是什麼(白話版)

這篇文章講的是一種讓 AI agent「越用越聰明」的技術,叫做代理記憶(agentic memory)讓 AI agent 把過去做過的任務經驗整理起來,之後遇到類似任務時可以拿出來參考的機制。做法很直覺:agent 做完一個任務後,把「這次哪裡做對、哪裡做錯」整理成一份筆記,下次執行類似任務時,就把這份筆記塞進提示詞裡讓它讀。聽起來像是餵越多筆記,agent 就該越強,對吧?

文章的研究團隊測了 8 種不同能力的模型後發現,事情沒這麼簡單。他們用一套叫 ALTK-Evolve 的方法,讓 agent 自己從過去執行任務留下的軌跡(trajectory)agent 執行一個任務時,從接收指令、思考、呼叫工具到給出結果的完整過程紀錄,就像一份「工作錄影帶」中,萃取出可重複使用的準則清單(guideline set)從過去成功與失敗經驗中整理出來的一條條建議,例如「遇到 A 情況要先做 B」「C 這種做法容易出錯」,再把這份清單放回提示詞給 agent 參考。整個過程完全不需要重新訓練模型(不用調整模型的權重(weights)模型內部用來決定輸出的數字參數,重新訓練模型就是在調整這些數字),也不需要人工標註對錯,agent 自己就能生出這份筆記。

但研究發現一個違反直覺的事實:準則清單不是「開了就有效」的功能開關,而是要按模型強弱「抓劑量」的東西。同一份清單,餵給強模型是補品,餵給弱模型卻可能變成噪音,讓它更迷惘、表現反而變差。

🎯 為什麼值得你花時間

省下重新訓練的成本用軌跡萃取準則清單,無需微調權重、無需人工標註,這代表任何團隊都能用「agent 自己寫給自己的筆記」持續改進,不必付出高昂的訓練或標註成本。
換模型不能照搬同一套記憶策略很多團隊會為了省錢,把大模型換成小模型,卻直接把原本那套完整的記憶策略原封不動搬過去。這篇研究證明這樣做可能讓小模型表現不升反降——換模型時,記憶的「配方」也要跟著換。
檢索比全塞更划算研究顯示,對某些模型來說,只挑「核心加上跟這次任務相關」的準則丟進去,效果比整包塞入更好,還省下將近一半的 token 成本——這是「少即是多」在工程上的具體證據,不是空泛的口號。

⚙️ 它是怎麼運作的

1
Agent 先做任務,留下軌跡agent 正常執行任務,過程中每一步的思考、工具呼叫、結果都被完整記錄下來,這份紀錄就是原始素材。
2
從成功與失敗的軌跡中萃取準則ALTK-Evolve 分析這些軌跡,把「有效的策略」「該避開的錯誤」「特殊情況該怎麼處理」整理成一條條白話規則,這就是準則清單。
3
依模型強弱決定劑量不是每次都把整份清單塞進去,而是先判斷這個模型屬於哪種類型:有餘裕的強模型、容易被塞爆的弱模型,還是怎麼給都沒差的飽和模型。
4
強模型:整份塞好塞滿像 DeepSeek-V3.2(671B MoE)這種容量大、還有進步空間的模型,把完整清單(包含罕見的邊緣案例)全部給它,任務完成率反而提升了 9.5 個百分點。
5
弱模型:只給核心加按需檢索像 gpt-oss-120b(117B MoE)這種規模較小的模型,改成「一小撮高信心度的核心規則」加上「跟這次任務有關才抓進來」的檢索方式,任務完成率提升 16.1 個百分點,用的 token 反而更省。
6
飽和模型:怎麼給都沒差像 GLM-5(745B MoE)這種已經逼近自己能力天花板的模型,不管給多給少準則,表現都沒有明顯變化——研究團隊坦言這只是觀察到的現象,背後原因(天花板到了、準則沒對到痛點、還是模型根本沒把準則用上)目前仍在釐清。
三種模型,三種記憶劑量
模型類型代表模型最佳記憶策略效果
強模型(有餘裕)DeepSeek-V3.2(671B MoE)給完整準則清單,含邊緣案例任務完成率 +9.5 個百分點
弱模型(容易被塞爆)gpt-oss-120b(117B MoE)核心準則加按任務檢索任務完成率 +16.1 個百分點,token 只多花 5%
飽和模型(已到天花板)GLM-5(745B MoE)給多給少都一樣沒有明顯提升

🛠️ 動手做:記憶劑量實驗室:同一份準則清單,餵給不同模型會怎樣?

  1. 先選擇「強模型」,把滑桿從 0 拉到 100,觀察任務完成率如何隨劑量持續上升。
  2. 切換成「弱模型」,注意滑桿拉過 35% 之後,任務完成率反而開始下降——這就是文章講的「被淹沒」。
  3. 比較「弱模型」在劑量 35% 跟 100% 時的任務完成率與花費,體會「核心加檢索」為什麼比「全塞」更划算。
  4. 切換成「飽和模型」,把滑桿從 0 拉到 100,觀察分數幾乎不動——想想看,這代表這個模型完全不需要記憶策略了嗎?
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 如果「準則清單」對每個模型都要客製劑量,前端到底該怎麼決定要塞多少?
文章給的答案不是靠感覺,而是先分類:模型有沒有還沒用完的能力餘裕(headroom)、上下文視窗夠不夠大、任務分布跟訓練時像不像。這代表在正式上線前,要先用小規模測試把模型「歸類」——是屬於吃得下整份清單的強模型,還是容易被塞爆的弱模型——而不是一套記憶策略打天下。這正是資深工程師常講的「先量測、再優化」,而不是先上線再說。
🔭 為什麼「準則變多,表現變差」這件事會發生?弱模型是笨,還是清單本身有問題?
文章的解讀是「被淹沒(drowned)」——不是模型笨,而是它的有效上下文利用能力模型在很長的提示詞裡,實際能穩定注意到、正確運用其中哪些資訊的能力,通常比它「能塞進多少字」要小得多比強模型差,塞進太多規則後,重要的核心規則反而被稀釋、找不到重點。這是一個很經典的工程取捨:資訊量與訊噪比是兩回事,資料多不代表訊號強,弱模型更需要「先篩選再餵」而不是「全都要」。
🔭 「飽和模型(GLM-5)給再多準則都沒用」——這代表準則清單這條路對它沒用了嗎?
文章很誠實地說「飽和」只是描述觀察到的現象,不是已證實的原因——可能是模型本來就已經逼近這批任務的天花板、可能是準則沒打中它真正會犯錯的地方、也可能是它根本沒把準則用上。資深工程師看到這種「沒效果」的結果,不會直接下結論「這條路沒用」,而是會先區分是「上限到了」還是「瞄準錯了」,這兩種情況的下一步行動完全不同——前者該換更強的模型,後者該換一批更精準的準則。
🔭 為什麼「用檢索」會同時是最準又最便宜的選項,這是不是有點太好了?
答案在於:檢索省下的不是「準確度換取的成本」,而是「雜訊換取的成本」——挑出跟這次任務相關的規則,等於同時降低了 token 用量,也降低了不相關規則造成的干擾,兩件事是同一個動作的兩個結果,不是互相拉扯的取捨。再加上文章提到的提示詞快取(prompt caching)把常用、不常變動的提示詞內容預先處理過並存起來,之後重複用到同一段內容時不用重新計算,能大幅降低反覆使用同一份準則清單的成本,代表在正式環境中,就算是強模型要用的「完整版」清單,也不會因為每次都重新處理整份清單而變得昂貴。

📝 隨堂考(點選答案,立即回饋)

Q1. 根據這篇文章,「代理記憶」(agentic memory)指的是什麼?
✅ 文章明確說「記憶」不是「重播過去的逐字紀錄」,而是從過去軌跡中萃取出來的準則清單,且完全不需要調整模型權重。
Q2. 強模型(如 DeepSeek-V3.2)跟弱模型(如 gpt-oss-120b)在準則清單的最佳用法上,有什麼差異?
✅ 文章實測顯示,強模型有餘裕吸收完整清單(含邊緣案例)表現最好;弱模型塞太多反而被淹沒,用「核心加檢索」效果更好,還更省 token。
Q3. 文章提到 GLM-5 屬於「飽和模型」,這代表什麼?
✅ 文章特別強調「飽和」這個標籤只是描述觀察到的現象,不是已證實的原因,可能有多種解釋,仍在釐清中。
Q4. 為什麼「核心準則加按需檢索」對 gpt-oss-120b 來說,同時是最準又最便宜的選項?
✅ 文章指出,挑選相關的準則同時降低了 token 花費,也降低了不相關規則造成的干擾,這兩件事是同一個動作帶來的雙重好處,不是互相拉扯的取捨。
Q5. 文章的核心結論「記憶是劑量、不是開關」,具體來說是什麼意思?
✅ 文章反覆強調『the right dose differs by model tier』——不是要不要給記憶的二分法問題,而是給多少、給哪些,要依模型量身調整的連續問題。

🃏 翻牌記憶卡(先想答案,再點開對答)

ALTK-Evolve 是什麼?點我翻面
一套讓 agent 從自己過去執行任務的軌跡中,萃取出可重複使用的準則清單,並在下次執行時放回提示詞的方法——不需要重新訓練模型、不需要人工標註。
強模型的最佳記憶策略?點我翻面
給完整準則清單,包含罕見的邊緣案例——它有足夠的能力餘裕吸收全部內容。(例:DeepSeek-V3.2 任務完成率 +9.5 個百分點)
弱模型的最佳記憶策略?點我翻面
給一小撮高信心度的核心規則,加上跟當次任務相關才檢索進來的規則,避免被大量準則淹沒。(例:gpt-oss-120b 任務完成率 +16.1 個百分點,token 只多花 5%)
什麼是「飽和模型」?點我翻面
不管給多給少準則,表現都沒有明顯變化的模型(例:GLM-5)。文章強調這只是觀察到的現象,背後原因還沒有定論。
決定記憶劑量的因素有哪些?點我翻面
不只是參數量,還包括模型的能力餘裕(headroom)、上下文視窗大小、模型架構、準則品質、任務分布等,這些因素目前還在釐清彼此的影響力。
為什麼弱模型會被「塞爆」?點我翻面
準則太多時,重要的核心規則被大量次要規則稀釋、蓋過,模型難以聚焦在真正該用的規則上,表現反而下降。

✅ 離開前自測(全勾=這課真的學會了)

0%