📍 真實場景
阿凱,一家電商新創唯一的後端工程師,負責維護客服 AI 代理
他上週剛把客服機器人背後的模型,從舊版換成當時最強、也最貴的新模型,指望能一次解決『答非所問』的客訴
😖 卡住的地方:換了模型之後,機器人還是常常查錯訂單狀態、引用不存在的退貨政策、甚至呼叫錯出貨系統的工具——問題根本沒改善,帳單卻多了三倍,老闆已經在問這筆錢花得值不值得
💡 這篇文章會告訴阿凱:問題可能從來不在模型本身,而在『模型看得到什麼、能用什麼工具、該守什麼規則』——這堂課教他怎麼優化代理的環境,同一顆模型效果可能就提升數十倍
🧭 這到底是什麼(白話版)
什麼是 AI 代理能自己上網查資料、呼叫程式、完成多步驟任務的 AI,不只是聊天回話而已 ?它跟一般聊天機器人不一樣的地方,是它會自己動手做事——查資料庫、呼叫工具、寫程式。但很多團隊發現,即使換了更強的模型,代理還是常常『做錯事』:查錯資料、用錯工具、答非所問。
這篇文章提出一個概念叫「載具工程(harness engineering)把 AI 模型本身當成不用去拆解的黑盒子,反而去優化模型『周遭的環境』——包括給它看的背景資料、可以用的工具、要遵守的規則——藉此大幅提升它的表現 」。想像模型是一台引擎,被當作 黑盒子把系統內部細節當作不用弄懂,只關心丟進去什麼、跑出來什麼結果的處理方式 ,你不去拆開它、不去改它裡面的線路;載具(harness)就是包住引擎的車體、方向盤、儀表板——引擎再強,沒有好的車體照樣開不好車。
文章作者說,很多組織裡重要的眉角、規矩、例外處理方式——這些叫 非功能性需求不是「這功能要做什麼」,而是「這功能要做到多好、多穩、多安全」的隱性要求,例如可靠度、安全性、維護性 ——根本不會寫進模型的訓練資料裡。這些是屬於組織自己的暗知識,只存在於老員工的經驗、內部文件、修正紀錄裡。載具工程要做的,就是把這些暗知識轉換成代理看得懂、用得到的背景資料和工具。
更關鍵的是,這個過程可以『越用越聰明』。每次代理做錯事被人糾正、每次任務失敗被記錄下來,都可以變成下一次任務的背景資料、邊界規則、範例或檢查機制——讓組織累積下來的判斷力像滾雪球一樣沉澱在載具裡,而不是每次都要重新教一次模型。
🎯 為什麼值得你花時間
換模型是燒錢的自我安慰 模型費用通常照用量計費,越換越貴的新模型只是把『猜錯的機率』降低一點點,但環境沒整理好,代理還是會查錯資料、跑錯流程——效果有限,錢卻燒得更快。
團隊的經驗不會自動教會 AI 資深員工腦中『這種情況要小心』『這個例外要這樣處理』的判斷,屬於一種 暗知識只存在於老員工經驗、內部文件、修正紀錄裡,沒有寫進正式規範或模型訓練資料的隱性知識 。如果沒有寫進代理能讀到的文件和工具裡,AI 永遠學不會——因為這些判斷根本不在它訓練時看過的資料裡。
程式碼是 AI 操作電腦的語言 文章提到「Code is how an agent uses a computer」——代理要真的完成任務(不是紙上談兵),得靠寫程式碼去操作真實系統;載具工程決定了這條操作路徑順不順、安不安全。
⚙️ 它是怎麼運作的
1
還原意圖 代理要先搞懂『這個任務真正要解決的問題是什麼』,不只是字面上的指令——這需要把背景脈絡(例如公司規則、過去案例)餵給它看。
▼
2
操作真實系統 代理不能只是紙上談兵,要能真的呼叫對的工具、串接對的資料庫、觸發對的流程,才能拿出真正有用的結果。
▼
3
尊重權限界線 代理該知道『這件事我能不能自己決定』『這個動作需不需要人核准』——載具要把公司的權限規則寫成代理看得懂的規範。
▼
4
拿得出證明 代理做完事情要能證明『我做對了』,例如附上查證來源、執行紀錄、測試結果,讓沒空一行行檢查程式碼的人也能安心採信結果。
▼
5
讓下一次更聰明 這次任務學到的教訓(哪裡出錯、哪裡被糾正)要被記錄成下次代理能看到的背景資料或檢查規則,讓組織的經驗一次比一次更完整地累積在載具裡。
兩種提升 AI 代理表現的路徑比較
面向 換更強的模型 做載具工程 改善速度 有限,常常只是機率上小幅提升 同一顆模型,效果可能提升數十倍
成本結構 通常隨用量疊加,越換越貴 多是一次性整理背景資料與工具,長期成本較低
能不能保留組織經驗 不行,經驗不會自動進到模型權重裡 可以,錯誤與修正能被寫成下次可用的規則
🤔 這則沒有適合的實作——改用三個問題帶你想深
如果你現在手上有一個常常『做錯事』的 AI 工具或代理,請具體列出:它欠缺哪些『背景資料』『可用工具』或『規則文件』,才會一直判斷錯誤?
文章說『暗知識』藏在老員工的經驗、修正紀錄、例外處理方式裡——回想你工作或生活中,有哪些『大家都知道但沒寫下來』的默契規則?如果要教會一個新人(或一個 AI),你會怎麼把它寫成白紙黑字?
『讓下一次更聰明』意味著每次錯誤都該變成日後可用的規則。你目前的工作流程裡,犯過的錯誤有被系統性記錄下來、讓下次不會重蹈覆轍嗎?如果沒有,卡在哪一步?
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 為什麼作者選擇把模型當『黑盒子』,完全不去動它?
這是資源分配的取捨:換模型的決定權通常不在你手上(要嘛太貴、要嘛換了也不一定變好),但『餵給模型看什麼、給它什麼工具』完全是你能掌控的變數。與其把力氣花在你控制不了的事情上,不如把最大槓桿放在你能掌控、報酬率又最高的地方——這是典型的『把力氣花在刀口上』的工程判斷。
🔭 把公司的『非功能性需求』(可靠度、安全性…)寫進代理的環境裡,跟寫進一份規範文件給人看,有什麼本質上的差別?
寫給人看的文件,人會自己判斷『這條規則現在適不適用』;但代理沒有這種常識判斷力,規則如果沒有變成它『看得到、查得到、甚至會被檢查機制卡住』的具體東西,它就是視而不見。所以載具工程的關鍵不是『寫下規則』,而是『把規則變成可執行、可檢查的東西』——這是從『文件』到『可執行約束』的工程轉譯工作。
🔭 作者強調『讓下一次更聰明』,這跟一般人以為的『訓練 AI』有什麼不同?
一般人以為要讓 AI 變聰明,就要重新訓練模型(換權重);但這裡講的是完全不動模型權重,只靠『持續累積、越修越完整的外部環境』讓同一顆模型表現越來越好。這其實是用工程手法(版本控制、文件累積、規則沉澱)取代機器學習手法(重新訓練)來解決『系統會不會越用越好』這個問題——成本結構完全不同,也更適合資源有限的團隊。
🔭 文章提到代理能讓『從沒審查過程式碼的人也能信任結果』,這件事背後藏著什麼風險?
這其實是把『信任』從『我看得懂所以我相信』換成『有證明流程所以我相信』。對資深工程師來說,這個轉換的風險在於:如果『拿得出證明』這一步做得不紮實(例如證明本身可以被代理蒙混過去),信任的地基就是空的——這也是為什麼『prove the outcome』要被列為與『操作真實系統』同等重要的步驟,而不是可有可無的附加動作。
📝 隨堂考(點選答案,立即回饋)
Q1. 載具工程(harness engineering)主要優化的對象是什麼?
AI 模型本身的參數
圍繞在 AI 代理身邊的背景資料、工具與規則
使用者的操作介面設計
伺服器的硬體效能
✅ 文章明確指出載具工程是把模型當黑盒子不去動它,改為優化『環境』這兩個外部槓桿:背景資料(context)與工具(tools)。
Q2. 文章認為,為什麼組織的『暗知識』(非功能性需求、例外處理經驗)通常不會出現在通用模型的訓練權重裡?
因為模型公司故意過濾掉這些資料
因為這些是組織私有、持續變動的資料,不在公開訓練資料範圍內
因為這些知識太簡單,模型不需要學
因為法律規定不能訓練這類資料
✅ 文章說組織不能假設這些私有、會變動的流程資料會出現在通用模型權重裡,這是組織自己才有的暗知識。
Q3. 根據文章,代理要做好一次任務,需要具備哪一組能力?
還原意圖、操作真實系統、尊重權限界線、拿得出證明、讓下一次更聰明
寫更多程式碼、用更貴的模型、加更多提示詞
只要模型夠新就自動具備
跳過人工審核以加快速度
✅ 文章列出的五項能力:recover intent、operate the real system、respect authority、prove the outcome、leave the next run better equipped。
Q4. 文章提到『讓下一次更聰明』的機制,實際上是怎麼運作的?
重新訓練模型權重
把錯誤、糾正、失敗案例轉換成下次任務可用的背景資料、規則與檢查機制
換一個更貴的模型
刪除舊的對話紀錄以節省空間
✅ 文章說被接受的成果、糾正、失敗與使用者回應,會變成下次可用的背景資料、邊界規則、範例與檢查機制——重點是外部環境變豐富,而不是重新訓練模型。
Q5. 文章提到『Code is how an agent uses a computer』,這句話在強調什麼?
代理只是用來寫程式的工具
程式碼是代理操作真實系統、產生實際結果的行動語言
只有工程師才能使用 AI 代理
程式碼比背景資料更不重要
✅ 這句話強調代理要真正『動手做事』(操作系統、產生結果),靠的就是程式碼這個行動語言,而不只是產生文字回答。
🃏 翻牌記憶卡(先想答案,再點開對答)
載具工程(harness engineering)點我翻面
把 AI 模型當黑盒子不動它,改優化模型周遭的背景資料、工具與規則,藉此大幅提升代理表現的做法
非功能性需求點我翻面
不是「做什麼功能」,而是「要做到多可靠、多安全、多好維護」的隱性品質要求
暗知識點我翻面
組織私有、會變動、只存在於老員工經驗或內部紀錄裡,不會出現在模型訓練權重中的知識
代理五能力點我翻面
還原意圖、操作真實系統、尊重權限界線、拿得出證明、讓下一次更聰明
AI 代理點我翻面
能自己動手完成多步驟任務(查資料、呼叫工具、寫程式)的 AI,而不只是聊天回話
ai-lecturer 教案工廠|藍圖 flash-full-v1.0|本頁零外部依賴,離線可開