AI-LECTURER 速報課|2026-08-06|約 26 分鐘

多輪代理式檢索也能省 100 倍?Castform 用小模型打敗 GPT-5.6 Sol 的心法

取材:Beating GPT-5.6 Sol on retrieval with 100x cheaper open models(Hacker News(AI 高人氣))
📍 真實場景
小周,一間做企業內部知識庫問答機器人的新創後端工程師

正在把公司的問答系統從「問一次、查一次」的單輪搜尋,升級成能處理複雜追問的多輪代理式檢索

😖 卡住的地方:升級後每次問答系統都要呼叫 GPT-5.6 Sol 好幾輪才能把答案兜出來,帳單一個月翻了好幾倍,使用者還要等十幾秒才看到回覆,老闆已經在問這功能到底能不能上線
💡 這課會給小周一個真實案例:新創 Castform 怎麼用「小 100 倍、但經過強化學習調教」的開源模型取代前沿模型做搜尋決策,把成本和延遲一起砍下來,以及這個做法真正的取捨在哪裡

🧭 這到底是什麼(白話版)

這篇文章在講一間叫 Castform 的新創,怎麼用「養小模型」的方式,打敗呼叫昂貴前沿模型做檢索的做法。故事要從兩種找資料的方式說起:過去主流是embedding 向量搜尋把文字轉換成一串數字(向量),再用數學方法比對哪些數字最接近,用「意思相近」來找資料,而不是直接比對文字,查一次就結束;但從 2025 年開始,產業轉向agentic retrieval(代理式檢索)讓 AI 自己判斷「還要不要再搜尋一次、搜什麼」,像一個會自己規劃步驟的偵探,而不是問一次答一次,把大問題拆成一步步的multi-hop search(多跳搜尋)把一個複雜問題拆成好幾個小問題,一步一步搜尋、每一步根據前一步的結果決定下一步要查什麼

問題是,代理式檢索是一個「迴圈」——每多繞一圈,就要多呼叫一次模型做決策。如果每次都呼叫frontier model(前沿模型)目前公開能力最強、最新的大型語言模型,例如文中提到的 GPT-5.6 Sol,一個典型的多輪搜尋請求就要花超過 10 秒、將近 0.03 美元,量一大帳單就爆炸。Castform 的解法,是改用open-weights model(開源權重模型)模型的參數(權重檔案)是公開的,任何人都能下載、修改、甚至自己微調的模型,跟只能透過 API 呼叫的「封閉模型」相對——這種模型本身便宜 100 倍,但一開箱能力比不上前沿模型,所以還要靠RL post-training(強化學習後訓練)模型先訓練完之後,再用「做對就給獎勵、做錯就扣分」的方式反覆練習,把它在特定任務上調教到更準把落差補起來。

這整套訓練與上線的迴圈,都靠 Neon 資料庫上的 Lakebase Search 搜尋擴充功能撐著:原始文件直接存在 Postgres 裡,訓練時模型用同一組搜尋工具反覆試錯,正式上線後也用同一組工具做檢索決策。這種「練習的招式和實戰的招式一致」的設計,是這個案例真正的工程巧思所在。

🎯 為什麼值得你花時間

帳單會爆炸的隱藏成本代理式檢索每繞一圈迴圈就要多呼叫一次模型,如果每一輪都靠前沿模型做決策,單次多輪請求就要 10 秒以上、將近 0.03 美元,量一放大,成本是用乘的往上疊,不是用加的。
小模型不再只能做簡單任務RL post-training 讓開源小模型在「特定任務」(例如判斷要搜什麼、要不要再搜)上追平甚至打敗前沿模型,這打破了「模型一定要夠大才夠聰明」的直覺。
資料庫廠商正在往上游卡位Neon 把搜尋擴充功能直接內建進資料庫,讓「存資料的地方」和「決定怎麼找資料的模型」變成同一套基礎設施,這是資料庫與 AI 模型分工整合的新戰場。

⚙️ 它是怎麼運作的

1
原始語料存進 Postgres文件不用額外搬家去專門的向量資料庫,直接存在 Neon 上的 Postgres 裡,省掉另建一套檢索基礎設施的麻煩。
2
產生訓練用的合成資料Castform 的訓練管線用 lakebase_text 和 lakebase_vector 兩種搜尋工具,自動生成「問題、搜尋步驟、答案」成套的訓練任務,不用靠人工大量標注。
3
用強化學習訓練搜尋能力模型在訓練迴圈裡反覆嘗試搜尋、被評分(答對了嗎)、根據回饋調整策略,每一次嘗試都真的呼叫 Neon 上的 Lakebase Search 當作搜尋工具。
4
上線後模型自己決定怎麼搜正式上線時,同一顆調教過的小模型接手,遇到問題會自己規劃要搜幾次、搜什麼關鍵字,不再需要昂貴的前沿模型幫忙做決策。
5
全流程只認一種搜尋工具訓練和上線用的是同一組 Lakebase Search 搜尋工具介面,確保模型「練習時用的招式」跟「實戰時用的招式」一致,不會有落差。
前沿模型 vs. RL 調教小模型:多輪檢索任務的實際差距
比較項目直接呼叫 GPT-5.6 SolRL 調教過的開源小模型
單次多輪檢索耗時10 秒以上大幅縮短(小模型推論速度快很多)
單次多輪檢索成本約 0.03 美元約為前者的 1/100
開箱即用能力弱,需要額外調教
特定任務(如搜尋決策)調教後表現作為對照基準可追平甚至超越前沿模型

🛠️ 動手做:檢索迴圈成本模擬器:前沿模型 vs. 調教過的小模型

  1. 拖曳滑桿,設定這次問題大概需要「查幾輪」才找得到答案(問題越複雜,通常要查越多輪)。
  2. 按下「開始模擬」,看兩個模型的累積成本和累積等待時間怎麼隨著輪數往上疊加。
  3. 把輪數拉到 8~10 輪再跑一次,感受一下前沿模型的帳單跟調教小模型的帳單,差距會被拉得多大。
  4. 讀完模擬結果的摘要句子,想想如果你的產品一天有一萬次這樣的請求,兩種做法一個月的帳單會差多少。
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 為什麼不乾脆一直用前沿模型就好,反正比較準?
關鍵在於代理式檢索是「迴圈」不是「一次性」呼叫,每多一輪都是一筆新的成本;但當任務範圍夠窄(例如只做搜尋決策),小模型經 RL 調教後準確度可以追平,通用能力卻仍比不上前沿模型。工程上真正的判斷是「只在窄任務上下注小模型,其餘廣泛任務仍靠前沿模型」,而不是全面替換掉前沿模型。
🔭 為什麼 Castform 選擇跟 Neon 這種資料庫綁在一起,而不是自己做一套獨立的搜尋引擎?
RL 訓練需要一個「環境」讓模型反覆試錯,而搜尋工具的呼叫介面在訓練和上線時必須一致,否則模型在練習時學到的招式,正式上線後可能用不出來。把資料庫原生的搜尋能力直接當作訓練環境兼上線工具,省掉自建、維護一整套搜尋基礎設施的成本,這是「借力使力」的架構決策。
🔭 合成資料生成在這個流程裡扮演什麼角色,為什麼不能只靠人工標注?
RL 訓練需要大量「問題、搜尋步驟、答案」成套的任務範例,靠人工標注在規模和成本上都不現實。用既有的資料庫內容自動生成訓練任務,才撐得起 RL 反覆試錯所需的資料量,這也是為什麼「讓 post-training 像 prompt engineering 一樣容易」會是 Castform 的核心賣點——它降低的是取得訓練資料的門檻。
🔭 這種成本優勢,會不會只是暫時的套利?
前沿模型自己的推論成本也在持續下降,今天的 100 倍差距不代表永遠都是 100 倍。但只要「窄任務加 RL 調教」這個模式成立,企業就能用同一套邏輯,持續把新出現的前沿模型能力「蒸餾」進更便宜的小模型裡,這是一種可以反覆複製的優化路徑,而不是一次性的價格套利。

📝 隨堂考(點選答案,立即回饋)

Q1. 文中「agentic retrieval(代理式檢索)」跟傳統的 embedding 向量搜尋,最大的差別是什麼?
✅ 代理式檢索的核心是「迴圈」——模型自己判斷還要不要再查、查什麼,而不是像傳統向量搜尋那樣一次查詢就給結果。
Q2. 為什麼多輪代理式檢索容易讓帳單暴增?
✅ 每多一輪迴圈,就是多一次呼叫前沿模型的成本,呼叫次數疊加起來,單次請求的總成本和等待時間都會跟著暴增。
Q3. Castform 用 RL post-training 調教小模型的目的是什麼?
✅ 文中強調 post-training 是在「特定任務」上讓開源小模型追上、甚至超越前沿模型,而不是讓它變成全能模型。
Q4. 訓練環境用的搜尋工具,為什麼要跟正式上線時用的搜尋工具是同一組?
✅ 如果訓練和上線用不同的搜尋工具介面,模型在訓練時學到的搜尋策略,到了正式環境可能用不上,造成表現落差,這是 RL 訓練「環境一致性」的基本要求。
Q5. 根據文章,一個典型的多輪 GPT-5.6 Sol 檢索請求,大約需要多少時間與成本?
✅ 文中明確指出典型的多輪搜尋請求用 gpt-5.6-sol「takes >10s and costs ~$0.03 end-to-end」。

🃏 翻牌記憶卡(先想答案,再點開對答)

agentic retrieval(代理式檢索)點我翻面
讓模型自己規劃、多次迴圈搜尋的檢索方式,取代一次性的 embedding 相似度查詢
RL post-training(強化學習後訓練)點我翻面
模型訓練完後,再用試錯加獎勵回饋的方式,針對特定任務加強調教
為什麼小模型能打敗前沿模型?點我翻面
不是全面打敗,是在「窄任務」(如搜尋決策)上,經 RL 調教後準確度追平甚至超越,同時成本只要 1/100
Lakebase Search點我翻面
Neon 資料庫提供的搜尋擴充功能,同時作為 Castform 訓練 RL 模型的環境,也是上線後模型呼叫的搜尋工具
訓練與上線的一致性點我翻面
RL 訓練和正式上線必須用同一組搜尋工具介面,模型練習的招式才用得上

✅ 離開前自測(全勾=這課真的學會了)

0%