這個服務會把每一筆退貨申請丟給LLM判斷「要不要自動核准」,規定AI一定要回傳固定格式的JSON,一天大約要跑六萬次判斷
這篇文章的作者Diogo Almeida,以前在OpenAI參與打造讓LLM大型語言模型,像ChatGPT這種會「一個字一個字生成文字」的AI乖乖聽指令、好好聊天的技術,這些研究後來變成ChatGPT背後的關鍵功夫之一。他觀察到一個奇怪的現象:LLM在聊天這件事上已經強到超乎常人,但真正被自動化取代的工作卻沒有想像中多——問題出在哪?
他的答案是:現有LLM的強項是「生文字」,可是企業真正需要的往往不是文字,而是「決策」,例如「這筆訂單要不要核准」「這封信是不是詐騙」。要讓LLM做決策,得先讓它生一段字串(通常是JSON),再由程式碼去解析、驗證;這個過程既慢又容易出包,因為字串本質上什麼都能長,連格式錯誤、答非所問、幻覺(hallucination)AI自信滿滿地說出根本不存在或不正確的內容都算在合法輸出範圍內。TypeSafe AI因此提出「System One Models」這個新類別,第一款公開模型叫Jev,直接把「生文字」這一步跳過,改成輸出結構化輸出答案侷限在事先規定好的格式裡,例如只能回傳「是/否」加上一個0~1的信心分數,不能亂回其他文字,保證不會出現格式錯誤。
要做到這件事,TypeSafe AI換了一套訓練方式。現有LLM多半是用RLHF讓人類幫AI的回答打分數,再用這些分數去調整AI,讓它的回答更討人類喜歡的訓練方式或是「可驗證正確性」的方式去訓練,說白了就是看「人類喜不喜歡」或「答案對不對得上標準答案」。Jev用的是他們自創的Reinforcement Learning for Calibrated Decisions(RLCD),獎勵訊號改成「這個機率有沒有校準(calibration)AI講的信心分數要跟真實命中率吻合,例如講「90%有信心」的判斷裡,真的要有九成是對的」,換句話說,它在乎的不是答案聽起來順不順耳,而是信心分數準不準。
另一個關鍵差異在「怎麼算出答案」。現有LLM是序列採樣(sequential sampling)AI生成文字時要一個字接一個字生,後面的字得等前面的字先跑出來才能生,這也是它們常常讓人等的原因;Jev改用平行採樣(parallel sampling)一次查詢就把所有可能的答案同時算完,不用排隊一個字一個字生,官方宣稱因此快上兩個數量級(也就是差不多一百倍),而且更省算力。目前Jev還在早期使用(early access)產品尚未正式對外公開,只先開放一小群人試用,好蒐集回饋階段,還沒有大規模公開數據可以驗證,這點在解讀「快一百倍」這類宣稱時值得放在心上。
| 面向 | 現有LLM(RLHF / RLVR) | System One + Jev(RLCD) |
|---|---|---|
| 訓練方式 | 用人類打分數(RLHF)或可驗證正確性(RLVR) | 用「校準決策」當獎勵訊號(RLCD) |
| 優化目標 | 人類比較喜歡的文字、或能驗證對錯的答案 | 答案的機率有沒有校準到跟真實命中率一致 |
| 輸出型態 | 字串,理論上什麼都能生,但要自己解析、驗證 | 事先定義好的型別化結構,附機率,不會型別錯誤 |
| 取樣方式 | 序列——一個字接一個字生 | 平行——一次查詢就把所有欄位算完 |
| 會不會幻覺 | 有可能亂編內容、格式錯誤 | 官方宣稱不會,但只保證型別正確,不保證判斷一定對 |