老闆週一早上要她列出下個月最可能退會的會員名單,手上只有一張 300 列的會員紀錄表,其中 200 列已經標好「有退會/沒退會」
NVIDIA 在 Hugging Face 上開源了 Kumo Tabular,這是一個專門處理表格資料(客戶紀錄、交易、感測器日誌、理賠單、訂單)的 基礎模型先用海量資料學過通用能力、之後可以直接拿去解很多不同任務的大型模型。你給它一張「部分列已有答案」的表,再給它「想預測的新列」,它會在一次 前向傳遞資料從模型輸入端一路算到輸出端的單趟計算,不需要回頭修正參數 裡直接回傳預測結果。分類任務回傳各類別的機率,迴歸任務回傳數值。
傳統做法是用 梯度提升樹一種把很多棵小決策樹接力串起來、每棵專門修正前一棵錯誤的預測方法。這種方法很強,但每個新問題都要重新收集標籤、設計特徵、搜尋 超參數訓練前要人工設定的旋鈕,例如樹要長多深,模型自己學不出來、驗證再部署,而且模型不懂「表格」是什麼,每次都從零學起。Kumo Tabular 走的是另一條路:不訓練、不調參、不做特徵工程。
它的做法借自大型語言模型的 上下文學習不更新模型任何權重,只靠在輸入裡放幾個範例,就讓模型學會新任務。素材指出,這個模型是一個圍繞表格結構設計的 Transformer,用了欄位、列與上下文三種注意力(column、row、in-context attention,概念源自 TabICL 與 TabPFN)。它要同時做到三件事:懂每個值在該欄位裡的意思、懂同一列裡各欄位怎麼互相影響、懂已知標籤的「上下文列」跟待預測的「查詢列」之間的關係。
有幾個細節很特別。素材說它只用 人工合成資料由程式按規則生成的假資料,不是真實世界收集來的 預訓練,共有三種大小(2,800 萬到 2.15 億參數)。數值與類別欄位都會經過 傅立葉特徵把一個數字轉成一組不同頻率的正弦與餘弦值,讓模型更容易分辨數字的細微差異 編碼,缺失值不需要事先補齊。它以 OpenMDW-1.1 授權釋出,可以商用,並在 TabArena、BeyondArena、TALENT、ScoringBench 四個基準測試上都排第一。
| 面向 | 梯度提升樹(傳統) | Kumo Tabular |
|---|---|---|
| 每個新任務要做什麼 | 收集標籤、特徵工程、搜尋超參數、驗證、部署 | 準備帶標籤的表,一次前向傳遞 |
| 是否需要訓練 | 需要,每個任務從零學 | 不需要,不更新任何權重 |
| 預訓練資料 | 無(只學眼前的任務) | 只用人工合成資料 |
| 模型大小 | 依任務而定 | 三種:2,800 萬到 2.15 億參數 |
這是一段「概念示意」,不是 Kumo Tabular 的真實 API(素材沒有提供呼叫方式,請以官方 GitHub 為準)。它只用來說明「上下文列+查詢列=一次算出預測」的資料形狀。
context_X = [[80, 3], [75, 5], [30, 30], [25, 48]]context_y = [1, 1, 0, 0]query_X = [[78, 4]]# 概念:prediction = model(context_X, context_y, query_X)# 傳統做法:model.fit(X, y) 之後才能 model.predict(...)