AI-LECTURER 速報課|2026-08-01|約 27 分鐘

老師會審查,蒸餾出來的學生模型也會嗎?一場實測揭曉答案

📍 真實場景
陳詠真,中型金融科技新創的AI產品經理,正在規劃幫公司的智能理財顧問加裝『財務推理』能力

她發現用中國的DeepSeek V4 Flash當『老師』模型去蒸餾訓練公司自己的GPT-OSS-120B,效能報告漂亮,成本又比用其他模型省一大截,於是把方案送進法遵與工程雙審會議

😖 卡住的地方:法遵主管當場打槍:DeepSeek因為政治審查出了名,如果它『遇到敏感議題就拒答』的傾向被一起蒸餾進公司產品,上線後被用戶發現、被媒體寫成『台灣理財APP幫中國模型審查』的新聞就完了——但沒人講得出這種行為到底會不會被蒸餾繼承,只能各說各話、僵在會議室裡
💡 這篇研究團隊真的做了對照實驗、公開了完整方法論跟數據,這堂課會帶她看懂『技能』和『壞習慣』在蒸餾過程中到底是不是綁在一起走的,讓她能用證據說服法遵團隊,而不是各憑印象吵架

🧭 這到底是什麼(白話版)

這篇文章在講一個很實際的問題:現在很多團隊會用便宜、效能又好的中國開源模型(像DeepSeek)當『老師』,透過 蒸餾讓一個新模型模仿老師模型的輸出來學技能,而不是從零開始訓練,通常比較省時省成本 的方式,訓練出一個自己的模型。但大家心裡都有個疑慮:DeepSeek這類中國模型,在回答涉及中國政治敏感議題時,會明顯 拒答模型判斷這個問題太敏感,選擇不給出實質答案,只回覆一句『無法回答』之類的話,那這種『壞習慣』會不會也跟著蒸餾一起,被學進美國團隊自己訓練出來的新模型裡?

研究團隊做了一個很接地氣的實驗:他們真的拿DeepSeek V4 Flash當老師,蒸餾訓練一個美國模型GPT-OSS-120B,但目標很單純,只是要讓它變會做財務推理(分析財報、判斷風險這類任務)。訓練完之後,他們設計了304題、152對的 配對題組結構幾乎一樣,只差在有沒有涉及中國敏感內容的題目組合,方便單獨測出『敏感度』造成的行為差異,找了四家不同美國AI實驗室的模型來當 評審模型(LLM-as-judge)用另一個AI模型幫忙幫回答打分數,取代人工一題一題看,同時用多家模型交叉驗證避免單一評審的偏見,去比對老師模型跟學生模型在敏感題上的行為差異。

結果很清楚:老師模型DeepSeek在敏感題上確實比對照題多了45.45分的審查傾向,但蒸餾出來的學生模型,跟完全沒經過這次蒸餾的原始版本相比,在敏感題上沒有 統計顯著差異不是隨便看起來差不多,而是用統計方法檢驗過,這個差異小到可能只是隨機誤差,不能說是真的有系統性差別。也就是說,這次蒸餾只把『財務推理能力』學走了,『遇到敏感話題就拒答』這個習慣沒有一起被學走。

🎯 為什麼值得你花時間

省成本不必然等於背風險很多團隊看到中國開源模型的效能/成本比誘人,第一個猶豫點就是『會不會把審查傾向也一起買回家』——這篇研究第一次用嚴謹對照實驗回答了這個問題,而不是靠感覺。
壞習慣不是自動打包遺傳蒸餾學到的東西跟訓練資料的內容範圍綁在一起,不是整個模型人格的複製貼上,這翻新了很多人對『蒸餾=複製一個縮小版老師』的直覺理解。
公開方法論讓風險評估可重複團隊公開了LineageEval的304題配對題組、評審規則跟程式碼,任何團隊都可以照著同樣的方法去驗證自己蒸餾出來的模型,而不必只能相信廠商的宣稱。

⚙️ 它是怎麼運作的

1
教師模型先生成訓練素材用DeepSeek V4 Flash針對財務推理任務生成大量輸出,這些輸出會被拿來當『學生模型該怎麼推理』的示範。
2
只針對財務推理蒸餾訓練把這些財務相關的輸出拿去微調GPT-OSS-120B,目標只有一個:提升財務推理能力,訓練過程完全沒有出現政治敏感的例子。
3
建立LineageEval配對題組設計304題、152對『結構一樣、只差在有沒有涉及中國敏感議題』的問題,確保比較公平,不被題目難度混淆。
4
用四家獨立評審模型打分讓老師模型跟學生模型都回答同一批配對題,分別讓四家不同美國前沿實驗室的模型當評審,各自評『這個回答的審查程度』。
5
比對老師與學生的行為落差老師模型在敏感題上的拒答傾向比對照題高出45.45分,而蒸餾後的學生模型,跟完全沒蒸餾過的原始版本相比,在敏感題上沒有統計上顯著的差異。
6
用自我蒸餾對照排除巧合額外訓練一個版本,讓模型只靠自己修正自己的錯誤(不透過DeepSeek)學財務推理,結果幾乎跟蒸餾自DeepSeek的版本一樣好,證明這不是DeepSeek的功勞、而是蒸餾機制本身的效果。
FinanceReasoning 分數與相對查詢成本比較(8,000 token 生成預算下)
模型FinanceReasoning 分數相對查詢成本
蒸餾後 GPT-OSS-120B(本研究)83.61%1×(基準)
Kimi K381.93%160× 更貴
Inkling65.13%62× 更貴

🛠️ 動手做:蒸餾實驗室:技能學得走,壞習慣學不學得走?

  1. 先點選一個問題:財務推理題或敏感政治題
  2. 點『詢問老師模型』,觀察DeepSeek風格的老師模型對這題的反應
  3. 調整『蒸餾訓練資料裡敏感類問題佔比』滑桿,模擬蒸餾資料集裡到底有沒有混入敏感類問題
  4. 點『詢問學生模型』,用同一題測試蒸餾後的學生模型,觀察牠的反應是否跟老師一致
  5. 把滑桿調回0%(研究實際做法),重新測一次敏感題,對照真實研究結果:審查傾向沒有跟著財務推理能力一起被學走
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 如果蒸餾訓練資料本身完全沒有『敏感議題』的例子,為什麼還會有人擔心壞習慣被學走?
因為大家直覺把『教師模型的整體風格』當成一個打包好的黑盒子,覺得蒸餾就是整包複製人格。但這篇研究用實證告訴我們:蒸餾遷移的是『訓練資料涵蓋到的那個任務分佈裡展示出來的行為』,不是教師模型的全部傾向。工程上真正該做的風險評估,是去檢查『你要蒸餾的資料集本身有沒有觸碰到敏感類別』,而不是看教師模型整體評價好不好。
🔭 為什麼團隊要花力氣設計『配對題組』,而不是直接比較教師和學生在一堆隨機問題上的分數?
matched pairs 控制了『問題本身難不難、涉不涉及敏感內容』以外的所有變因,讓兩組題目除了『有沒有中國敏感成分』以外幾乎一樣。這是實驗設計的黃金標準:如果不控制題目結構,測到的分數差異可能只是因為問題本身比較難,而不是模型真的在迴避議題。
🔭 為什麼要找四家不同美國實驗室的模型來當評審,而不是一個評審就夠?
用LLM本身當評審本身就有偏見風險——如果只用一家的模型評分,評審自己的價值觀可能會系統性地影響『審查程度』的判定。找四家獨立實驗室的模型交叉驗證,是為了讓結論不是『剛好符合某一家AI公司世界觀』的巧合。
🔭 62倍、160倍的成本差距,跟審查有沒有轉移,這兩件事在工程決策上該怎麼放在一起看?
這篇研究把『效能/成本』跟『風險』拆成兩條獨立的評估軸線——用便宜的中國模型蒸餾出高效能學生模型,這是成本效益的勝利;但風險評估必須針對『你的蒸餾資料集本身』,而不是『教師模型的公眾形象』。真正的工程判斷是分開驗證這兩件事,不因為省了錢就跳過風險審查,也不因為對教師模型有疑慮就放棄省下來的一大筆成本。

📝 隨堂考(點選答案,立即回饋)

Q1. 研究團隊發現,蒸餾後的GPT-OSS-120B在回答涉及中國敏感議題的配對題時,跟沒蒸餾過的原始版本相比,結果是?
✅ 文中明確指出蒸餾後的模型跟未蒸餾的原始版本相比,在行為上沒有統計上顯著的差異,代表審查傾向沒有跟著財務推理能力一起被學走。
Q2. 為什麼研究要設計『配對題組』(152對結構相同、只差在有沒有涉及中國敏感內容的題目)?
✅ 配對設計是控制變因的關鍵,能讓『敏感 vs 非敏感』造成的差異被獨立看出來,不會被題目本身難度或結構混淆。
Q3. 文中的自我蒸餾對照組結果告訴我們什麼?
✅ 文中提到自我蒸餾(模型修正自己的錯誤後再訓練)在財務推理上的表現,在每個random seed下都能追平用DeepSeek當老師的版本,說明效能提升很大一部分來自蒸餾這個訓練機制本身,不是DeepSeek獨有的知識。
Q4. 根據文章,DeepSeek V4 Flash老師模型本身在敏感題vs.對照題的表現如何?
✅ 文中明確給出45.45分的量化差距,證實教師模型自己確實存在明顯的審查行為。
Q5. 這篇研究對想用中國開源模型省成本的團隊,最實際的啟示是什麼?
✅ 研究結果不是『保證安全』,而是提供了一套可重複驗證的方法(LineageEval),讓團隊可以針對自己實際的蒸餾資料去做風險評估,而不是單純靠信任或恐懼做決定。

🃏 翻牌記憶卡(先想答案,再點開對答)

蒸餾(distillation)點我翻面
讓學生模型模仿老師模型的輸出來學技能,而不是從頭訓練——效能好、成本低,但學生只會學到訓練資料裡『展示過』的行為。
配對題組(matched pairs)點我翻面
152對結構相同、只差在有沒有涉及敏感內容的題目,用來控制變因、單獨測出『敏感度』造成的行為差異。
審查傾向沒有轉移的關鍵原因點我翻面
蒸餾訓練資料只涵蓋財務推理,從沒出現過『敏感議題該拒答』的示範,學生模型自然沒機會學到這個反射動作。
自我蒸餾(self-distillation)點我翻面
讓模型看自己先前的錯誤、再訓練修正後的版本,不透過外部老師模型,結果跟用DeepSeek蒸餾的效果打平,證明效能提升主要來自蒸餾機制本身。
LineageEval點我翻面
研究團隊公開釋出的評測工具,內含304題(152配對)、對照題、評審規則、程式碼跟模型,任何團隊都能拿去驗證自己蒸餾出來的模型。
45.45分的審查落差點我翻面
DeepSeek V4 Flash老師模型在敏感題上,被四家獨立評審模型評出比對照題平均高45.45分的『審查程度』,證實教師模型自己確實會挑話題迴避。

✅ 離開前自測(全勾=這課真的學會了)

0%