AI-LECTURER 速報課|2026-09-26|約 25 分鐘

AI 解得開歷史謎題嗎?先用五個問題檢查「這個題目能不能交給 AI」

📍 真實場景
林筱雯,歷史所博士班三年級,研究十七世紀歐洲的手抄書信與煉金術文獻

她手上有一大批已經掃描好的拉丁文與法文書信影像,決定用最新的 AI 模型幫她「解題」,而不只是幫她把手寫字轉成文字。

😖 卡住的地方:她第一次丟給 AI 的問題是「這位學者私底下到底相信什麼?」,得到一篇洋洋灑灑的分析,卻找不到任何方法檢查它是對是錯。她開始懷疑:是模型不夠強,還是自己問錯了問題?
💡 這課給你原文作者整理的「五問檢查表」:動手之前,先判斷一個研究題目適不適合交給最強的 AI,並用瀏覽器裡的體檢器親手試一次。

🧭 這到底是什麼(白話版)

這是一位歷史學者寫的實驗報告。他先前寫過 AI 用在歷史研究上的陷阱與用途,但他說 2024–25 年之後情況大變。這週 GPT-6 Sol 與 Opus 5.5 兩個新模型同時推出,他拿 前沿模型當下能力最頂尖的一批 AI 模型,不再只讓 大型語言模型(LLM)用大量文字訓練、能讀寫人類語言的 AI 做研究助理的雜事(例如轉錄文件),而是真的去解歷史上還沒解開的問題。

他的結論是:把歷史學家組成合作小組,搭配目前的前沿模型,可望在歷史知識與詮釋上產生許多進展,其中不少可能相當有意義。他說這在去年都還不是這樣,所以呼籲 AI 實驗室、歷史研究者與經費機構,都該開始主動推動這類合作。請注意,這是作者的看法(原文用「in my view」「my guess」這類語氣),不是已經被證實的定論。

不過並不是什麼歷史問題都適合。作者發現,和數學一樣,模型在遇到 可處理的問題模型有機會真的處理完的題目,原文說模型自己常用「tractable」來形容 時表現最好。他列出五個檢查問題:專家是否已經列出待解問題?需要的資料是否已經 數位化把紙本或手稿掃描、轉成電腦能讀取的檔案 且拿得到?題目是否對準 AI 的 尖刺式能力AI 不是樣樣平均,而是在某幾項特別突出,像多語推理、進階數學、在大量資料或跨學科之間自主查找?解法能不能靠寫 專用程式為這個題目量身寫的小程式,而不是現成軟體 完成?以及最重要的一題:答案能不能被明確證實或推翻?

照這五個標準,作者認為前沿 AI 目前能幫上忙的歷史「開放問題」其實相當有限,主要是三類:一、密碼與破譯把加密過的文字還原成能讀懂的內容;二、追蹤一段文字如何在不同語言的翻譯與改寫之間流傳;三、把只分散發表在各個小眾子領域、還沒被整合的研究發現連起來。作者自己的例子是:他用 GPT-6 Astra 辨認出牛頓自由翻成拉丁文的一段話,原文出自一本法文煉金術文本,而他說這個辨認似乎先前沒人做過。

🎯 為什麼值得你花時間

從「研究助理」升級成「解題夥伴」過去 AI 在歷史研究裡多半做轉錄文件這類輔助工作。作者這次的實驗是拿它去解真正的歷史問題,例如辨認牛頓那段翻譯的出處。如果他的判斷是對的,歷史學家與 AI 的合作小組可能帶來不少知識進展,這也是他呼籲 AI 實驗室與經費機構投入的理由。
挑對題目,比挑最強的模型更重要作者拿數學當對照:推理模型會先一步步推演再給答案的 AI 在數學領域勢如破竹,在人文領域卻沒有,關鍵原因之一是數學答案能被清楚證實或推翻。所以動手前先問「這個題目驗收得了嗎?」,能少走很多冤枉路。
這套檢查表不只適用歷史五個問題本身不綁定歷史:專家有沒有列出問題、資料拿不拿得到、有沒有對準 AI 強項、能不能寫程式、能不能驗證。你要把 AI 用進自己的工作之前,都可以先過一遍。(這是本課的延伸應用,原文談的是歷史研究。)

⚙️ 它是怎麼運作的

1
關卡一:專家已列出待解問題先確認這個領域的專家已經整理出一批「大家都同意需要解決」的問題。這樣你問的不是臨時想到的怪題目,成果也比較容易被同行拿來對照評價。
▼
2
關卡二:資料已數位化、拿得到AI 只能處理它讀得到的資料。手稿與書信如果還沒掃描成電腦可讀的檔案,或被鎖在拿不到的地方,題目再好也無從開工。
▼
3
關卡三:對準 AI 的尖刺式強項作者點名三項:多語推理、進階數學,以及在大量資料或跨學科領域之間自主查找。例如追蹤文本在不同語言間的流傳,就同時需要多語能力與大量比對。
▼
4
關卡四:解法適合靠專用程式完成作者把「解法適合用專用程式」列為條件。本課的理解是:能寫成程式的過程可以重跑、修改、檢查,不必全靠 AI 一次性的聊天回答。
▼
5
關卡五:答案能被證實或推翻(最重要)作者認為這是最關鍵的一條,也是推理模型在數學橫行、在人文領域沒那麼順的重要原因之一。答案沒有對錯的標準,你就分不出模型是真的解對,還是只是說得很像。
作者列出的三類適合題目(第三欄為本課整理,非原文逐字)
題目類型原文舉的例子為何較容易過關(本課整理)
密碼與破譯Astra 解開 1941 年德軍通訊與一戰德軍無線電密碼;作者也嘗試用 GPT-6 Astra 處理伊莉莎白時代神祕學家 John Dee 的密碼魔法書《Liber Loagaeth》(節錄未交代結果)還原出的文字讀不讀得通,一看就知道對不對,容易通過第 5 關
追蹤文本在翻譯與改寫間的流傳作者用 GPT-6 Astra 辨認出牛頓自由翻成拉丁文的一段話,出自一本法文煉金術文本需要跨語言比對大量文本,用得上多語推理;找到原文後可以逐句對照驗證
串起分散在小眾子領域的既有發現作者認為這類可能是最有影響力的新方法;原文節錄在舉例處中斷用得上在大量資料與跨學科之間自主查找的能力;成果要回頭查證各來源

🔍 程式碼漫遊(點有 ● 的行看白話講解)

把五問檢查表寫成一個小函式。這是本課自己寫的示範,不是原文的公式。重點是看「一票否決」怎麼寫:最重要的條件放在最前面先擋下來。

●CHECKS = ['experts_listed', 'data_digitized', 'fits_spiky',
💬 五個檢查項的名字,對應原文的五個問題:專家已列出問題、資料已數位化、對準 AI 強項……
● 'code_solvable', 'verifiable']
💬 ……能靠專用程式解、能被證實或推翻。用英文名字而不是數字編號,之後讀程式才看得懂每一項在問什麼。
●def assess(answers):
💬 answers 是一份字典(像一張填好的表單):每個檢查項對應 True(有)或 False(沒有)。
● if not answers['verifiable']:
💬 先檢查最重要的一項。這叫「提早退出」:一發現致命缺口,後面就不必再算。
● return '先別交給 AI'
💬 答案無法驗證,其他四項再漂亮也不算數。
● score = sum(answers[k] for k in CHECKS)
💬 把五項逐一取出來加總。Python 裡 True 算 1、False 算 0,所以總和就是「通過幾項」。
○ if score == 5:
● return '很適合'
💬 五項全過,才給最高評價。
○ if score >= 3:
● return '有機會,先補缺口'
💬 過了大半但還有缺口,回答的重點是「補什麼」,而不是「行不行」。
● return '缺口太多,先改題目'
💬 前面的條件都沒命中,就走到這裡:建議先縮小或重新定義題目。

🛠️ 動手做:題目體檢器:這個歷史問題能交給 AI 嗎?

  1. 先看預設的「辨認牛頓譯成拉丁文的那段文字」:五題全勾,體檢器給出「很適合」。這對應原文作者做出的實際例子。
  2. 從下拉選單換成「這位十七世紀學者內心真正相信什麼」:第 5 題沒勾,體檢器立刻一票否決。想一想,為什麼其他題目再怎麼勾都救不回來?
  3. 回到「牛頓」那題,只取消第 5 題、其他維持勾選,觀察結論怎麼變;再改成只取消第 2 題(資料數位化),比較兩種缺口的嚴重程度差在哪裡。
  4. 選「自己出題」,想一個你工作或興趣裡的問題(例如:我能不能用 AI 從一年份的客服紀錄找出最常見的退貨原因?),逐題誠實勾選,看看你最需要補哪一個缺口。
👇 下面是活的,直接操作

🧠 工程思維透鏡(資深工程師看到的是什麼)

🔭 如果你是工程師,為什麼會把「答案能否被證實或推翻」排在第一位?
工程師有個習慣:沒有測試的東西,就不知道它壞了沒。原文把「能否證實或推翻」列為最重要的條件,本質上是在問:這個題目有沒有「驗收標準」?數學題有標準答案,AI 解對解錯一目了然;解密後的文字讀不讀得通、找到的原文能不能逐句對上,也都能檢驗。相反地,「某人內心信什麼」沒有驗收標準,模型輸出再流暢也只是一篇文章。這裡的取捨是:能驗證的題目範圍窄,但成果可信;不能驗證的題目範圍寬,但成果只能當靈感。
🔭 「資料要數位化」「解法要能寫成專用程式」這兩條,其實在保護什麼?
它們保護的是「可重複、可檢查」。資料在電腦裡,才能被反覆讀取;解法寫成程式,別人(包括未來的你)才能重跑、找錯。如果整個過程只是和 AI 聊天,你得到的是一次性的答案,出錯了也不知道錯在哪。代價是前置成本:要先花時間掃描與整理資料,還要有人會寫程式。這是本課的工程角度解讀,原文只是把這兩項列為條件。
🔭 為什麼作者強調「尖刺式能力」,而不是說 AI 什麼都行?
「尖刺」意味著能力分布不平均:在某幾項(多語推理、進階數學、在大量資料中自主查找)特別突出,其他地方不一定。工程上這像選工具,不會拿鎚子去鎖螺絲。所以選題要「順著尖刺走」,例如追蹤文本在不同語言間的流傳,正好用上多語與大量比對。設計取捨在於:只挑對準強項的題目,命中率高,但看起來能做的事變少;什麼都丟給 AI,範圍廣,但失敗率也高。
🔭 讀這篇文章時,哪些地方該保持警覺?
第一,作者自己用「in my view」「my guess」這類語氣,並稱這些是早期結果;牛頓那段的辨認,他也只說「似乎」先前沒人做過。第二,文章網址的標題部分是 ai-labs-need-to-start-funding-historical(AI 實驗室該開始資助歷史……),帶有倡議資助這類合作的色彩,寫作目的之一是說服,不是中立的實驗報告。第三,本課取得的原文節錄在舉例處中斷,作者處理 John Dee 那本書的結果也沒有在節錄內交代,所以我們不能替他補上結論。資深工程師讀技術文章,會把「已驗證的結果」和「作者的主張」分開記。

📝 隨堂考(點選答案,立即回饋)

Q1. 依原文,作者把哪一個條件視為「最重要」的判斷標準?
✅ 原文在五個問題中特別標出「Most importantly」的是最後一項:解法能否被清楚證實或推翻。
Q2. 下列哪一個題目,最符合原文列出的「前沿 AI 可合理期待幫上忙」的類型?
✅ 密碼與破譯是原文列出的三類之一,而且還原出的文字讀不讀得通可以檢驗。其他三個選項都沒有明確的驗收標準。
Q3. 作者用 GPT-6 Astra 辨認牛頓自由翻譯成拉丁文的那段話,屬於哪一類題目?
✅ 牛頓把一段法文煉金術文本自由翻成拉丁文,作者要做的是找出原文出處,正是「追蹤文本在翻譯與改寫間的流傳」。
Q4. 原文說推理模型在數學橫行、在人文領域卻沒有,關鍵原因之一是什麼?
✅ 作者在第五個檢查問題旁補充:能否被明確證實或推翻,是推理模型在數學橫行、在人文領域卻沒有的關鍵原因之一。
Q5. 關於作者的主張,下列哪一種描述最貼近原文的語氣?
✅ 原文寫的是「early results」「in my view」「my guess」,是有依據的看法加上倡議,而不是定論;作者也明確說 AI 不只能做轉錄這類研究助理工作。

🃏 翻牌記憶卡(先想答案,再點開對答)

「尖刺式能力」指什麼?(原文列出的三項)點我翻面
AI 的能力不是樣樣平均,而是在特定項目特別突出:多語推理、進階數學,以及在大量資料或跨學科領域之間自主查找。
原文的五問檢查表點我翻面
1. 專家是否已列出待解問題?2. 資料是否已數位化、拿得到?3. 是否對準 AI 的尖刺式能力?4. 解法是否適合靠專用程式?5. 答案能否被明確證實或推翻?(最重要)
前沿 AI 目前可合理期待幫上忙的三類歷史問題點我翻面
1. 密碼與破譯;2. 追蹤文本在翻譯與改寫之間的流傳;3. 串起分散在小眾子領域、尚未被整合的既有發現。
為什麼「能證實或推翻」最重要?點我翻面
原文說它是推理模型在數學橫行、在人文領域卻沒那麼順的關鍵原因之一。答案有對錯標準,你才分得出模型是真的解對,還是只是說得很像。
作者自己做出的例子是什麼?點我翻面
用 GPT-6 Astra 辨認出牛頓自由翻成拉丁文的一段話,原文出自一本法文煉金術文本,作者稱這個辨認似乎先前沒人做過。他也嘗試處理 John Dee 的密碼魔法書,但原文節錄沒有交代結果。

✅ 離開前自測(全勾=這課真的學會了)

0%