📍 真實場景
自學寫程式滿三個月、正準備轉職當工程師的上班族
通勤路上滑手機,在 Hacker News 熱門文章看到「AI 解開十年數學難題」的新聞,忍不住點進去看
😖 卡住的地方:自己才剛搞懂變數跟迴圈,卻看到 AI 已經強到能解開數學家卡關十年的題目,心裡冒出一個念頭:我現在拚命學的東西,是不是很快就沒用了?
💡 讀完你會知道:這則新聞真正的重點不是「AI 有多聰明」,而是「AI 怎麼證明自己沒有唬爛」——這個判斷方法,以後你自己用 AI 寫程式、查資料時都用得上。
⚡ 一句話講清楚
OpenAI 內部代號叫「Astra」的下一代模型(還沒對外發布,是他們正在訓練測試的版本),在數學家與理論電腦科學家長年沒有進展的 10 個難題上,提出了新的解法或反例。這些題目橫跨球體堆疊、編碼理論、群論、量子計算、格密碼學等領域,每一題都是該領域專家公認「卡很久」的硬骨頭,不是隨便找冷門題目充數。
為什麼這則消息可信,而不是「AI 又在唬爛」?關鍵在於 形式化驗證把證明翻譯成電腦看得懂、可以逐行檢查邏輯是否成立的嚴謹格式,不是「感覺對」而是「電腦逐步驗算過,保證每一步都沒有邏輯漏洞」。OpenAI 讓模型把每個證明都用 Lean一套可以自動核對數學證明每一步是否正確的程式語言,像是請一位不會出錯、不會偷懶的助教把作業從頭核到尾 重新寫過一遍,核對通過才公開,這代表這些答案不是模型「掰出來看起來很像答案」的東西。
這也不只是抽象的數學遊戲。其中一題「closest vector problem」的難度證明,直接關係到 格密碼學一種利用高維空間裡的格子點規律來設計加密演算法的技術,目前被視為就算量子電腦出現也很難破解,是「後量子加密」的候選方案之一 的安全性基礎——換句話說,未來你我的網路加密、資安系統,都可能建立在這類研究之上。
🧠 工程思維透鏡(資深工程師看到的是什麼)
🔭 解 10 題卡關十年的數學難題,只花了大約 2000 美元的運算成本——這對「研究」這件事意味著什麼?
以前一個數學家可能窮盡職涯只為攻克一題,現在模型幾天內、幾千塊美金就能生出候選解法。好處是研究速度可能大幅加快,學者可以把心力放在「驗證與延伸」而非「從零想解法」;風險是如果大量候選解法湧入,同儕審查(peer review)的人力反而會變成新瓶頸,而且會有更多人依賴 AI 產出卻不懂原理,長期可能弱化人類獨立推理的能力。
🔭 OpenAI 為什麼堅持要模型自己把證明轉成 Lean 檢查一遍,而不是直接公布模型講的答案就好?
這是「相信模型推理」和「要求外部可驗證證據」之間的取捨。大型語言模型在長串多步驟推理中很容易「看起來邏輯通順、其實中間一步跳過或算錯」,人類專家要抓出這種錯誤也很花時間。強制過一次形式化驗證,等於用一個獨立、不會被『話術』說服的裁判把關,犧牲了一點速度跟彈性,換來的是「答案是真的對,不是模型很會辯」的信任基礎——這也是為什麼未來看到 AI 宣稱的成果,有沒有『形式化驗證』會是判斷可信度的重要分水嶺。