AI 開始證明數學定理之後,數學家在做什麼:Odd Lots 談「證明充盈」的時代

2026 年 10 月 9 日 Bloomberg Odd Lots 訪問 MIT 工程教育副院長 Justin Solomon,談 AI 證明、Lean 驗證器、Navier-Stokes 反例與學術品質訊號的崩壞。教育性聽後心得,非投資建議,不含個股推薦與目標價。

不學自知,不問自曉,古今行事,未之有也。
—— 王充《論衡・實知篇》(東漢,約 1 世紀)
2026 年 10 月 9 日 Bloomberg《Odd Lots》這集〈How AI Is Upending the World of Mathematics〉,主持人 Joe Weisenthal 與 Tracy Alloway 請來 MIT 工程學院教育副院長 Justin Solomon。他說 AI 生成的證明有時長到幾十萬行 Lean 程式碼,人類讀不完,正確性交給另一套不是 AI 的軟體去查;他也舉了一個數字——機器學習旗艦會議 ICLR 的投稿量,十年內從一兩千篇長到六萬篇,原本靠同儕審查當品質訊號的制度撐不住。Solomon 借用數學家 Terence Tao 的說法,把這件事叫做從「證明稀缺」走進「證明充盈」,值錢的位置從寫證明移到選題與驗證。他講的是學術圈,所以這集的適用範圍有個界線:產出能被大量生成、而驗證成本沒跟著掉下來的工作。
這集在講什麼
節目開場兩位主持人先承認自己不懂高等數學,Tracy 說她對這行的全部認識來自電影《心靈捕手》裡黑板上那堆公式,Joe 則說他把那篇 Navier-Stokes 的論文下載下來,讀不懂第一段。這個開場我挺喜歡,因為接下來的問題都是外行人會問的問題:高等數學到底在做什麼、數學家用不用計算機、AI 現在是在想題目還是在檢查答案。
Solomon 的背景剛好跨兩邊。他是應用數學出身,早年在 Pixar 工作過——他說電影裡的布料、煙霧、流體、亂飛的剛體,背後都是偏微分方程,要把演算法調到讓美術人員完全不用想到數學,是一個很硬的數學問題。他這學期教一門叫 shape analysis 的課,同時管 MIT 工程學院的教育。所以這集不是在談模型有多強,而是談一個行業的評價制度、師徒關係、學生怎麼學,被工具重新排了一次。
六個讓我停下來的點
一、正確性被外包給一個不是 AI 的軟體。 問到模型現在在做證明生成還是證明檢查,Solomon 的回答是「兩個都在做,也兩個都沒做」——模型檢查證明的能力很糟。過去一年的轉折是:把猜想丟給模型,讓它除了寫人類讀得懂的版本,另外吐出 Lean 這種程式語言寫的證明。Lean 內建幾條公理,軟體逐步驗過,驗過的就進入「已知為真」的庫,再往上堆。所以可信度來自那套檢查器,而我們換成要相信寫 Lean 的人。
二、那隻湯匙是人做的。 Navier-Stokes 方程描述杯子裡的液體怎麼流動。原本的千禧年問題問的是解會不會永遠存在、還是會在有限時間內爆掉——Solomon 說他大學的微分方程教授講得更白:你只要證明水不會爆炸,就能拿到一百萬美元。最近的消息是反例:用一支構造得很刁鑽的「湯匙」把流體攪成某個初始狀態,它會在有限時間內變成無限亂流。關鍵在於那支湯匙的構造,大半是西班牙一組人類數學家用紙筆長年做出來的,AI 接走最後一哩。他說 AI 在那個反例裡貢獻了關鍵洞見,但這不是從天外飛來的結果。
三、搶跑靠的是算力。 消息傳出有人接近反例之後,OpenAI 看來把一筆荒謬的算力砸進去,搶先寫出符合 Clay 研究所條件的東西。他們還公開說不需要那一百萬——燒兩分鐘的算力就是這個數字。Solomon 的反問是:那他們為什麼做?對當年的數學家,那一百萬改變一個人的生活;對實驗室,這是技術展示。他接著說一句我記了下來:你怎麼知道他們的模型不是部分用你的對話訓練出來的。
四、品質訊號一起失效。 他引 Tao 的觀察:過去判斷一個數學家做得好不好,發表在哪、產量、結果有多有趣、有沒有拿獎,這幾個指標互相相關;現在它們互相打架。AI 公司發現證出一個大定理是漂亮的新聞稿,於是多了一層經濟動機。更誇張的是 ICLR 六萬篇投稿那件事——整個社群花一兩個月互審,連 PDF 都打不開那麼多份,於是審查變得浮淺,他說有高中生因為做過一個專案就被系統分進審稿人池。
五、諂媚會生出一種新的信。 Tracy 問模型對數學題會不會也拍馬屁,Solomon 說看他的信箱就知道。他收到一堆陌生人來信,說自己跟 AI 玩出一個新結果、AI 告訴他們這很重要、需要一個 MIT 教授背書。他自己試過把本行幾個未解問題丟進去,沒解開(他笑說我這一角暫時安全),模型證了一個在他看來很表面的東西,底下還加了小註腳:就我所知文獻裡沒有這個,要不要我幫你排成期刊投稿格式?
六、能混搭,還沒看到從無到有。 他引同行 Nestor Guillen 的部落格說法:這些 AI 產出的新結果,多半落在既有知識的凸包裡——把我們已經知道的東西用很精巧的方式混搭、或把某人卡住的計算算完。至於提出一套原本不存在的理論,到現在沒看到多少例子。
Joe 追問那個 Navier-Stokes 反例優雅嗎,Solomon 說大概不優雅,裡頭全是不等式、上下界、指標,正確但讀不下去。他說損失在別處:如果證明變成無摩擦的,沿路那些會岔出新研究領域的花園小徑,就被剪掉了。
「資料看起來很完整」為什麼讓我更不安
我自己最常掉進去的坑,是收到一份排版漂亮、引用齊全、口氣肯定的報告,然後就接受了它。這集給我一個分辨的方法:問這份東西有沒有一個不靠產出者的檢查器。
數學家現在的做法,是把「寫得像不像真的」跟「是不是真的」分開——Lean 不理你的文筆。換到投資上,一樣的分法是:把公司說的故事跟我自己能重算的數字分開。營收與現金流從財報原始檔自己拉一次、口徑自己對一次,這就是我的 Lean。它不會告訴我這家公司好不好,它只會擋住一類錯:引用來源根本不存在、數字跟原始報表不合、兩個地方互相矛盾。
Solomon 說現在整個學術界的瓶頸從生產移到驗證,Tracy 接得更好:生成內容的能力上去了,驗證的能力沒有同步上去。我讀研究報告的時候就是這個處境——供給變多,我的驗證產能沒變。所以我後來改成反過來排:先決定我願意驗幾檔、驗到什麼深度,再去決定看幾份報告,而不是讀完一堆再煩惱哪些可信。
「AI 都會了,我還學這些幹嘛」
這句話我自己也問過。Solomon 在教育那段給的答案,比「保持學習」這種話具體:寫五段式作文從來就不是目的,它是為了訓練別的東西。他說 MIT 的學生這一兩年作業分數接近滿分,考試分數說的是另一回事——學生以為自己在學,感受跟結果脫鉤了。
所以他們改了課的結構。作業留著,但比喻換成舉重:你做它不是因為好玩,是因為你想變強。作業後面加一個小測,題目就是作業題複製貼上,確認學生懂自己交了什麼;期末專案加口頭報告。他那句話講得很乾淨:我們要教的是這個人,不是測一個模型的能力,這兩件事不一樣。
放到投資上我自己的對應是這樣。我可以叫模型幫我整理一家公司的競爭格局,省掉三小時;但如果我從來沒有自己從頭拆過一次損益表到自由現金流,我就沒有那個肌肉去看出模型漏了什麼。這裡沒有「要不要用工具」的問題,只有「哪幾塊我願意自己留著練」。我留著的是三塊:口徑怎麼定、失效條件怎麼寫、數字從哪一份原始檔來。
算力不平等,比不過就換賽道
這集有一段我覺得被低估了。Solomon 說他在 MIT 都覺得經費吃緊,而他的博士生想要最貴的雲端帳號,一個人一個月兩百美元——這個數字開始跟多請一個人的成本可以比。他也問了教育端一樣的問題:有兩百美元帳號的學生,作業答案是不是比較好?
更殘酷的是 Joe 指出的那件事:你在大學裡用的模型,確定比實驗室內部沒發表的那一代差;你花幾個月證明這條路可行,他們一週內用更強的模型做完。拿已知題目的答案去跟算力比,這條路對個人是輸的。
Solomon 給的出路跟 Tracy 的總結是同一件事:重心移到提出問題跟品味。他說典型的數學家不在做 Clay 研究所那七個問題,數學更多是關於品味,而不是把別人寫好的猜想證一遍;寫提示詞這件事,本來就是幾百年來我們在訓練學生做的事——定義問題、挑該問的問題、說清楚它能帶來什麼洞見。他也補了一句很實在的:典型的數學系學生最後去金融、去工程,對那些人來說,選題跟提問的能力才是關鍵。我自己看持股的時候,這對應到「我這次要回答哪一個問題」寫不寫得出來。寫不出來,我拿到任何資料都只是在收集。
可以參考的資料
- Bloomberg《Odd Lots》2026 年 10 月 9 日這集,與 Justin Solomon 的對談
- Terence Tao 關於數學進展指標互相脫鉤、「證明稀缺到證明充盈」的公開文章
- Lean 定理證明語言與它的數學庫,可以看它怎麼把公理堆成定理
- Clay Mathematics Institute 的千禧年問題清單,含 Navier-Stokes 與 P vs NP 的正式表述
- MIT 關於 AI 與教育的報告(節目中由 Solomon 提到,Sam Klopfer 與 Eric Madden 主筆)
- Nestor Guillen 討論 AI 新結果落在既有知識凸包內的部落格文章
帶得走的一件事
一個觀念:產出變便宜的時候,驗證就是你的工作。 這集從頭到尾在講同一件事的不同面向——證明可以大量生成了,於是價值跑去了 Lean 那一端、跑去了選題那一端。你手上任何「生成很快、檢查很慢」的東西,都會長出同樣的形狀。
我試過的一個做法,分享給你:挑一件你最近接受下來的結論——不限投資,可以是醫生說的一句話、家人轉給你的健康建議、同事給的專案時程——寫下兩行字。第一行:如果這是錯的,裂縫會先出現在哪裡。第二行:有什麼方法能看到那道裂縫,而且不用再去問原本給你結論的那個人。寫不出第二行,就是你還沒有自己的檢查器,而這件事你先知道了,比事後知道好。
本文為投資方法論的教育性分享,不構成任何個股買賣建議、不提供目標價、不針對當期標的。投資有風險,任何決策請自行判斷或諮詢合格的專業人士。
留言
載入留言中…