OpenAI 公開 722 篇數學手稿四天後,The Verge 訪問 30 多位數學家,結論是裡面有真東西,但哪些成果可靠,可能要花好幾年才分得清。
(前情提要:OpenAI 一次公開 722 篇數學手稿,數學家轟 AI 公司「黑幫行徑」)
(背景補充:OpenAI 聲稱解開世紀數學難題,但陷入「挪用他人未公開研究」羅生門)
數學家看了四天,對 OpenAI 這批 AI 數學論文的初步結論是:裡面有真東西,但哪幾篇是對的,可能要花好幾年才分得清。OpenAI 10 月 7 日把 722 篇 AI 產出的數學手稿放上 GitHub,隔天就在更新紀錄中撤回 3 篇。
The Verge 訪問了 30 多位數學家,他們用「驚人」「前所未有」「超現實」形容這批成果。多數人同意,光是弄懂 OpenAI 放出了什麼就要花好幾年,也擔心數學界還沒消化完,OpenAI 就會丟出下一批。
到底有幾篇是對的?
目前還沒有人答得出來,OpenAI 自己也說不準。README 寫明,模型在評估過程中被丟了約 4,000 道題,OpenAI 再歸組並篩選,才有現在的目錄:719 篇手稿,歸成 372 組。這兩個數字不能相除成成功率,歸組後一道題可能併入別組。
驗證程度差很多。Lean 是一種讓電腦逐步檢查證明的程式語言,有 Lean 形式化的成果,邏輯上比較有把握。OpenAI 在更新紀錄裡算的是 300/719,約 42% 的主要結果附了形式化,不到一半;README 也自承,沒有形式化的結果可能有問題。
另外有形式化也不等於沒事。受訪者指出,電腦驗證的敘述不一定對得上論文的主張,還得逐一核對。
倫敦帝國學院的 Kevin Buzzard 說,在他的代數數論領域,只有約 6 項一眼看出值得注意,其中幾乎沒有經過 Lean 驗證。他要嘛讀「可能不正確的垃圾內容」,要嘛等別人讀、等別人形式化,才能確定結果對不對。
也有研究者私下說,部分論文似乎重複了別人走過的路,還有人說原本要寫幾百頁的結果被壓到幾十頁。
同時錯誤也已經出現。更新紀錄顯示,一篇談 Weil 類的論文裡有個正負號錯誤,論證因此不成立,另外兩篇建立在它上面、和 Hodge 猜想相關的論文也一起撤回。另有 14 篇被修訂。所有成果也都還沒經過同儕審查。
好的部分有多好?
撇開呈現方式,多位受訪者認為整體水準很高:在 AI 出現前,其中許多成果夠格登上頂尖期刊,足以讓作者拿到教職。史丹佛大學的 Jared Duker Lichtman 更認為,有「數十項」成果夠格讓作者成為菲爾茲獎(數學界最高榮譽之一)的有力人選,包括朝黎曼猜想推進、Hodge 猜想的特殊情形,以及四維 Kakeya 猜想。這是他個人的評估。
不過 OpenAI 在 README 註明,黎曼與 Hodge 這兩項不是用其餘成果那套固定流程做出來的,也沒有說明差在哪裡;黎曼那篇的其中一個版本還經過人工潤稿。
索邦大學的 Scott Armstrong 提醒,這些不是冷門題,很多是好幾代人試了幾十年的知名難題。
誰受衝擊最大?
對部分數學家來說,Openai 這次拋出的論文,等於讓他們看到自己的計畫一夜蒸發。聖安德魯斯大學的 Colva Roney-Dougal 說:「我有一群朋友和同事的研究經費申請剛被整個抹掉。」Armstrong 知道有一個團隊的整個研究計畫幾乎被清空;紐約大學的 Tristan Buckmaster 也聽說有三個人的計畫被抹掉。
受害最深的,是博士生、年輕研究者與沒有終身職的人,因為未解難題常是博士論文、經費申請與求職的基礎。波蘭密茨凱維奇大學的 Bartosz Naskręcki 則說:「這是社會問題,AI 實驗室完全無視。」
多數受訪者並不反對 AI 做數學,不少人自己也用 AI 工具。
不安來自做法:高調公告、初步寫稿,其餘丟給數學界消化,然後馬上往下一個目標走。數學家之間已在流傳還有下一波的說法,OpenAI 沒有回應 The Verge 是否還有下一批。Armstrong 說:「兩個月後會有東西把這次蓋過去。」他自認是對 AI 最樂觀的數學家之一,自己也用 AI,卻坦言「晚上有點難睡」,眼前目標是在「OpenAI 搶先之前」做完手上的研究。
📍相關報導📍
OpenAI 稱正在訓練的新模型已解開超 100 道數學難題,同步成立學者顧問團
數學家對 AI 公司不爽!菲爾茲獎 25 人連署砲轟:只會解題不是數學
AI 接管數學界?OpenAI Astra 模型破解 10 大百年難題,學者憂:人類貢獻將被抹煞

