Piffer 指出,AI 數學表現變強,關鍵可能不是推理更深,而是上下文視窗提供了近乎無限的符號工作記憶,能同時攤開更多假設與中間算式;但這項優勢在需要因果判斷的模糊問題上派不上用場。
(前情提要:AI 接管數學界?OpenAI Astra 模型破解 10 大百年難題,學者憂:人類貢獻將被抹煞)
(背景補充:Claude 挑戰人類 167 年未解的黎曼猜想,這是目前進度)
人類數學家一次頂多在腦中放住幾件不熟悉的事,這是研究者 Davide Piffer 在一篇評論裡的觀察起點。他指出,AI 在數學上愈來愈強,多數人歸因於推理能力進化,但更可能的解釋簡單得多:AI 手上有一本人類想像不到的巨大筆記本,能同時攤開幾百條中間算式、被放棄的路徑與尚未驗證的假設。
Piffer 把這個現象歸結成一句話:AI 表現得像是更聰明,其實可能只是少了一項人類與生俱來的限制,工作記憶幾乎沒有上限。
紙筆先接住
人類做心算時,最先卡住的往往不是邏輯,而是同時記住幾件事的能力。
操作本身通常不難,難的是一邊往下算,一邊還要保留剛剛算出來的部分結果。紙筆之所以能讓人算得更快,並不是因為讓人變聰明,而是把工作記憶外掛出去。專業數學家用符號、草稿紙、先前證過的引理,把推理攤開在紙面上,才有辦法繼續往下走。
Piffer 引用多篇心理學研究,說明工作記憶對數學表現的解釋力獨立於智商之外。Alloway 與 Passolunghi(2011)發現工作記憶對數學成績有獨立貢獻;Alloway 與 Alloway(2010)的六年追蹤研究顯示,五歲時的工作記憶表現比智商測驗更能預測日後學業成就;Blankenship(2015)與 Friso-van den Bos(2013)的研究也得出類似結論。
換句話說,兩個智商相近的孩子,工作記憶較大的那一個,數學通常學得比較好。這給了理解 AI 的線索:人類數學表現本來就被記憶瓶頸卡住,一部擁有龐大符號工作空間的機器,等於換了一套競賽規則。
上下文視窗,是一本攤開的帳本
上下文視窗(context window)扮演的角色,Piffer 形容成一本巨大的外部筆記本。
簡單來說就是,AI 一次能處理並保留的文字總量,題目敘述、定義、中間算式、放棄過的解法都能攤在裡面,隨時回頭檢視。這和人類默默在心裡替換一個數字的主動記憶不太一樣,語言模型寫下的字詞幾乎無法覆寫,只能不斷往後疊加,所以更精準的說法或許是增強型符號工作記憶,而不是真正意義上的工作記憶。
這個差異在數學上特別吃香,因為數學幾乎能被寫成沒有歧義的符號:假設、定義、已知條件、證明目標、已排除的情況,全部可以一字不漏留在紙上,不會因為心情或語境悄悄改變意思。
Piffer 舉例,一道題目只要同時記住 n 是奇數、p 是質數、x 不等於零,人類可能漏記其中一個條件,在推導中不小心除以零;AI 卻能在每一步都重新覆誦一次完整的前提。長推理鏈更是如此,證明的難度不只來自每一步有多難,也來自要同時協調多少步,AI「多想一會兒」帶來的進步,某種程度上只是在更大的筆記本裡做更廣的搜尋,未必是想得更深。
數學答案又能代回驗證、交給程式跑過,或送進形式化證明器檢查。簡單來說就是,能自動確認每一步推導是否符合邏輯規則的軟體,這種外部記憶才能被立即糾錯,不會一路累積成一團錯誤。
換成不確定的問題,筆記本就不管用
不過 Piffer 也補了一刀。換成一個不確定的問題,例如「某人為什麼突然不回訊息」,再大的上下文視窗也沒有用。
原因可能是對方在生氣、在忙、手機壞了,或是在迴避另一件事,關鍵資訊從一開始就沒被記錄下來,記憶再大也生不出沒被觀察到的事實。「公平」「成功」「有害」這類詞彙的意義本身會隨情境漂移,模型可以記住整段對話,卻依然可能誤解對話真正在講什麼。
政治分析、歷史解讀、商業判斷處境類似,真正的困難不是記不記得住,而是在證據不完整時找出正確的因果解釋。
Piffer 也承認,人類的工作記憶包含注意力、抑制、持續更新,語言模型的上下文相對被動,寫出去的內容改不了,所以他把 AI 的優勢限定在數學這種仰賴外部符號、又能被驗證的領域,而不是直接推論成「AI 記憶力比人類好,所以什麼都比人類強」。
他提出一個可實測的預測:AI 優勢應最大出現在條件多、計算長、分很多情況討論的題目上;換成只需一次概念躍遷的題目,優勢會明顯縮小。反過來,砍掉可用上下文或禁止寫出中間步驟,長篇數學題表現會不成比例崩掉。
Piffer 最後借物理學家 Wigner 的觀察收尾。Wigner 認識馮紐曼與愛因斯坦,他形容馮紐曼的頭腦是他見過最快、最銳利的,能瞬間吸收大量資訊、跨領域推導;但他認為愛因斯坦的理解更深、更原創,是那種能重新框定問題本身的人。
Piffer 認為,現在的 AI 更像機器放大版的馮紐曼,速度快、記性好,卻還不是愛因斯坦式、能推翻既有框架的那種深度。
📍相關報導📍
開源 Qwen3.8-27B 贏 Claude 9 項:輸的全是純推理?資料來自阿里發布

