跳到內容

Technology

新聞|OpenAI 公開內部模型的 722 篇數學稿件,含準黎曼假設的證明宣稱

OpenAI 10 月 6 日在 GitHub 公開內部前沿模型產出的 722 篇數學稿件,分成 372 個結果家族,其中包括 ζ 函數在 Re s > 7/8 沒有零點的準黎曼假設證明。整理產出流程、主要宣稱、Lean 形式化實際涵蓋的範圍,以及數學界對驗證與揭露方式的批評。

AI
Published: at 09:00 AM
編輯本頁下載圖卡

重點

發生了什麼

OpenAI 在部落格文章〈Sharing AI progress in mathematics〉宣布釋出這批結果,同時開放儲存庫 openai/math(Apache-2.0 授權)。儲存庫的第一個 commit 在太平洋時間 10 月 6 日下午 2 點 58 分,台灣時間 10 月 7 日清晨。

儲存庫的內容:

一個家族把相關稿件歸在一起,可能包含主結果、配套論證、推論或替代證明。所有稿件的作者都署名 OpenAI。官方承諾修訂會以新版本記錄,舊版保留可查。

怎麼產出的

README 說,OpenAI 原本用數學評測集測試模型,這些評測飽和之後,才改成直接拿開放研究問題來測。流程是:

  1. 評估期間對模型提出約 4,000 個問題
  2. 絕大多數結果用同一個固定流程得到,平均每個結果約等於 ChatGPT Pro 三小時的思考算力
  3. 把輸出整理成家族與稿件,再用一個「足夠重要」的門檻篩選,最後留下 372 個家族

有些結果建立在模型更早產出的結果上。README 列出兩個例外:ζ 函數的零點自由區域,以及 CM 阿貝爾簇的 Hodge 猜想,兩者都沒有走固定流程。Re s > 11/12 那篇的寫法也經過人工編輯。

OpenAI 發言人告訴 Scientific American,幾乎每個結果都來自交給單一 agent 的單一提示詞,但也承認有些結果可能試了不只一次。上個月的 Navier–Stokes 證明動用了約一萬個 agent,算力成本達數百萬美元。

各領域的家族數:

領域家族數
理論計算機科學40
組合學37
代數與複幾何36
數論31
機率與統計力學29
微分幾何29
數學物理25
其他 10 個領域145

準黎曼假設

黎曼假設說,ζ 函數的非平凡零點都落在 Re s = 1/2 這條線上。準黎曼假設弱一些:只要求存在某個小於 1 的常數 θ,使 ζ 在 Re s > θ 的整個半平面上沒有零點。過去一百多年已知的零點自由區域都貼著 Re s = 1,而且越往虛軸高處越窄,從來沒有一條固定寬度的帶狀區域。

家族 003 的主稿件是 199 頁的〈The Quasi-Riemann Hypothesis: A Zero-Free Half-Plane Re s > 7/8〉,日期為 9 月 30 日。它宣稱:

同一家族還有兩篇:

Comparator 檢查的 ζ 敘述只有一行:對 Re s > 7/8 的複數 s,Mathlib 定義的 riemannZeta s ≠ 0,只允許 propext、Quot.sound、Classical.choice 三個標準公理。Dirichlet 與 Hecke 的版本各有一個敘述。範圍說明寫出了沒有涵蓋的部分:

10 月 7 日,一個獨立團隊在 GitHub 專案 davegoldblatt/openai-zeta-proof-check 重跑了 ζ 的檢查。Lean 預設 kernel 與另一個用 Rust 獨立實作的 nanoda kernel 都接受了證明,用到的公理也只有上述三個。這份證明約 2,900 個檔案、將近 50 萬行。團隊特別說明,他們只檢查了 Lean 證明,沒有審閱論文本身,而且只在一台機器上跑過。

羅格斯大學的數學家 Alex Kontorovich 在 X 上寫道,如果這是人類做到的,「會立刻拿到費爾茲獎,沒有疑問」。

其他主要宣稱

家族宣稱Lean 形式化
002Selmer 餘秩 0 或 1 的有理數橢圓曲線滿足完整的 BSD 公式未列入
017π 的無理性指數恰為 2有,Flint–Hills 級數的推論不在內
032CM 阿貝爾簇的有理 Hodge 猜想未列入,也沒有走固定流程
087對稱與一般形式的 Mahler 猜想有,函數形式的不等式不在內
102Khot 的 Unique Games 猜想,以及 Max-Cut、Vertex Cover 的近似困難度有
287所有非交換自由群因子彼此同構有,基本群的推論不在內

Nature 指出,這批稿件沒有解決剩下五個千禧年大獎難題中的任何一個,但有幾篇跟 Hodge 猜想、黎曼假設有關。OpenAI 發言人說,重要性「留給更廣的數學社群評估」。

Lean 涵蓋了多少

Lean 能保證的是:形式化敘述在給定的定義、匯入的定理與公理下成立。敘述是否忠實對應論文的宣稱,要靠人來核對,結果重不重要也一樣。New Scientist 指出,這批結果的 Lean 敘述跟論文對不對得上,目前還沒有人檢查。

儲存庫裡的數字:

依稿件資料夾上的日期分組:

稿件日期稿件數有 Lean 主結果
9 月 10–18 日40
9 月 22–27 日567159
9 月 30 日–10 月 2 日73
10 月 3–6 日1430

另有 1 篇沒有標日期。越接近釋出日寫成的稿件,形式化越少。

爭議

9 月 21 日,OpenAI 因為 Navier–Stokes 結果的公布方式引發爭議,宣布組成獨立的數學家諮詢小組,也就是高等研究院(IAS)的 Advisory Group on Mathematics and Artificial Intelligence。依 Scientific American 與 New Scientist 的整理,小組的建議跟這次的做法對照如下:

小組建議這次的做法
公開模型名稱只稱「內部前沿模型」
公開每個結果的提示詞未公開
公開算力成本只給平均約三小時 Pro 算力
盡可能形式化162 篇有主結果的形式化
揭露失敗的題目與選題方式只給出約 4,000 題的總數

OpenAI 發言人對 Scientific American 表示,公司認真看待這些指引,但不受其約束。

其他批評與回應:

限制與未知

參考資料

註釋

編輯本頁

Podcast

關於語音摘要

此語音摘要由 Google NotebookLM 提供,不完全代表作者本人對文章的理解。