
OpenAI一夜开源722篇数学手稿我翻完仓库先说结论导语北京时间 10 月 7 日OpenAI 在 GitHub 上开出一个叫 math 的仓库722 篇数学手稿、372 组成果全部出自一个尚未发布的内部模型。发布后两天仓库还在动撤了 3 篇、修了 14 篇、形式化又加了 11 个。我把新旧两个版本的仓库都下载到本地逐个数了一遍——里面有什么、怎么算出来的、哪些是真金、哪些还得攥着劲看这篇一次讲清。全文约 3600 字读完约 10 分钟。一、一个叫 math 的仓库提交者写着 Anonymous先说我点开仓库第一眼看到的画面仓库名就一个单词math没有描述、没有官网链接、没有话题标签当时整个仓库只有一次提交提交信息是干干净净的Initial commit提交者一栏写着——Anonymous匿名。但数据不撒谎这个页面在我截图时已经9.7k star、951 次 fork到本文截稿star 已过1.03 万fork 破千。一个上线不到一天的仓库靠口口相传冲到这个量级我上一次见到还是 ChatGPT 本尊。右侧语言统计条里有个细节值得圈出来Lean 占了 92.1%。Lean 是数学家用来给证明做机器验算的形式化语言——也就是说这个仓库的主体不是文档而是能被计算机逐行检查的证明。这跟AI 吹牛是完全不同的两码事后面细说。二、仓库里到底有什么结构简单到近乎粗暴四个部分overview.pdf一份 41 页的总览把 372 组成果按学科逐个介绍我下载后翻了一遍目录长这样CONTENTS.md手稿地图每篇论文的摘要和链接preprints/722 篇手稿的 PDF 和源文件每篇自带引用格式lean/机器可验证的形式化证明库。722 篇手稿归成372 组成果族——一组里面可以有主定理、配套引理、推论甚至同一结果的另一种证法。我把总览逐条数了一遍372 组成果的学科分布长这样理论计算机科学 40 组排第一组合数学 37 组、代数与复几何 36 组紧随其后数论 31 组排第四——名单上最响亮的名字确实扎堆在这里。还有一个反直觉的点清单里不全是证明了我把总览里 372 个成果族的标题逐一过了一遍44 组成果是证伪标题以 Counterexample、Disproof、refutation 为标志——一些流传半个多世纪的猜想是被 AI 拿反例推翻的。上面截图里那一排 Counterexample 开头的文件夹就是证据。还有一件事得说就在我写这篇文章的两天里仓库自己也在动。10 月 7 日官方在仓库里加了一份更新日志撤稿 3 篇一篇八维阿贝尔簇上 Weil 代数性的证明出了符号错误连带两篇依赖它的 K3 曲面论文一起下架撤稿通知和原稿存档都留在原位、修订 14 篇、更新 13 篇的引用另外补了 11 个 Lean 形式化。所以现在目录的自述是372 组成果族、719 篇手稿——722 减 3正好是撤掉的那三篇而 preprints 文件夹里躺着749 个目录多出来的 27 个全是修订版和新增形式化的配套稿被替换的旧版留档可查。成果族 372 组这个数一次都没变过。722 这个数字发布当天就没打算凝固——这是个活的仓库。三、目录大到 GitHub 都不肯渲染翻仓库的过程中我撞见一个哭笑不得的细节点开 CONTENTS.mdGitHub 直接回了一句这个文件太大了没法显示。我看了下文件大小——625 KB 的纯文本目录10 月 7 日更新后现为 624 KB。一份论文目录写得比普通论文的正文还长这个仓库的体量可见一斑。我绕到原始文件地址才看到了目录开头的真容。第一条编号 001就是Milne 有理性猜想——代数几何里挂了几十年的名字第二条002更狠直接冲着千禧年大奖难题 BSD 猜想的完整公式去的。四、这些结果是怎么算出来的OpenAI 官方中文公告的标题很克制——《分享 AI 在数学领域的进展》发布日期 10 月 6 日。我拿官方公告和仓库 README 互相印证着读关键口径对得上README 里写得坦白我把关键段落截图放在下面绝大多数成果出自同一个流程、一个尚未发布的内部模型。模型在评估期被投喂了约 4000 个开放数学问题平均每个成果烧掉相当于ChatGPT Pro 账号 3 小时的思考算力。4000 个问题里筛出 372 组站得住的存活率不到 10%。有两个例外流程值得单独记一笔对黎曼 zeta 函数无零点区域的研究以及CM 阿贝尔簇上霍奇猜想的证明其中 zeta 函数那篇还经过人工润色才发出来——官方自己都承认AI 写的论文人类读着费劲。另外仓库公开了10 个结果的推理过程摘要reasoning_traces 目录。我打开其中一篇——《π 的无理性指数是 2》42 页是模型思维链的缩写版里面甚至保留了模型原话的逐字引用VERBATIM EXCERPT。等于把 AI 怎么想的解剖给全人类看这在以前是不可想象的。既然下载了全部 749 个手稿目录含修订版与存档我还顺手干了件事把每篇论文的落款日期统计了一遍画出了这批成果的**“生产节奏”——9 月 23 日到 27 日是绝对主力窗口五天写出 565 篇峰值 9 月 24 日单日 194 篇10 月 5 日再冲 112 篇10 月 6 日打包上线。所谓一夜甩出 722 篇其实是一场打磨了两周多的闪电战**。而且发布不是终点。10 月 8 日仓库又推了一次Update manuscripts and Lean formalizations——合并这次更新的 PR来自一个叫codex/update-10-7的分支。看分支命名OpenAI 用自家的编程代理 Codex维护着自家数学模型产的数学仓库。这个细节比 722 这个数字更有未来感。五、清单上最硬的几根骨头我把传播最广的几个名字按分量排一下记住前提这些全是 OpenAI 的自述准黎曼猜想003 号黎曼猜想太远数学家退而求其次——证明某条竖线右侧完全没有零点。一百多年没做成的事OpenAI 声称把线划在了Re(s) 7/8而且对 zeta 函数和所有狄利克雷 L 函数同时成立附带 Lean 形式化。这是清单上传播最广的一条。我把论文原文打开看了标题就叫《The Quasi-Riemann Hypothesis》正文199 页。BSD 猜想002 006 号千禧年难题关于椭圆曲线上有理点与一个解析函数的深刻对应。OpenAI 声称对每条有理椭圆曲线在几乎所有二次扭曲上证出了完整的 BSD 公式还顺手带走 1979 年提出的 Goldfeld 猜想。这项没有形式化。希尔伯特第十问题有理数域版、霍奇猜想CM 阿贝尔簇——一道是希尔伯特 23 问的遗留悬案整数域原版 1970 年已解有理数域上至今开放一道是千禧年大奖难题。 再往下还有 π 的无理性指数、自旋玻璃的 Mézard–Parisi 公式、量子海森堡铁磁体的自发磁化、自由群因子同构……名字一个比一个唬人。六、先别跪三盆冷水照例要泼冷水一机器验证没有传闻中那么多而且口径还在变。媒体一窝蜂说约六成成果附带 Lean 形式化。我把仓库新旧两个版本的形式化清单都亲手数了一遍发布当天是162 篇论文的主结果有机器验证约占 722 篇的22%10 月 7 日更新后涨到173 篇按目录现列 719 篇算约24%。同一天README 里还冒出了一个新口径——官方自述约 42% 的 top-line 成果已形式化300/719“把配套和支撑结果的验证也算进去了。同一件事媒体六成、官方 42%、清单实数 24%三个数打架全看你怎么数。唯一不变的硬事实首页语言统计里 Lean 占 92.1% 只是验证工程本身的代码量别被它骗了——剩下大多数成果目前仍只能算声称”。官方自己也在 README 里承认有些未形式化的结果可能有问题发现了会尽快修。冷水二零同行评审。一篇论文从写完到被数学界真正消化正常要以年计。这次 722 篇一次性砸出来数学家们连读都读不完。普林斯顿高等研究院的数学与 AI 咨询小组AGMAI的表态很微妙——他们提前几周就知道了但声明写得很清楚咨询角色不代表对结果的背书“只有数学界本身才有资格做这个评判”。冷水三连数字都有对不上的地方——我顺手把悬案破了。《纽约时报》标题写 377 道数学问题仓库自己数出来 372 组成果族两个数对不上OpenAI 一直没解释。我把本地目录文件解析了一遍成果族编号从 001 排到 377中间缺了 45、61、70、123、163 五个号——纽约时报没数错是清单里留了五个空号大概率是撤下或未达标被拿走的成果。再加上上个月刚宣布的纳维-斯托克斯方程进展、以及《科学美国人》转述的几乎所有成果都源自给单个智能体的单个提示词质疑声一直没停过这是严谨的科学发布还是一场编排好的传播事件七、翻完仓库我的三个判断第一AI 做数学的门槛事件是真的发生了。不管最后几成成果经得起同行检验AI 在开放研究问题而不是竞赛题上批量产出候选成果这件事以前只存在于预言里。哪怕最后只有两成多 Lean 验证过的部分站得住这也是数学史级别的节点。第二Lean 可能是这波最大的赢家。当人类读不动 722 篇论文时机器验证成了唯一可行的质检手段。可以预见形式化验证会从小众爱好变成 AI 数学的标配基础设施——以后评判 AI 数学成果的第一问不再是证明写得漂亮吗而是过 Lean 了吗。第三对普通人的启示恰恰藏在细节里。4000 个问题、3 小时一个、存活率不到 10%、44 组成果是拿反例证伪的——这套数字组合拳说明即便是最强的模型也是靠大规模试错 严格筛选出成果的而不是AI 灵光一闪解出千年难题。神话叙事省省工程叙事为真。关键数字速查维度数字手稿总数发布 722 篇 → 10/7 更新后目录 719 篇撤 3 篇留档preprints 含存档共 749 个目录成果族372 组更新前后不变覆盖方向17 个数学方向尝试的问题约 4000 个存活率不足 10%单成果算力平均 ≈ ChatGPT Pro 思考 3 小时生产节奏9/23—27 五天 565 篇峰值单日 194 篇10/6 上线后追加 27 个目录10/8 经 codex 分支再推更新Lean 形式化发布 162 篇 → 更新后 173 篇主结果约 24%官方自述 top-line 口径 42%300/719推理摘要公开 10 个结果证伪类成果44 组成果族标题实测Counterexample/Disproof/refutation编号疑云编号至 377缺 45/61/70/123/163 五个空号实测更新后不变协议 / 状态Apache-2.0无同行评审成果以官方修订版本迭代最后仓库是公开的感兴趣可以直接去 GitHub 搜openai/mathgithub.com/openai/math——不用梯子外的任何工具README 十分钟能读完目录翻一翻就很震撼。看的时候建议带着一个问题如果 AI 一晚上能写出 722 篇论文发表这件事还值钱吗我的答案在文章里了你的答案欢迎评论区聊聊。参考资料openai/math 仓库 README 与 CONTENTS.md、OpenAI 官方博客《分享 AI 在数学领域的进展》本文截图均为实测页面《纽约时报》《科学美国人》相关报道36 氪《翻完 OpenAI 的 722 篇数学手稿我们挑出了最重的 30 道名题》上海证券报转载 AGMAI 声明。所有证明了/证伪了均为 OpenAI 官方表述绝大多数成果尚未经同行评审。