Claude研究版把黎曼ζ函数相关下界推至67.2%
论文、简明说明与Lean制品已公开,但67.2%下界不等于黎曼猜想获证。
本文要点
- 公开下界从官方概括的41.6%级别跃至优化后的约67.25%。
- 验证材料从自然语言论文扩展为简明说明、Lean制品和过程记录。
- AI数学展示从答题正确率转向可供研究者逐步复核的原创主张。
阅读辅助
先看数字、证据和来源,再读正文。
论文主张无条件把临界线上不同零点的渐近比例下界提高到约67.25%。
1859 · 黎曼提出后来被称为黎曼猜想的临界线命题;截至本文发布仍未获证明或证伪。
先从最容易被误读的比例尺说起:Anthropic公布的 67.2%,是“能够无条件证明落在临界线上的黎曼ζ函数非平凡零点所占比例”的新下界,不是“黎曼猜想完成了67.2%”,更不是对黎曼猜想的证明。技术论文把优化常数写得更细,为 0.6725…;基础版本先得到 2/3。
8月10日公开的材料不只是一则模型能力宣言。Anthropic同时放出了研究说明、一份由Claude署名的技术论文、人类数学家整理的简明证明说明,以及一套Lean 4形式化仓库。论文主张结果是无条件的,也就是定理本身没有先假设黎曼猜想成立。
可信度还没有走完最后一公里。官方称Anthropic内部两位数学家Levent Alpöge与Ralph Furman研究并验证了论文,Brian Conrey与Dan Goldston则在短时间内审看了材料;但官方对后两位使用的是“examined on short notice”,不能扩写成他们完成了正式同行评审或为全文背书。当前最稳妥的状态是:制品充分、主张重大、初步专家检查存在,广泛独立审阅尚未形成公开结论。
这对数学研究者和AI研究团队的意义不同。前者拿到的是一套可以逐引理质疑、逐文件重放的候选数学成果;后者看到的则是一种研究工作流:模型提出大量失败方向、让子智能体相互裁判、跑数值反例搜索、回查文献,再把自然语言证明迁移到形式系统。两种价值都成立,但都不能绕开第三方复核。
先把“比例”里的分母说清楚
黎曼猜想断言,黎曼ζ函数的全部非平凡零点都位于复平面上的临界线 Re(s)=1/2。所谓“至少多少比例在临界线上”,讨论的是随着高度 T 趋于无穷时,临界线上零点计数与全部非平凡零点计数的渐近比例下界;论文还区分“按重数计数”“不同零点”与“简单零点”。这些不是普通样本中抽查了多少个点,而是关于无穷零点集合的渐近定理。
| 命题或数字 | 它实际表达什么 | 它没有表达什么 |
|---|---|---|
| 黎曼猜想 | 100% 非平凡零点都在临界线上 | 不是有限高度的数值核验 |
| 既有公开记录 | Pratt等给出 κ > 0.417293,即 >41.7293% | 不能精确简写成“此前只有41.6%” |
| 新论文定理A、B | 无条件得到至少 2/3 的不同零点、简单零点在临界线上 | 没有定位剩余零点 |
| 新论文定理D | 优化测试函数后把下界推到约 67.25% | 没有把32.75%证明为临界线外零点 |
| 方法自身边界 | 论文估计仅用带宽一信息的证书上限约为 68.185% | 不能沿同一路线机械迭代到100% |
因此,“67.2%”与“证明黎曼猜想”的距离不是简单的 32.8个百分点。下界提升表示已有证明技术能覆盖更多零点;未被证书覆盖的部分可能在临界线上,也可能不在,现有论证不作判断。论文1.5节甚至明确说,这个结果对黎曼猜想的真伪“没有直接影响”,因为所用输入对少量离线零点并不敏感。
41.6%是标题口径,不是精确历史刻度
Anthropic研究页称长期下界从 41.6% 提高到 67.2%。这个叙述足以传达量级,但若用于研究比较,需要再精确一层。
Pratt、Robles、Zaharescu与Zeindler的论文在数值优化中报告 κ > 0.417293,也就是 >41.7293%;其定理标题使用“超过五分之十二”,而 5/12=41.666…%。Claude论文的历史段落则把这一档记录概括为 κ > 5/12 = 0.4166…。所以 41.6% 可以视为官方面对大众的粗略标签,却不应写成精确、无争议的前纪录小数。
这个修正不削弱新结果的幅度。用 41.7293% 而非 41.6% 作参照,提升仍约为 25.52个百分点。但它提醒读者:数学新闻中的“从A到B”常把定理的严格不等式、优化常数和便于传播的四舍五入混在一起;这里应保留原论文计数口径,不能只比较两个宣传数字。
证明的转轴:把零点侧读成矩阵
新论文没有继续微调产生41%级记录的Levinson“mollifier”路线。它沿着Montgomery的零点对相关思路,把Weil显式公式限制到一个有限维测试函数空间,并把所得Hermitian型看成矩阵。临界线上的零点贡献半正定、秩一的部分;由函数方程成对出现的离线零点,则贡献符号为 (1,1) 的块。
关键变化在于,传统论证在假设黎曼猜想时可以把零点侧当作实数上的正和来读;没有该假设,复零点破坏逐项正性。论文改用Sylvester惯性定律与秩—迹不等式,同时约束正负子空间,再把矩阵的一阶、二阶矩同素数一侧的无条件估计接起来。论文称,Baluyot、Goldston、Suriajaya与Turnage-Butterbaugh近年的工作提供了无条件的pair-correlation输入,Goldston与Suriajaya的前置论文则明确提出“若能从Montgomery证明移除RH,会得到三分之二临界线零点”这一目标。
这条机制链可以压缩为:
- Weil显式公式把零点与素数幂信息连接起来;
- 有限维压缩把零点贡献编码为Hermitian矩阵;
- 临界线零点与离线对具有不同的秩和符号结构;
- 素数侧给出矩阵迹与Frobenius范数的渐近量;
- 线性代数不等式把这些量翻译为临界线零点比例下界。
论文把 2/3 称为平坦测试族的结果,再以Montgomery–Taylor窗口优化到 0.6725…。这也解释了为什么从 67.2% 推到 100% 不是“多跑几轮智能体”即可完成:论文自己的方法分析认为,仅凭当前带宽的一阶、二阶信息,证书存在约 68.185% 的结构上限;再往上需要更宽的pair-correlation信息,而那会触及尚未知晓的素数对强度估计。
五类证据放在同一张桌上
| 证据制品 | 当前能支持的判断 | 当前不能替代的环节 |
|---|---|---|
| Anthropic研究页,8月10日 | 发布时点、实验规模、参与者和官方限定语 | 独立正确性判断 |
| Claude技术论文,8月10日 | 定理、定义、证明路线、常数与局限的完整主张 | 期刊同行评审结论 |
| 人类专家简明说明 | 展示Anthropic数学家如何压缩并重述核心证明 | 对长论文每一引理的公开审稿记录 |
| Lean 4仓库 | 提供可机器检查的定理语句、证明脚本与固定工具链 | 自动保证自然语言论文与形式化语句完全同义 |
| 54篇 arXiv检索 | 说明模型工作流主动做过查重和既有结果核对 | 系统综述、新颖性证明或证明正确性 |
“论文、说明、Lean”三件套的价值,在于它们允许不同背景的审阅者从不同入口攻击同一结论。自然语言论文便于解析数论专家核对方法与引用;简明说明把核心结构压短;Lean则把形式化语句交给内核逐步检查。三者相互补强,却不是三次独立验证,因为它们都来自同一项目发布链路,可能共享同一建模误差或遗漏的侧条件。
Lean通过了什么,尚未通过什么
仓库README称,定理A至E直接建立在Mathlib的riemannZeta与零点重数定义上,headline定理无额外假设,项目模块无sorry,#print axioms只报告Lean常用的 propext、Classical.choice、Quot.sound 三个标准公理。它还固定了Lean v4.33.0-rc2与Mathlib提交,并给出lake build、公理审计和comparator命令。8月10日的提交记录显示仓库在发布窗口内仍有文档与补充结果整理。
这些信息足以把“有一份形式化证明”提升为可操作的复核对象,但还要回答三层对应关系。其一,仓库是否能在独立、干净环境完整构建;其二,comparator中的受信语句是否恰好对应论文声称的计数函数、极限和常数;其三,自然语言证明中用于解释方法的新颖性、历史定位与适用范围,是否都被形式化定理覆盖。Lean内核擅长回答“给定形式语句是否由这些定义和公理推出”,却不会自动回答“这是不是作者原本想说的那条定理”。
还应注意仓库自己的审计边界。README区分了受信challenge文件与solution模块,并说明某些额外结论存在外部区间算术输入或未包含的技术补充。它不必然影响headline的ζ函数结果,但独立复核者仍应以具体提交、具体工具链和具体定理名为单位,而不能只看“Lean verified”标签。
专家看过,与同行评审通过之间
官方材料给出了四位人类数学家的角色。Alpöge与Furman是Anthropic内部数学家,研究并验证了Claude的工作,并制作专家说明;Conrey与Goldston是该领域专家,在短时间内审看论文。技术论文进一步写道,内部数学家研究结果、把它放入既有文献脉络,并对呈现负责。
这里最需要克制的是动词。内部“validated”是重要信号,却不是组织外独立复现;外部专家“examined”说明材料没有在发布前完全脱离领域视线,但官方没有公开逐条审稿意见,也没有说两位外部专家为全部细节签字。因此文章置信度维持为medium:事件、文件和定理主张高度可核查,数学正确性的最终社会性确认仍在进行。
同样,Claude下载 54篇 arXiv论文进行查重,是一个有价值的过程指标,而不是结果指标。公开页面没有提供这54篇的列表、检索式、纳入排除标准,也无法据此判断是否覆盖非arXiv期刊文献。它能支持“模型尝试避免重复已有结果”,不能支持“已经证明全球文献中无人做过”。
这项工作的核心增量,是让原创数学主张第一次以较完整的“可攻击面”进入公共视野:读者可以质疑论文引理,可以对照人类整理版,可以重放Lean,还可以检查模型的过程记录。相比只给最终答案或比赛分数,这更接近科学共同体真正能消费的AI产物。
但制品多不等于独立证据多。论文、说明、形式化仓库和流程叙述都由Anthropic组织发布;即使四者内部一致,也可能共享同一个定义偏差。短期内最重要的不是继续放大“AI攻克数学”的叙事,而是让无利益关联的解析数论专家与Lean维护者分别复核,再把两条审阅链对接起来。
如果核心证明经受住这种复核,它会成为AI参与原创数学的一座方法论路标:模型的贡献不再只以“是否答对一道已知题”计量,而以“是否提出新结构、能否生成可审计制品、能否承受独立反驳”计量。若发现漏洞,这套公开材料同样有价值,因为它能精确展示多智能体自审和形式化迁移在哪一层失效。
下一步应当怎样验
最有信息量的后续,不是社交媒体上再转述一次 67.2%,而是出现署名清楚、可定位到引理的外部审阅。解析数论侧尤其需要检查Weil型有限压缩的零点尾项、离线零点块的符号计数、从素数侧二阶矩到矩阵范数的误差控制,以及Montgomery–Taylor优化是否保持同一无条件口径。
形式化侧则应从指定提交开始,在新环境获取固定Mathlib版本,依次运行默认构建、Solution与Multiplicity目标、公理打印和comparator;随后把定理A、B、D中的计数函数、重数约定、liminf的ε形式,与论文的自然语言逐项对照。能构建只是起点,语义对齐才是“Lean证明支持新闻标题”的关键。
最后看发布路径:论文是否进入arXiv或正式期刊,是否公开 54篇检索清单,外部专家是否发表独立说明,仓库是否出现实质性证明修订。只要这些环节尚未发生,最准确的表述就应保持为:Anthropic发布了一项有论文、专家说明和形式化制品支撑的重大候选结果;它把相关无条件下界推至约 67.25%,但没有证明黎曼猜想,且仍需更广泛的独立同行审阅。