Aioga
AI资讯 / 技巧观点
返回 AI资讯

ChatGPT 用反例推翻 Erdős 单位距离猜想,AI 自动形式化验证紧随其后

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-20T22:11:08.840Z热度 66

2026 年 5 月,ChatGPT 推翻了离散几何中的 Erdős 单位距离猜想,构造出反例。一周后,Logical Intelligence 的 AI 系统将该证明自动形式...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

2026 年 5 月,ChatGPT 推翻了离散几何中的 Erdős 单位距离猜想,构造出反例。

一周后,Logical Intelligence 的 AI 系统将该证明自动形式化为 Lean 代码。 6 月,OpenAI 的 Sol 模型在无任何数学公理假设下完成了完整形式化,生成 120 万行 Lean 代码,证明中涉及百页以上的全局类域论定理。

中文正文 · AI 翻译

过去几周对反例研究来说非常有趣。这篇文章基本上是我对形式化、人工智能工具,特别是反例领域所发生情况的看法。

两个月前的今天(2026年5月20日),ChatGPT 证明了离散几何中 Erdős 的单位距离猜想是错误的。这在现在已经是老消息了,但我必须从某处开始。官方公告:https://openai.com/index/model-disproves-discrete-geometry-conjecture/ 附带了人类数学家的见证,其中很多我认识,也有几位我信任,他们表示相信这一论证(他们曾提前获取过这一论证并进行了检查)。证明的基本结构是,20世纪60年代 Golod 和 Shafarevich 提出的一个重要数论定理可以用来构造该猜想的反例。

我中年危机已经过去9年,我意识到在技术细节上我不再信任许多人类数学家,发现了 Lean,并开始主张交互式定理证明器在未来数学中应发挥重要作用。因此,我的第一个问题当然是:“这个反例在 Lean 中被形式化了吗?”答案是“没有”。

但不到一周后(2026年5月26日),我收到了菲尔兹奖得主 Mike Freedman 的电子邮件。Mike 现在是 Logical Intelligence 的首席科学官:https://logicalintelligence.com/,这家公司由图灵奖得主、“人工智能教父” Yan LeCun 共同创办。Mike 告诉我,他们的系统已将整个 ChatGPT 生成的论文自动在 Lean 中形式化,问我是否可以看一看。我和我的博士后 Thomas Browning 都看了。确实,这正是 Logical Intelligence 所做的:他们形式化了数论重要定理蕴含 Erdős 反例的精确陈述。突破性的 LLM 生成数学得到了实时形式化。这是一个有趣的数据点。

当然,这里有一个不容忽视的问题,即数论中的一个深刻定理,其证明需要100多页(它需要大量的全局类域论,这是20世纪初发展起来的理论,至今仍没有简短的证明;压缩它一直非常困难)。在2025年,我与Richard Hill一起举办了一个Clay暑期学校:https://www.claymath.org/events/formalizing-class-field-theory/,研究类域论的形式化,一年后,我们几乎完成了局部情形(这是我学生Edison Xie当前的博士项目);全局情形仍然未解决,实际上在2025年,形式化全局类域论似乎像一个幻想。

我不确定Logos的工具会有多好,但我希望在Lean中发展有限平坦群方案理论,以用于我正在进行的费马大定理证明,所以我将该领域的一些经典论文上传到Fable和ChatGPT,并将它们整理在一起,用自然语言写成理论阐述。我在研讨会前一天将这份PDF文档交给了Logos,在研讨会的第一天,他们说PDF中的一个论断是错误的,并且他们找到了一个明确的反例。又一个反例!我看了一下,确实在描述一个标准构造时,LLM生成的PDF在某点是错误的;虚惊一场。不过,当我自己阅读这份PDF时也忽略了这一点。有趣的是,AI再次找到了一个反例。我修正了PDF。我觉得有趣的是,AI不仅仅说“我不太理解这个论证”,它反而说“这是一个证明,这个论证完全错误”,这是一个更强有力的声明。

随着有限平群方案理论的发展重新上轨道,我可以放松地回到FLT工作坊。7月7日星期二,我在午餐时坐在Akhil Mathew(https://math.uchicago.edu/~amathew/)对面;Akhil是芝加哥大学的数学教授,他是一个一直在尝试可用工具的与会者。我们讨论了人工智能可能研究的潜在问题,Akhil提出了Grothendieck的老问题:是否每个阶为n的有限自由群方案都会被n消去。Deligne在交换情形下已经证明了这个结果,而Grothendieck在基是约化的情况下证明了它;Rene Schoof在更多情况下也证明了它,甚至还出现了一篇论文(https://ems.press/content/serial-article-files/51994),由Emiliano Torti去年发表,在更一般的条件下证明了这一点。我说我认为这是让人工智能思考一个极好的话题。

我认为此刻值得退一步,审视一下人类专家对这类问题的态度。星期二(7月14日)我去帝国理工工作,Grothendieck的反例成为午餐时的热门话题。一位(我不打算透露姓名的)教职人员对我说,反例如此容易找到,仅仅表明人类尚未花足够的时间思考这个问题,这暗示Grothendieck提出的一个60年历史的问题实际上并不那么值得研究。我没有告诉他,我职业生涯早期曾花了一周时间努力研究这个问题。在我看来,我的同事只是在经历悲伤的五个阶段;目前他们似乎处于否认阶段。

午餐后,我与我的博士生Andrew Yang会面,他一直在用Lean形式化一个模性提升定理,这是我FLT工作的关键。Andrew参加了Logos FLT工作坊,现在可以使用Sol和Fable。他告诉我,使用这些工具,他写了25万行Lean代码,基本上在大约两周内就完成了整个项目。

几天前,我收到了帝国理工学院数学系一位教授的电子邮件,他对于我们的一些研究生每月支付200美元来使用Sol和Fable等模型感到惊讶。他说他认为这些人疯了。我没有立即回复。但在见过Andrew之后,我给那位教授回了邮件,并告诉他,在我看来,任何没有每月支付200美元来使用这些工具的博士生都是疯了。事实上,在研讨会期间,我从哈佛的博士生Bryan Wang那里了解到,哈佛已经为所有博士生、博士后和教职员工免费提供Fable访问权限。

但回到Akhil。我不确定他是否认真对待了我提出反驳霍奇猜想的想法。但看起来他已经深刻理解到,利用这些非凡的新AI工具,反例可能正是目前唾手可得的果实。他曾与Levent Alpöge讨论过在代数几何中寻找更多反例的想法,而12小时前,Levent在X上发布:https://x.com/__alpoge__/status/2079028340955197566?s=20,Fable发现了雅可比猜想的一个反例:https://en.wikipedia.org/wiki/Jacobian_conjecture。这是一件大事——这是代数几何中的一个著名问题,已经未解答达100年,许多人都曾思考过。显然,它是在2026年世界杯决赛期间被解决的。

今天早上,我醒来收到了Akhil发来的私信,说“我应该再提交一个PR吗?”,但这次他来晚了——Paul Lezeau已经手动形式化了这个反例,并在DeepMind的Formal Conjectures仓库中提交了一个PR:https://github.com/google-deepmind/formal-conjectures/pull/4474:https://github.com/google-deepmind/formal-conjectures。Mathlib中没有包含大量数学猜想的列表,但DeepMind的仓库有。由人类形式化猜想的重要性在于,如果人类一致认为某个Lean语句忠实地表达了一个猜想的核心思想,那么检查该(可能由AI生成的)Lean代码是否构成该猜想的证明或反例就变得微不足道。恭喜Levent,感谢Akhil向他提出这个问题,并感谢DeepMind已经形式化了该陈述,从而使反例的正式验证变得毫不费力。

雅可比猜想已被解决!哇!接下来的工作是让人类确切地理解这个例子中发生了什么。因为这类工作的真正价值在于让人类更好地理解数学。事实上,Akhil 一直在努力以比“这是一个随机环的随机表示和随机计算,显示某些东西不起作用”更深的方式理解格罗滕迪克的反例。接下来我们需要的是从这些非凡的例子中获得的洞察。

Unknown's avatar
ys's avatar

感谢这篇文章。你写道你“没有在阅读 AI 生成的非正式数学”,但也写道“接下来的工作是让人类确切理解这个例子中发生了什么。”我们如何在不阅读非正式 AI 输出的情况下做到这一点?我们肯定不会去看一个千行的 Lean 文件吧?

链接:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4839&_wpnonce=611d4e061b 赞

David Jao's avatar

我实际上觉得阅读形式化输出比非正式输出更容易。使用形式化输出时,不会有想象或者误解论证的危险。大多数合理的 Lean 开发都是按照引理的逻辑进展组织的,并且大多数引理对于熟悉该领域的人(当然也能读 Lean)来说可能显而易见,只剩下一小部分实际论证需要阅读。

链接:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4848&_wpnonce=ef34c24134 赞

dasc's avatar

嗯,那是因为你熟悉 Lean。在我看来,对初学者来说,阅读 Lean 证明非常困难,相比之下比如 Isabelle/HOL 会更容易。如果人类理解是主要目标,“非正式输出”,比如我认为是 Latex 文档,不应该被忽视。

如果未来所有证明都仅由 Lean/Rocq/任意证明助手生成,而知识只掌握在少数既懂证明助手又精通某个特定领域的人手中,那将非常悲哀。

链接:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4866&_wpnonce=99a1d09e1c 被 1 人点赞:#

我只开始使用 Lean 三个月;我很难称自己为专家。其实没有人会像传统意义上那样“阅读” Lean 的静态文档。你需要互动地逐步进行证明,并观察每一步的状态变化。

首先,要阅读数学就需要相当多的训练。阅读 Lean 只是基于此的一小步困难,只要你有学习的动力。

像:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4879&_wpnonce=2b36a92851 喜欢

Tanay Wakhare's avatar

解析如此大量的 LLM 和 Lean 输出正是我认为今年会出现的瓶颈。今后我们将面临两个巨大问题。

我认为,对于 Lean 的新手来说,更大的风险是形式化的内容与他们原本认为的不同。

这两者从根本上是关于用户界面/用户体验的问题,涉及到人类数学家如何应对信息过载,这正是我们在 https://mathvision.ai/ 解决的问题:https://mathvision.ai/ 🙂 如果你感兴趣,可以免费查看。

像:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4858&_wpnonce=eaf031ee8e 喜欢

jeanabousamra's avatar

“几天前,我收到帝国理工数学系一位教授的电子邮件,他对一些研究生每月支付 200 美元访问 Sol 和 Fable 这样的模型表示惊讶。他说,他认为这些人疯了。我当时没有立即回复。但在与 Andrew 会面后,我给教授回了邮件,告诉他在我看来,任何不每月支付 200 美元使用这些工具的博士生都是疯了。”

恕我直言,我觉得这条评论让人反感。除了其他问题,这笔钱将被用来向未来几代人竖起巨大的“V”手势,也就是建立大量额外的燃气发电厂来为新的数据中心供电。我不会因为别人这么做而评判他们,就像我不会因为别人吃红肉而评判一样,尤其是在这样一个竞争激烈的学术体系中,但如果你认为如果可能会影响职业生涯而不把工资的10%捐给不道德的公司是疯狂的,那么我们根本不是在同一套价值观下运作的。

点赞:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4840&_wpnonce=e68045bc2b 4人点赞:#

在提示的条件下,即互联网和多年的社交媒体鼓励我们做出本能反应,我的直觉是同意JAS的评论/回复。除了人们可能(或可能不)对构建和销售这些工具的公司有的看法之外,Kevin坦率承认的这种心态并不是我希望看到在攻读博士的人中被鼓励的。

点赞:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4842&_wpnonce=0e5a0eb3a1 1人点赞:#

可能有政治或社会福利方面的理由让人抵制人工智能对数学的接管。但是,从严格的功利主义角度来看,这些工具让你的生产力提高远超过10%,并且完全值得其成本。

我担心把我们大量资源交给AI公司所带来的社会影响,以及对来自那些200美元就是大数目的国家的人在公平性和获取上的担忧。此外,有证据表明,AI公司正在补贴当前订阅访问的费用,而实际成本远高于我们支付的费用。

点赞:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4847&_wpnonce=2bea7100ae 点赞

你应该根据实际数字来形成你的观点,数据中心使用的电力和水只占很小的一部分,比如与农业相比。所以,如果你是那种会因为别人吃红肉而评判别人的人,你也需要对AI用户进行相应比例的评判。

几个月前我就给研究生们提过同样的建议,支付最好的模型费用,尤其是现在它们仍然负担得起。参与证明使用案例(此时,还有疑问吗?),并让你的系/导师负责今后的模型费用。

点赞:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4844&_wpnonce=b7679e2bb6 点赞

我不知道这是否让人满意,但这是GPT对Jacobian例子的理解方法。取P1×P2->P3(例如P1上除子的联合),去掉分支点集并去掉P3的一个与映射P1->P3的某个点相切(除子三倍化)但不振荡(重数正好为二)的超平面。然后通过直接计算,其逆像是A3。

点赞:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4841&_wpnonce=6833b187db 点赞

比起我之前的评论/帖子更建设性一点:希望那些出于对形式化兴趣/承诺而关注此博客的人,也对理解代数几何感兴趣,我想给https://sbseminar.wordpress.com/2026/07/20/the-new-counterexample-to-the-jacobian-conjecture/ 提个信号,使这里能展开一些数学讨论。

点赞:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4843&_wpnonce=7b61124922 点赞

一组相当重要的哲学问题:当正式证明猜想的任务已经外包给由大型语言模型和证明助手组成的团队时,数学的意义和数学家的角色是什么?当数学家不再需要手动开展和撰写证明时,数学严谨性还有什么意义?

我觉得,数学形式主义观点的残余,在过去几年人工智能和证明助手的发展中已经基本被否定:显然,在大型语言模型在证明助手中撰写正式证明的时代,数学家仍然有他们的活动空间。

喜欢:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4851&_wpnonce=711b4dabd8 喜欢

“当正式证明猜想的任务已经被外包给一个由大型语言模型和证明助手组成的团队时,数学的意义和数学家的角色是什么?”

数学家的角色不仅仅是证明猜想,还包括提出猜想。提出一个有趣的/重要的/有用的、可能成为定理的陈述,通常需要与证明它同样多的创造性洞察(甚至更多)。

喜欢:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4873&_wpnonce=b7139e08dd 喜欢

目前,我同意,人类在提出猜想和判断结果的重要性方面仍有优势。但我可以合理地设想一个机器在提出猜想方面变得更好的世界。

下一个围绕探究和判断的护城河是责任和义务。我相信已经有一些法院案例,客户与人工智能客服聊天机器人互动时,从这些聊天机器人那里获得了错误的信息(例如,某航空公司的聊天机器人声称票务购买可以退款,而实际上不可以)。在所有这些案例中,那些聊天机器人所代表的公司都对聊天机器人所作的声明承担责任(例如,公司被迫履行承诺的退款)。目前,许多公司对允许机器代表它们承担责任持谨慎态度。人类仍然是责任目的上的最终保障。

喜欢:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4881&_wpnonce=fa96b95c51 喜欢

我有一篇文章(与Graber、Harris和Mazur合著)反驳了Serre在与Grothendieck通信中提出的一个关于有理点的猜想。我们的定理证明了这个猜想存在反例(作为一个更一般定理的推论),但我们的方法并没有给出具体的反例。几乎在随后的不久,就有人坐下来找到了一个具体的反例。说实话,这个具体反例可能在这个猜想打开的四十年里任何时候都可以被找到(如果有一个专注的人去寻找的话),但学术界预期这个猜想是真的。如果猜想是真的,那么去寻找反例就是浪费资源。现在人工智能意味着这种“寻找反例”的工作可能可以自动完成。这是一个非常棒的进展!正如其他人所说,我们可以尝试*反驳*正特征下的奇点解析(通过反驳关于特定有限域上特定簇的有理点的一些推论)。

喜欢: https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4884&_wpnonce=1c337d5605 喜欢

但在与Andrew会面后,我给教授发了邮件,告诉他在我看来,任何没有每月支付200美元访问这些工具的博士生都是疯狂的。

也许你本意是想表达对人工智能在数学上取得的进展感到兴奋。但从博士生的角度来看,这听起来非常不合时宜。在世界上的许多地区(包括欧洲和美国的许多地方),博士生的工资微薄,几乎难以维持生计。期望他们每月支付200美元是非常不合理且不切实际的。

喜欢: https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4867&_wpnonce=3f1d2ca959 由 1 个人点赞:#

我认为我们都希望哈佛式的做法,即机构支付访问费用,而不是从研究生工资中扣除以抵消成本。

我认为回到过去的美好时代是不现实的。即便你自己放弃使用人工智能,你也无法阻止其他人使用,而这些其他人正是你的竞争对手。

喜欢:https://xenaproject.wordpress.com/2026/07/20/human-mathematicians-are-being-outcounterexampled/?like_comment=4880&_wpnonce=37b71f919c 点赞

我们接下来需要的是可以从这些非凡例子中得出的洞察。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:2026 年 5 月,ChatGPT 推翻了离散几何中的 Erdős 单位距离猜想,构造出反例。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:实践类内容的价值在于是否能被复现、是否有明确边界,以及它能否转化为稳定的开发或工作流方法。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察示例是否可复现、工具版本变化、社区反馈和实际成本。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: xenaproject.wordpress.com

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-20T22:11:08.840Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

2026 年 5 月,ChatGPT 推翻了离散几何中的 Erdős 单位距离猜想,构造出反例。一周后,Logical Intelligence 的 AI 系统将该证明自动形式...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-20T22:11:08.840Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。