Aioga
AI资讯 / 论文研究
返回 AI资讯

宾大教授用 GPT-5.6 Sol Pro 在 90 分钟内推翻统计学 30 年未解猜想

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-15T17:35:12.000Z热度 68

宾夕法尼亚大学沃顿商学院教授 Edgar Dobriban 使用 OpenAI 的 GPT-5.6 Sol Pro 在约 90 分钟内推翻了一个存在 30 年的统计学猜想,证明...

论文研究The Decoder:AI News(RSS)

今日 AI 情报摘要

宾夕法尼亚大学沃顿商学院教授 Edgar Dobriban 使用 OpenAI 的 GPT-5.6 Sol Pro 在约 90 分钟内推翻了一个存在 30 年的统计学猜想,证明

Benjamini-Hochberg 方法在连续相关数据下无法始终可靠控制错误发现率。 其前代 GPT-5.5 在多个智能体协作超过 20 小时后仍未能给出有效解。 该结果目前主要具有理论意义,实际影响尚需进一步研究。

中文正文 · AI 翻译

宾夕法尼亚大学的一位统计学教授使用 OpenAI 的 GPT-5.6 解决了他研究领域中的一个核心未解问题。

Image description

当研究人员同时检验成千上万个假设时,比如扫描人类基因组寻找与疾病相关的基因,他们会遇到一个问题:检验的次数越多,漏掉的假阳性就越多。

1995 年,统计学家 Yoav Benjamini 和 Yosef Hochberg 发展了一种方法来限制这些假阳性。它控制假发现率(False Discovery Rate, FDR),即报告为显著结果中实际上是错误警报的比例。

Benjamini-Hochberg 方法(https://en.wikipedia.org/wiki/False_discovery_rate,简称 BH)现在被广泛应用于现代统计学及许多科学领域。根据宾夕法尼亚大学沃顿商学院副教授 Edgar Dobriban(https://x.com/EdgarDobriban)的说法,原始论文已被引用超过 13 万次。

Benjamini 和 Hochberg 最初表明他们的方法在独立数据上有效。然而,现实世界的数据点往往是相关的。例如,当基因组中某些位置经常共同遗传时,基因变异可能是相关的。

多年来,专家们假设 BH 方法在相关的、正态分布的数据上也能可靠工作,特别是在检验双向偏差时。但之前没有人证明过这一点。

an 现在使用 OpenAI 的 GPT-5.6 Sol Pro(https://the-decoder.com/openai-staffer-maps-out-which-of-gpt-5-6-sols-five-reasoning-levels-fits-which-task-complexity/)推翻了这一假设。在他的预印本中(https://faculty.wharton.upenn.edu/wp-content/uploads/2017/06/bh.pdf),他利用 AI 构建了一个统计模型,其中实际假发现率可证明超过了目标水平。模拟也证实了这一结果。Dobriban 还发布了相关的代码(https://github.com/dobriban/BH)。

Dobriban 写道,超过目标水平的差距“相对较小(0.104 对比 0.1)”,因此目前这一结果主要具有理论意义。实际影响仍需进一步研究,这一发现并不意味着 BH 方法通常不可用。

这个结果对统计学家仍然具有重要意义,因为在人工未能解决问题后,人工智能快速地解决了它。多布里班(Dobriban)表示,GPT-5.6 Sol Pro 大约用了 90 分钟,而 GPT-5.5 即使在几个代理共同工作约 20 小时后也无法找到解答。“所以能力的提升是真实存在的。生活在这样激动人心的时代!”他写道。完整的聊天记录和提示可在此查看:https://chatgpt.com/share/6a541c6f-a2d0-83ea-bb2f-782271a103ca。

伯克利统计学家威尔·菲希安(Will Fithian):https://x.com/wfithian/status/2077218361398964684 称这个被推翻的猜想是“我所在统计学领域中最有趣的未解问题”,并且这个结果是“AI 能力进步的又一个标志,其影响将远远超出数学领域。”

菲希安还暗示了这些结果对专家自身工作的冲击。“我忍不住怀念那些过去的日子,当一个关键结果总意味着可以庆祝的同事、值得欣赏的人类洞察力以及激励人心的人类成就。”

与数学中的类似案例一样:https://the-decoder.com/openais-gpt-5-6-sol-ultra-reportedly-solves-a-50-year-old-math-problem-in-under-an-hour/,这个解法似乎是结合了已有的方法,而不是完全产生全新的东西。多布里班说,这种组合不寻常,但结果最终“并不特别令人惊讶”。挑战在于找到正确的方法来连接已知的方法,而较新的模型成功做到了这一点。

这仍然留下一个更广泛的问题未解。基于人类数据训练的模型能否推理出真正的新知识,或者它们“只能”重新组合在训练中学到的内容:https://the-decoder.com/so-called-reasoning-models-are-more-efficient-but-not-more-capable-than-regular-llms-study-finds/? 即便重新组合是这些系统唯一能做的事情,它们作为内置于人类工作流程的日常工具已经证明很有用。多布里班的结果增加了一个不断扩大的例子列表:https://the-decoder.com/terence-tao-argues-ai-could-bring-division-of-labor-to-math-for-the-first-time-in-history/。

但更宏大的目标,比如构建能够自我改进且具备泛化能力的人工智能:https://the-decoder.com/deepmind-ceo-hassabis-says-nobody-in-the-world-knows-what-happens-next-so-cautious-optimism-means-building-guardrails-now/,可能需要超越简单重组的方法。深度学习先驱理查德·萨顿(Richard Sutton)也是持这种观点的人之一,他最近创办了一家初创公司,正是为了应对这一问题:https://the-decoder.com/turing-award-winner-rich-sutton-founds-oak-lab-to-build-ai-agents-that-learn-on-their-own/。

随时了解 AI 动态。清晰、有用、无废话。

关注 The Decoder,获取 AI 新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:宾夕法尼亚大学沃顿商学院教授 Edgar Dobriban 使用 OpenAI 的 GPT-5.6 Sol Pro 在约 90 分钟内推翻了一个存在 30 年的统计学猜想,证明 Aioga 将其归入「论文研究」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-15T17:35:12.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

宾夕法尼亚大学沃顿商学院教授 Edgar Dobriban 使用 OpenAI 的 GPT-5.6 Sol Pro 在约 90 分钟内推翻了一个存在 30 年的统计学猜想,证明...

The Decoder:AI News(RSS)2026-07-15T17:35:12.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。