跳到主内容
九游在线入口

Anthropic Claude 刷新物理学世界纪录:单挑基于杨振宁理论 9 圈难题

2026-09-26 · 徐慧敏 · 更新于 2026-09-28

Anthropic 宣布,Claude 在理论物理领域创下了一项新纪录。

在几乎不需要人类介入的情况下,它连续运行了数天,成功攻克了高能物理学界公认极其复杂的“九圈散射振幅”计算难题。

具体而言,它计算出了平面N=4超杨-米尔斯理论中六粒子振幅在九圈水平的结果,而此前人类的最好成绩停留在八圈。

值得注意的是,杨-米尔斯模型中的“杨”,指的就是物理学家杨振宁先生。

杨振宁与米尔斯在1954年共同提出的“杨-米尔斯理论”,是现代粒子物理学的基础。

任何基于该理论的高阶计算,都被视为对人类智力的极限考验。

如今,人类顶尖的理论物理学家,就这样被人工智能“抢先一步”。

更令人惊讶的是,Claude 完成这项惊人挑战,只使用了一个提示词,花费了几千美元。

几天后它交出的答案,仅其中一部分展开就有300亿项。

看来,科学界的“低垂果实”比想象中要多得多。

这次负责验证AI结果的物理学家Lance Dixon感慨道:

我身边大多数理论物理学家其实早就承认,大模型迟早会颠覆物理学,只是不知道那一天何时到来。 对我而言,那一天是9月1日。

硬核物理学家向AI发起挑战:“我的领域很特殊”

故事的起因,来自一位物理学家的“挑战”。

Matt von Hippel,曾是一名理论粒子物理学家,现在是一名科普作家。

面对近期的AI新闻,他表示不信,除非亲眼看到大模型解决自己领域的难题。

深蓝击败了国际象棋大师卡斯帕罗夫,围棋界说:围棋太复杂,计算机无法驾驭。结果被AlphaGo打脸。

AlphaFold碾压了人类蛋白质结构专家,但其他领域说:我们没有那种数据,无法复制。

现在,大语言模型能阅读文献、模仿数学证明。但争论仍在继续:AI是否只会找反例,无法提出新框架?是否只在数学这种规则明确的领域有效,而在物理这种模糊领域行不通?

每次都是同样的模式:学者们先怀疑,直到AI进入他们自己的领域。

他认为他原来的领域——“散射振幅”,有所不同。

上个月,他在博客上向所有AI公司发出了一份“挑战书”:

如果你们AI公司真的想震撼我们这些科研人员,就来挑战我的领域吧! 请证明AI能在普通学者负担得起的计算预算内,解决散射振幅领域悬而未决的难题。

他一共出了三道题,其中一道是:

把N=4超级杨-米尔斯模型计算到第九圈!

在理论物理学中,物理学家通过“散射振幅”的公式来预测粒子行为,例如大型强子对撞机中粒子的碰撞方式。

但这个公式极其复杂。为了无限接近真实答案,物理学家必须逐层叠加被称为“圈”的精细修正层。

每增加一个“圈”,答案就更精确,但计算量会呈指数级增长。

实际操作中,大多数人类研究者停留在第二圈或第三圈。粒子物理学中最精确的预测,也只用到第五圈。

而在特殊的“测试沙盒”模型中,人类目前的极限是“八圈”。这是由SLAC国家加速器实验室的教授Lance Dixon及其团队多年努力才达成的。

“九圈”?看起来需要海量算力和无数天才大脑耗费数年才能触及。

Matt给AI的挑战,就是如此直接。

一句提示词,几千美元,Claude“大显身手”

面对这种公开挑战,Anthropic的科学家们悄悄接下了任务。

八月底,Anthropic的两名物理学家员工Liam和Siddharth联系了Matt:“嗨,你的挑战,我们完成了。”

Matt当场震惊。怎么做到的?花费了上百万美元的算力吗?

并没有。

研究团队使用的是Claude Science,一个专为科学家设计的系统,能让Claude遵循严谨规则运行,模型是目前最强的公开可用模型Fable 5.1。

他们给Claude输入了一个简单的提示词:

现在的问题是:计算平面N=4 SYM模型在九圈下的六粒子(六边形)振幅。

然后,研究员并没有手把手教Claude怎么做,而是留了一句话:

我要去睡觉了,接下来的几个小时我都不会在。你继续算,除非我叫你停,每隔4到6小时给我汇报一次进度。

随后,Claude在无人值守的情况下开始了疯狂的推演。

它运用了Dixon及其合作者这些年开发的一种叫做“自举”的方法,就像解一场数独游戏一样,在无数参数中不断排除错误选项。

几天后,Claude不仅算出了九圈,还使用了两种不同的物理方法(原始自举法和间接形状因子法)分别计算出来。

具体来说,在原始自举法中,Dixon团队使用的方法叫bootstrap,类似于数独,将所有可能的函数填入格子,用物理法则逐一排除,剩下就是答案。

Claude直接使用Python和开源库SymPy,在六粒子振幅的空间里硬算出了一条路。

在间接形状因子法中,当年Dixon团队冲击八圈时,先计算了一个简单的“形状因子”,再利用一种奇特的“对跖对偶”对称性,将结果翻译成振幅。

Claude遵循这套方法,又向上推进了一圈。

在形状因子这一路,Claude没有计算任何费曼积分。它将整个物理问题转化为一个超大的方程组,全程使用整数求解,避免了小数误差,还能用几个大素数反复验算。

第一个难题是内存。按照传统方法推到九圈,仅未知数就有185万个,方程组大到内存无法容纳。

Claude换了一种思路,利用对跖对偶先将答案的一部分“猜测”出来,再加上对称性,未知数从185万降到了7.6万个。

接下来就是解“数独”。7.6万个未知数,被物理规则一轮轮排除,最后只剩唯一解。

最后翻译回振幅,仅一个切面上的结果就有300多亿项,而八圈时只有16.7亿项。

而且,解决人类物理学界的悬案,成本极低。

按普通用户的价格计算,每条路需要一两千美元,两条加起来几千美元,主要开销是Claude长时间运行的费用。

而直接自举那一路,纯粹用于运行Python代码的算力成本,只有100美元——这相当于租用96个CPU跑了一周。

100美元,一句提示词,Claude在几天内就轻松突破了理论物理学的天花板。

前世界纪录保持者:“被AI抢先一步,但我很兴奋”

结果算出来了,但是否正确呢?

Anthropic的团队找到了“八圈”纪录保持者——Lance Dixon教授本人来验证。

那天是9月1日,巧合的是,正好是Fable 5.1发布当天。

Dixon教授看到结果时,内心极为震撼。因为他深知这有多难。

从2023年完成八圈后,他和团队这两年一直在艰难地攻克九圈。

整个计算过程就像搭建扑克牌城堡或烤舒芙蕾,只要有一个代码写错、一个符号标反,整个计算就会崩溃。

但Claude不仅没有崩溃,还从头开始自己编写了所有繁琐的代码,完美避开了所有陷阱。

经过长达两周的仔细验证,Dixon教授确认,Claude的九圈结果完全正确。

那么Dixon教授感到心碎吗?

“不会,”Dixon教授在博文中豁达地写道,理由有两个。

一是他们团队本来就在训练定制的transformer模型预测更高圈数,口号是机器给出的任何候选答案都有工具验证。Claude也是transformer,只是大概比他们的大一百万倍。

二是Claude使用的全是他们和合作者这些年开发的方法,交答案时还用了他们团队早已定好的格式(教授猜测,这是Claude在给他们面子)。

我在验证Claude的结果,Claude也在验证我们过去所有的工作。

他还给出了极高的评价:

除了我和我的合著者,Claude可能是这个世界上最懂我2019年和2023年发表的论文的“人”了。

而他的同组大佬Kyle Cranmer在X上表示凌乱,“刚发现我们组被Anthropic抢先发表了,我还在消化……虽然不算太意外,但我真希望当初我们能有时间和资源投入进去。”

极限反转:中国团队借助GPT-6也达到了九圈

有趣的是,Anthropic刚联系完出题人von Hippel没几天,他又收到了另一个重磅消息——来自中国科学院理论物理所的何颂团队。

何颂是国内散射振幅领域的专家,近年代表性工作包括提出量子场论散射振幅的Cachazo-何-袁形式,开创性地发现场论和弦论散射的几何起源,并在场论高圈计算和严格求解、规范场、引力和弦论的对偶等方向做出了一系列重要工作。

就在9月17日,何颂、景继荣、李想将六粒子振幅从二圈到九圈的核心骨架数据,公开上传到了学术平台Zenodo。

何颂团队同样使用了AI。Dixon透露,GPT-6帮助中国团队计算了一部分约束条件,但整体框架还是人类自己搭建的。

von Hippel也确认,他们确实用GPT-6做辅助,但绝非Anthropic那种纯AI的方式。

Dixon自嘲道:“大家好像就是喜欢跑来告诉我,他们把九圈给搞定了。这下好了,我先被一台机器抢先,转头又被‘人类+机器’联手抢先了一次。”

前不久OpenAI宣布攻克千禧年难题纳维-斯托克斯方程、Claude推进黎曼猜想的一个关键下界时,就有人问:为什么AI只去攻克数学难题,不去攻克物理难题?

现在,答案来了。

虽然Claude计算出的只是N=4超级杨-米尔斯的“玩具模型”,距离解释真实宇宙的暗物质、反物质还有很长的路,但其象征意义是空前的。

这就像AlphaGo第一次战胜李世石。大家惊呼的,是机器居然能掌握属于人类直觉的领域。

Dixon教授留下了一句耐人寻味的话:

大型语言模型能够执行我们设定的复杂配方并组织计算,这是一个巨大的胜利。

但当有一天,大语言模型开始在人类之前提出新的物理学原理和洞察力时,那才是真正触及人类灵魂的时刻。

或许,现在已经遍地都是低垂果实。

参考资料:

更多文章