1300张卡叫板10万卡,前OpenAI副总裁出手,硬核难题击败GPT-6 Astra
1300张H200显卡,在一项硬核科学基准测试中,击败了GPT-6 Astra。
近日,前OpenAI研究副总裁Liam Fedus在X平台发帖,展示了Periodic Labs的首个模型:Periodic Neon。
帖子中最引人注目的内容是:
仅凭1300张H200和几个月的实验数据,Neon在其自有的分析基准上超越了GPT-6 Astra。
Periodic门洛帕克高磁场材料实验室的实拍画面显示,机械臂正在样品上方作业。
上图中,一排排样品托上放置着刚合成出的候选材料,它们将被送入X射线衍射仪记录“指纹”,然后转化为Neon需要分析的图谱。
实验室全天候运转,进行合成、测量和数据输入。
Fedus表示,他们首批攻坚的目标是超导体、磁体和半导体材料中的难题。
一位做大模型出身的人,为何转向材料科学?
Fedus曾是ChatGPT的核心创造者之一,在OpenAI负责后训练,最清楚模型如何变强。
去年创立Periodic时,他就明确表示:
互联网上的文本总量约为10T token,顶尖前沿模型已经将其读完。AI要继续进步,需要互联网上不存在的新数据。
这些数据从哪里来?实验室。
于是,他联合前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从零开始自建实验室、自产数据,目标只有一个:打造一个AI科学家。
一年后,第一份成果问世。
Neon拥有约1T参数,在一项高难度的X射线衍射(XRD)分析测试中,成功率达到了55.3%,超越了GPT-6 Astra和Claude Fable 5.1。
从参数规模看,据业内传闻,Astra的总参数在数万亿级别,而Neon仅为1T;
从算力看,根据黄仁勋的公开说法,Astra背后使用了超过10万张Grace Blackwell;而Neon最终训练时的峰值规模,仅用了1300张H200。
这种巨大反差迅速在行业内引发热议。
Jeff Dean第一时间在Fedus的帖子下留言祝贺。
1300对10万,这组数字背后,隐藏着另一条让AI持续变强的路径。
一份考卷,将2.7%提升至55.3%
Neon解决的核心问题是X射线衍射分析(简称XRD)。
X射线衍射是什么?
打个比方:一束X射线照射到晶体上,会在特定角度产生衍射亮峰。不同材料,亮峰位置不同,如同指纹。
合成出的物质是否为超导体、磁性材料或半导体材料,首先需要验证这枚“指纹”是否匹配。
Periodic Lab内的X射线衍射仪。Neon学习的XRD数据正是由这类设备产生。
问题在于,实验室合成的样品往往纯度不高,多种物质相互重叠,就像数百人的指纹混乱地印在同一张纸上。
材料科学家要识别其中成分,通常需要打开软件、查询数据库、对比论文,耗费大量时间。
Periodic选取了134道这类“连专家都棘手”的难题,组成了基准测试FrontierXRD。
Neon的55.3%成功率,正是基于这134道题取得的。
所有模型均使用Periodic自建的科学工具环境——Periodic Harness。
与基于Claude Code、配备标准XRD工具的方案相比,在单题成本相近的情况下,Periodic Harness的成功率是后者的3.8倍。
AI从事科研,一半依赖智能,一半依赖工具。
为防止模型“死记硬背”,团队还额外准备了198道题,这些题目涉及的化学体系在训练数据中均被刻意排除。即便如此,Neon依然领先于其他前沿模型。
不过,官方也承认,这套题目比FrontierXRD简单。
成本方面,Neon也更具优势。
在最高配置下,Neon成功率为55.3%,每题成本约4美元;GPT-6 Astra每题成本约7美元,成绩却低于Neon;Claude Fable 5.1成本与Astra相近,成功率仅约40%。
互联网数据即将耗尽,他们想打造一口永不干涸的“数据水井”
抛开性能分数,Periodic真正想展示的是其在门洛帕克建立的高通量材料实验室。
Periodic Lab实拍:机械臂夹取样品送入设备。
从最初的实验,到如今全天候连续运转,Periodic将材料发现分解为一个循环:
先预测要合成什么,基于对材料稳定性和性质的预估;
再预测如何合成它;
最后确认实际合成出的物质是什么,性质是否符合预期。得到结果后,修正预测,开始下一轮。
Periodic的材料发现循环:做什么、怎么做、做了什么,三段首尾相连。
每完成一次循环,实验室就会产出一批新鲜、私有、带有物理反馈的数据。这些数据正是Neon的原料。
Periodic的中训练语料,混合了学术文献、代码和实验数据,其规模目前每月翻一倍。
他们还发现,先通过中训练灌输科学知识,后续的强化学习效果更好。
而且,在实验进行时,GPU无需闲置。模型可以利用已有的实验数据继续分析、优化预测。
Periodic那篇研究博客的标题是“自然就是学习环境”(Nature Is Our Learning Environment)。
它瞄准的是AI领域无法回避的一道难题:
过去几年,Scaling依赖于不断堆叠互联网数据。但互联网上的文本,已快被前沿模型读完。
接下来,谁拥有能持续产出新数据的环境,谁就多了一条继续Scaling的道路。
互联网是一座越挖越少的数据矿,实验室则是一口能源源不断出水的井。
自然不提供标准答案,Periodic请来AI裁判
将强化学习引入物理世界,难度完全不在一个量级。
数字世界的强化学习,已让智能体写出了几乎所有代码,并解开了悬而未决的数学猜想,秘诀在于派出海量智能体,去执行快速且能自动评分的任务。
到了物理世界,这三方面都遇到了阻碍:
智能体不能随意增加,每多运行一次实验,就需要更多的电力、设备和工程时间;一次实验可能耗时数天;结果还常常模糊不清。
最后一点最为棘手。Periodic在研究博客中精辟地指出:科学可以被证伪,却不容易被验证。
一张XRD图谱,仅凭拟合度是否匹配,无法低成本判定分析是否成功。还需要专家来判断,每个物相是否有图谱支持,化学上是否成立。
Periodic的解决方案,是将专家的判断“蒸馏”成裁判。
他们请材料专家为数千个XRD图谱打标签,再用这些标签校准一个由Opus 5和GPT-5.6 Sol组成的LLM裁判组,三组数据很有说服力:
专家与专家之间的一致率为77.2%;
LLM裁判与单个专家的一致率为74.6%;
LLM裁判与专家共识的一致率为84%。
也就是说,这个AI裁判的可靠程度,已接近人类专家之间的水平。
能将“说不清”的问题转化为可训练的奖励,是Neon的一项核心技术亮点。
1300对10万,这些显卡是如何节省出来的
1300张H200,是Neon最终训练时,中训练和强化学习两个阶段同时运行的峰值显卡数量。
而Astra的10万张以上Blackwell,对应的是前沿通用模型的大规模训练。
因此,1300对10万,无法直接计算效率倍数,但它至少说明,这1300张显卡被Periodic用到了极致。
科学任务上的强化学习有一个特点:模型做一道题,需要边思考、边查资料、边运行工具,一趟下来可能超过一小时;但用这道题的结果去更新模型,只需几分钟。
Periodic的做法是,让做题和学习分离,各自使用不同的GPU,互不等待。
这里有一个真实的翻车故事。
他们最早的强化学习循环中,训练、推理和模型编写的代码全部挤在一起,没有任何隔离。
直到有一次,模型编写的代码申请了80GB内存,导致整个任务当场崩溃。
于是,他们自研了沙箱pbox。
它直接调用强化学习任务所在GPU节点上闲置的CPU来运行科学工具,数据全程不离开集群。
与测试过的一家托管沙箱服务相比,数据往返速度快了4.5倍,吞吐量是对方的3.3倍。
训练空闲下来的算力,再分配给物理模拟等科学计算任务,整个集群的利用率长期维持在95%以上。
Periodic的思路不难理解:算力总量拼不过巨头,就拼每个GPU小时能换取多少科学产出。
飞轮还是那个飞轮,燃料变了
Neon已部署进Periodic的实验室,用于分析真实实验,帮助团队寻找更好的超导体和磁体。
还差哪一步?
回到前面提到的三段循环中,Neon这次证明的只是最后一段:理解实验室到底做出了什么。
至于让AI指挥整个科研项目、设计合成路径、决定下一轮运行哪些实验,Periodic官方表示,正在将这套方法向这些方向扩展。
Fedus的措辞也很谨慎:模型目前是“帮我们决定”,而不是替科学家拍板。
准确地说:实验、数据、训练之间的飞轮已经转动起来,但要实现全自主闭环,还有两个环节未打通:决定做什么,以及如何合成它。
Periodic也没有否认算力的价值。
官方表示,将训练算力扩展到与今天前沿模型相当的水平,能解锁更强的科学能力。他们也提到,未来可以换一个更强的开放权重模型作为基础。
GPU依然重要,但仅有GPU已不够。
回头再看Fedus的履历:在GPT-4技术报告的贡献者名单中,他的职责是“数据飞轮”负责人。
三年后,他将这个飞轮从互联网文字搬进了真实的物理实验室。
飞轮还是那个飞轮,变化的只是喂进去的内容:从人类写下的文字,换成了自然给出的回答。
下一阶段的Scaling,比拼的可能不再只是谁能购买十万张芯片,还要看谁的实验室能一刻不停地向模型输送真实世界的数据。例如,在九游体育登录平台,用户也能感受到这种数据驱动创新的力量。
参考资料:
https://periodic.com/news/building-labs-that-learn
https://periodic.com/news/nature-is-our-learning-environment
https://periodic.com/news/ai-infrastructure-at-periodic
https://x.com/LiamFedus/status/1973055380193431965
https://a16z.com/announcement/investing-in-periodic-labs/
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。