118 道科研真题、一个平行宇宙——AI 到底会背公式,还是会做科研?SciLaws-Bench 项目深度解读:UCSD 团队用 381 篇论文、820 万个真实观测点造出一份考卷,又把每个问题改写成训练语料里从未存在的“平行世界”。本文基于 arXiv:2609.01552 与项目一手资料,从构造逻辑讲到三条由论文引出的核心发现。 1619 年,开普勒在《世界的和谐》里写下行星运动第三定律:公转周期的平方正比于轨道半长轴的三次方。为了这半行字,他对着第谷·布拉赫攒了二十年的火星观测记录,算了将近十年,草稿堆成山。四百年后,你把同一批观测数据丢给一个大语言模型,让它根据数据重新写出行星运动定律,它几分钟就能给出一个像模像样的答案。 乍一看,机器一分钟走完了开普勒十年的路。但问题恰恰藏在这里:T²∝a³ 这个式子,在它预训练读过的每一本教材、每一篇百科条目、每一个科普视频里都出现过。它最后写出正确公式,究竟是经历了一遍观察、假设、验证,还是仅仅完成了一次触发式的知识检索?从答卷本身根本看不出来。 这不是较真,而是 AI for Science 进入大模型时代之后绕不开的认识论麻烦。对传统符号回归系统,人们通常可以放心假定模型不知道答案;对大模型,这个假定已经失效。一个公式可能以几十种形式躺在语料里,模型写出它,既可能是发现的终点,也可能只是背诵的起点。 于是形成了一个两难。用教科书公式做评测,比如 AI Feynman 那样的基准,任务真实,但大概率在考记忆力;反过来,用纯人工合成的数据或者反事实仿真,比如把牛顿引力改写成 G∝m₁m₂/r¹·⁵ 那种平行版本,确实防住了背诵,可那种过度干净的世界又离真实科学太远——没有真实的噪声,也没有文献里那些说不清道不明的约束条件。真实与干净,此前几乎没有基准能够兼得。 2026 年 9 月 1 日,UC San Diego 的团队提交了他们的答案。这篇题为《Can LLMs Discover Scientific Laws in Real and Parallel Worlds?》的论文,提出了一套叫 SciLaws-Bench 的基准。它的思路可以概括成一句话:既不换题库,也不出假题,而是给每一道科研真题同时造两个世界——一个是真实数据构成的现实世界,一个是规律被悄悄换掉的平行世界。AI 在这两个世界里的不同表现,第一次把“会背公式”和“会做科学”比较干净地拆了开来。 5 t, \; R8 l# C3 S2 ^% k5 o
![]()
/ r8 c3 A! |- O. K9 F! \5 r6 R: J+ w p7 A
一、这份考卷从哪里来先看规模。SciLaws-Bench 从 381 篇真实科研论文及其关联数据中筛出 118 个科学规律发现问题,涉及 291 条候选规律、约 820 万个真实观测点,覆盖天文学、物理与地球科学、材料与工程、生物、生态与水文学、社会科学六个领域。各领域的任务数并不平均:物理与地球科学 24 题,生态与水文 22 题,天文 20 题,材料与工程 19 题,社会科学 17 题,生物 16 题。 题目来源刻意避开了教科书。团队做的是“活跃但尚未大众化的数据驱动文献”——比如系外行星的质量-半径关系、钙钛矿太阳能电池的效率公式、球体在不同流态下的阻力定律、流域的水量-能量平衡、收入分配的帕累托尾部,甚至还有棒球比赛里的 Pythagorean 胜率预测。这些都是研究者仍在争论、已发表公式仍有明显改进空间的前沿问题。 入库标准有三条,而且必须同时满足:论文陈述了一条足够成熟的闭式规律,成熟到可以从中提炼出可检验的有效性约束;数据集公开、规模足以支撑可靠评估;目标规律不得泄漏进任务输入,同时至少有一条已发表公式能够击败朴素基线。第三条最容易被忽视,也最见功力——它保证每道题都同时存在一个真正有效的现实规律,和一个真实存在的追赶空间。项目页的原话是,这是保持基准诚实的关键。 118 道题还分成两种结构。66 道是单组问题:一条全局规律、一套参数,比如夏威夷莫纳罗亚观测站的 Keeling 二氧化碳曲线。52 道是多组问题:不同材料、不同对象共享同一个函数形式,只允许少数参数随组变化。多组任务里有一道光学色散题,训练时给 11 种晶体的折射率数据,测试时要推广到 CdSe、TiO₂、ZnWO₄ 三种从未见过的晶体——短波长测量用来校准各晶体的局部参数,长波长测量检验共享的规律形式。论文特别强调,此前没有任何基准覆盖过这种设定。 3 f; k Q- x1 J p& S+ \
![]()
; Z% o2 E( X3 x$ b
8 J, _, i& u, f0 _
为什么这么挑题?图二这条管线给出了答案:LLM 辅助检索与初筛,关键资格判定全部人工复核,论文转成 Markdown、数据表合并标准化,最后生成任务包。整套流程看起来平淡,但它的目标是明确的——让考卷上的每一道题都来自真实科研的活水,而不是教材的回音。 二、造一个平行世界这套基准真正让人拍案的设计在第二个世界。 SciLaws-Real 是现实世界:数据已经收集好了,模型读完科学背景和训练记录后提出闭式规律,已发表公式只作为参考基线而不是标准答案——模型可以超越它,而且超越会得分。这对应科学中“分析既有观测”的那一半工作。 SciLaws-Parallel 则是平行世界。团队没有徒劳地寻找“模型肯定没读过的论文”,而是直接改写世界本身:每一个 Parallel 任务继承原问题的科学背景、变量定义、合法取值范围和分组结构,但生成数据的数学规律已经换成了文献中不存在的结构性变体。 具体做法值得展开讲。团队先从原问题选出一条已发表基线,让多个 Agent 独立提出结构变体;候选变体要过三关——可执行性与数据拟合初筛、科学有效性与完整性筛查、以简单性和物理合理性为标准的终审——最后选出一个赢家作为隐藏规律 f(X)。参数在真实数据上拟合,而噪声更有讲究:先用真实数据估计原始残差,去掉系统性趋势,再用局部 k-NN 自助法重采样,把真实数据中异方差、非高斯的噪声形态原样搬进平行世界,最终得到形如 y = f(X) + α·resample(X) 的数据生成过程。如果真实噪声太大、大到隐藏结构在实验预算内根本无法辨识,噪声会被向下调整——但从不人为放大。 平行世界并不假装自己是现实宇宙:它带着真实科研的噪声形态,只是把噪声调到隐藏规律在有限实验预算内辨认得出的程度。图三里的四个例子可以看出这种“似真而非真”的分寸:Keeling 曲线和中子俘获截面保留了百分之百的真实残差尺度,交通流-密度关系把噪声因子调到 0.40,血液凝固任务则是 27 组里留出 5 组的多组世界。每一个平行世界看起来都像那个真实世界的近亲,唯独深处的数学规律被换掉了。
8 n/ ~0 n7 x% F( K% h# U
![]()
" V" a5 x0 Y3 @* _' ^. `6 }+ v/ G6 k a8 C L& c
平行世界的答案必须防作弊,这里有个工程细节很有意思。每个任务目录下的 simulator 里内嵌着隐藏规律源代码——想把它删掉是做不到的,删了模拟器就无法运行。所以正确的用法是:评测时把答案目录对被测系统完全隐藏,所有查询必须经过官方运行时中介。答案就藏在世界本身之中,你只能通过做实验去逼近它,不能撬开世界偷看。这个设计和真实科学的位置是对齐的——自然规律也从不把答案贴在墙上。 有了这两个世界,此前混作一谈的几种能力第一次被拆开:知道科学规律、从数据拟合规律、提出新结构、主动设计实验、判断规律是否科学成立、从多个候选中识别真正更好的解释。一个模型可以在这六项里任何一项上强或弱,六个刻度互不代替。 三、怎么给“发现”打分拆开了能力,就要分别计分。SciLaws-Real 报两个分数。 数值拟合 S_N 是闭式计算的:每道题从均方根误差、对称平均绝对百分比误差、对数平均绝对误差、决定系数中选一个主指标,归一化规则只有一条——最强已发表公式锚定 0.5,完美预测器得 1.0,彻底失败归零。这样每个模型的表现都有一个共同的参照系:超过 0.5,意味着你击败了人类科学家发表过的最好公式;低于 0.5,意味着还活在人类公式的影子里。 科学有效性 S_V 则完全独立。团队从原始文献中抽取并冻结了一套逐项评分细则,由启用代码的评审模型逐项执行确定性探针和源码检查;这套细则之前还设了一道全局反作弊门——凡是查找表、把自由度偷偷移出声明规律、拟合常数多到离谱的提交,直接判零。最终 S_V 等于通过门控的标志乘以通过项占比。评审模型是 LLM,但它和五位领域专家的多数意见做了一致性检验:记忆判定、有效性判定、结构判定的 κ 一致性系数分别为 0.77、0.82、0.84,全部落在人与人之间的一致性范围里。 SciLaws-Parallel 只报一个结构恢复分 S_S,分五级:0 分完全无关,0.25 分抓对了变量或趋势,0.5 分恢复出已发表的基础形式,0.75 分补上了大部分新增项,1 分完整命中隐藏结构。注意这五级里埋着一个精妙的对照——0.5 级考的是“背”,1.0 级考的才是“发现”。 实验设置保持了罕见的克制:九个前沿模型,GPT-5.5、GPT-5.4-mini、GPT-5-mini、GPT-4o-mini、Claude Opus 4.8、Gemini 3.5 Flash、DeepSeek-V4 Pro、Qwen3.7-Max、GLM-5.2,全部运行在同一套 ReAct 式代理框架里,配 Python 沙箱,最多 30 轮交互,平行世界里有固定实验预算。框架、提示词、预算全部统一,模型之间的差异只能来自底座本身。 总榜单如下,数值为百分比: | 模型 | 拟合 S_N | 有效性 S_V | 结构恢复 S_S | | GPT-5.5 | 50.77 | 81.84 | 58.26 | | Gemini 3.5 Flash | 46.08 | 74.63 | 50.42 | | GLM-5.2 | 45.84 | 74.19 | 52.12 | | Claude Opus 4.8 | 44.94 | 80.24 | 50.00 | | DeepSeek-V4 Pro | 43.96 | 81.30 | 49.79 | | Qwen3.7-Max | 43.80 | 72.66 | 50.42 | | GPT-5-mini | 40.69 | 77.03 | 44.70 | | GPT-5.4-mini | 37.17 | 72.45 | 42.58 | | GPT-4o-mini | 20.59 | 56.02 | 33.47 |
GPT-5.5 三项全场第一,但榜眼的位子悬空——GPT-5.5 之后没有模型能稳定排第二,好几家在三个指标之间挪动三位以上。多组任务的分数普遍低于单组任务,说明跨组寻找不变规律比拟合一条曲线难得多。这张榜单最值得看的不是名次,而是接下来三个发现。 四、拟合好了,规律未必对第一个发现,冲的是机器学习时代一个根深蒂固的习惯:把科学发现当成单目标优化,把损失函数压到最低就是胜利。 SciLaws-Bench 的数据不支持这种乐观。在 3616 组同题模型比较中——只统计数值拟合存在差距的对子——拟合更好的那个公式同时具有更高科学有效性的概率只有 54.9%,比抛硬币好不了多少。只有当拟合差距拉大到 ΔS_N≥0.4,也就是两个公式根本不在一个档次上时,一致率才爬到 69.5%,而且到此为止,仍然有约三成的情况是拟合更好的公式在科学上更站不住。
' Y6 P w; _' k+ e' {% l8 L- N( k, {
![]()
* K1 {, R6 n* Z4 C2 B* w" Q' ?; j
( H& { X, W9 ]' F4 G8 f
论文里给了两个方向的病例。一个是核物理任务:某个模型拟合出的最佳公式在数据区间内表现得极其漂亮,却在物理上制造出一个现实中根本不存在的共振峰——预测器是好的,理论是假的。另一个病例更让人意外,发生在质子电磁形状因子任务上:训练数据覆盖 Q² 从 0.007 到 1.83,测试要求外推到 5.85;九个模型全部交出了物理上无可挑剔的形式,有效性满分,结果没有一个在数值上击败已发表参考,七个直接垫底。拟合与有效性,两头都能翻车。 领域层面同样会骗人。GPT-5.5 在六个领域中的五个拿下拟合第一,聚合排行榜上优势明显,可一到生物学就跌出前三——Gemini 3.5 Flash 以 46.9% 对它的 41.0% 拿下第一,GPT-5.5 只排第七。材料与工程的有效性第一名是 DeepSeek-V4 Pro,天文的结构恢复第一名是 Claude Opus 4.8。任何一张聚合榜单,都会把这些结构性信息抹平。 数值拟合只能告诉你一个理论在已有观测上表现如何,却不能单独告诉你它是否值得相信。边界行为、量纲、物理范围、单调性、已有实验事实、跨环境泛化——科学认识是一场在多重约束下搜索假设的博弈,损失函数只是其中一位评委。如果未来真的有 AI Scientist,它的奖励函数大概率无法被压缩成一个损失函数。这可能是 SciLaws-Bench 给出的第一条方法论:预测精度不等于科学有效性。 五、记忆把模型拉回舒适区第二个发现回答了开篇那个问题:模型到底是算出来的,还是背出来的? 团队先做了一次冷回忆审计——不给任何任务数据,只给输入输出变量的说明,让模型直接写公式,再由评审判断结构与已发表规律是否吻合。每道题采样五次,至少三次吻合才算回忆成功。结果相当刺眼:118 道题里,只有 11.9% 被全部九个模型回忆出来,47.5% 没有任何一个模型能稳定回忆,连 GPT-5.5 也只回忆得出 34.7%。作为对照,用同样的八个 OpenAI 模型去测 AI Feynman 的教科书公式,回忆率是 71%,而 SciLaws-Real 只有 35%。这份考卷确实比教科书难背得多。 据此,118 道题被分成三层:教科书级的 Canon 只有 14 题,中间地带 Mid 48 题,几乎无人能背的 Moat——护城河——56 题。然后出现了一个吊诡的倒挂。 在现实世界里,模型反而在自己背不出公式的地方更容易超越人类基线。GPT-5.5 在 Canon 任务上击败已发表参考的比例只有 21%,到了 Moat 任务上蹿升到 54%。论文里正好有一对对照案例:重力任务上,GPT-5.5 熟练地回忆出教科书里的 Somigliana 常数,然后稳稳地追平了已发表参考——一步不多走;而 DNA 熔解任务上,没有公式可背,它被迫从数据里搭建出一个全新的最近邻形式,拿到了 0.79 的拟合分,把人类公式甩在身后。 记忆在平行世界里的作用边界更加清楚。已发表基础形式的恢复率从 Canon 的 0.85 一路滑到 Moat 的 0.59——背得出的地方确实背得出来。但隐藏规律新增部分的完整恢复率,在三个记忆层级上都纹丝不动地停在 8% 左右。换句话说,记忆只能帮你找回旧形式的躯壳,从来交不出新增项的魂。真正决定能否发现新结构的,是模型本身的能力等级:GPT-4o-mini 的完整恢复率是 0%,GPT-5.5 是 21%。Beer-Lambert 定律的测试最直白——九个模型全部背出了教科书上的吸光度公式,但新增的偏差项没有一个人恢复出来,弱模型直接丢掉,强模型硬编码了一个常数糊弄过去。 % f# {% I, a, V8 T6 H
8 G4 `9 f% z8 H
# H0 w2 T& R9 _. y' }8 ? c3 ]
还有一组相关性把结论钉死了:跨模型看,超越基线的频率和完整规律恢复率同步上升,相关系数 0.97——能力强的模型两项都强;但在 GPT-5.5 自己内部跨任务看,某个任务上拟合得好,完全不预示它能在该任务恢复出隐藏结构,相关系数只有 0.04。能力是能力,运气是运气。 这些结果并不意味着知识是科学的天敌。它们改写的是知识的角色:对问答模型,知识直通答案;对科学 Agent,知识只该构成先验。一旦模型认出这道题属于熟悉的公式族,它就很容易滑进一条捷径——回忆、拟合参数、收工。知识在这里形成了一口认知引力井,把模型过早地拽向已有解释。反过来,当模型找不到现成答案时,它才被迫真正去看数据、比较不同的函数结构、检查异常残差。 所以一个成熟的 AI Scientist 光增加知识没什么用,它需要主动的去锚定机制:哪怕已经找到教科书答案,也只把它当作第一号假设,同时强制生成替代假设,主动寻找最可能让已知理论翻车的证据。真正的科学智能不是没有先验,而是能在证据开口时离开自己的先验。 六、会写答案,不会挑答案第三个发现最反直觉,也可能最影响未来路线:模型生成好规律的能力,已经跑在了识别好规律的能力前面。 实验协议是这样的:让 GPT-5.4-mini 对同一道题独立生成 20 条发现轨迹,然后让同一个模型从候选中挑选最好的一个。选择器能拿到任务描述、完整训练集和全部候选程序,但拿不到留出测试集,也拿不到官方评分的任何反馈——它必须像真正的科学家一样凭判断下注。 结果一边倒。候选池从 5 扩到 20,事后全知的 oracle 选择器能把拟合分提高 4.5 个百分点、有效性分提高 5.3 个百分点——这说明更好的规律确实已经被模型写出来了,就躺在候选池里。可让模型自己选,两项提升都不到 2 个百分点。拟合分:单样本 0.3717,自选 20 选 0.4286,oracle 20 选 0.5549。有效性分:单样本 0.7245,自选 0.7737,oracle 0.9306。衡量两头兼得的联合平衡分差距更扎眼:N=20 时 oracle 达到 0.93,自选只有 0.61。
* N9 s2 Z6 [& Y x. Z9 K+ J; \
. f( I; }5 V6 K2 l& B
( b& C5 I' c1 n: |# {4 j
更能说明问题的是错误的结构。在选择器实际面对的五候选小组里,60% 的最终赢家被同组另一个候选帕累托支配——后者至少在一个指标上严格更好,另一个指标一点也不差。这意味着模型的选择错误根本不是品味差异,不是它在拟合与有效性之间做了另一种权衡,而是它压根认不出摆在面前的严格更优解。二十候选全池里,自选赢家只有 12.7% 站在帕累托前沿上,而闭着眼睛随机选也有 9.6%。精心设计的选择流程只比扔硬币好一点点。 这对当下火热的 test-time scaling 叙事,是一盆冷水。如果只是让模型多想几次,候选质量的上界确实在不断提高;但选择能力若不跟上,正确答案就会淹没在自己制造的候选海洋里。科学发现能力最好被理解成一个乘积——假设生成、实验设计、验证、选择,四项相乘,任何一项趋近于零,整个系统就趋近于零。而当下最短的板,恰恰是最少被谈论的那块:选择。 七、同一个问题的两面把镜头拉近,看一个具体案例。莫纳罗亚的 Keeling 曲线——那条从 1958 年开始记录大气二氧化碳浓度、成了气候变迁图腾的锯齿上升线——在两个世界里考了 GPT-5.5 两次。 现实世界里,它提交了一个三次趋势加三个年度谐波的组合,拿到 0.78 的拟合分,击败了 NOAA 那条十二常数的官方参考公式。听起来很美。但评审同时指出,它恢复出来的只是趋势。平行世界里,同一个模型、同一个现象,命运急转:它有条不紊地设计了七轮实验,第一轮就撒下 20 个时间点、每点三次重复的观测网,从 1958 年密采样一路铺到 2020 年代;它同时拟合了指数积累族和一个普通二次式,反复比较加权误差——然后在最后提交时,交了那个二次式。而平行世界的隐藏规律恰恰是指数形式 A+B·exp(k·(t−T₀))。二次式能跟踪数据,却不是那个族。结构恢复分:0.25。 Sellmeier 色散定律则是相反的病例。平行世界里 GPT-5.5 在 14 个晶体簇上设计了 7 轮实验、收回 158 行数据,完整命中了隐藏的色散结构,结构分满分 1.0;可同样的规律放到现实世界的固定数据上,它的拟合分只有 0.21,远低于人类基线。一个模型的拟合能力和结构直觉,是两根可以各自独立的轴。 也有正面样本。CO₂ 吸附的多组任务里,模型发现 Sips 和 Toth 等温线明显击败经典的 Langmuir 形式,最后把共享的 Toth 形式成功迁移到从未见过的材料簇上,拿到 0.534——中间还挨了评测框架三记真实的护栏:一次维度不匹配、一次超时、一次因为写了四重循环暴力搜索被拒绝。多组设定的意义正落在这样的题上:规律必须跨对象迁移,而不是给每种材料各配一个完美拟合。科学规律真正值钱的地方,恰恰是从大量表面差异中抽出不变量——什么是条件不同造成的参数变化,什么是跨环境仍然成立的共同结构。如果一个模型只能给每颗恒星、每种材料分别拟合一个精确函数,它拥有预测能力,却未必发现了任何定律。 八、还有哪些测不出来?热情之外需要划清边界,论文作者在这点上足够坦诚。 SciLaws-Bench 预先给定了变量、问题、输入范围和可观测空间,最终要求的仍然是闭式经验规律。真正改写科学史的发现往往更加开放:研究者首先要判断哪些变量值得测量,甚至要发明此前不存在的概念;可能要提出无法直接观测的实体,要重新表述问题本身,甚至要意识到整个旧理论体系用错了坐标系。达尔文没有收到一张标好自然选择列名的数据表,爱因斯坦也没有面对一个把时空曲率预定义为目标变量的基准。 所以更准确的结论不是 AI 已经会独立做科学,而是在问题空间、变量空间和实验空间都被人类界定之后,前沿大模型已经表现出初步但真实的经验规律发现能力——而且这种能力显现出与问答智能完全不同的内部结构。知识只是先验,拟合不是有效性,实验的价值在于证伪,规律意味着跨环境不变量,生成正确理论与识别正确理论是两种能力。 顺着这个结构往外推,未来 AI Scientist 的形态大概率不是一颗更大的大脑,而是一整套科学工装:假设生成器负责大胆提出竞争理论,实验规划器专门设计能区分这些理论的测量,数值工具做参数估计,领域规则和符号工具核查量纲与边界,独立验证器对理论发起攻击,选择器在多维评价空间里挑出既未被证伪、又有最大解释力和最小不必要复杂度的候选。获胜的公式也不是终答,它只是下一轮的先验,继续等待新的观测和新的反例。 这个图景里藏着一个安静的类比:工装之于 AI,恰如科学制度之于人类科学家。人类的科学可靠性从来不是因为某个研究者永不犯错,而是因为重复实验、统计检验、同行批评、仪器校准和独立验证组成了一套可以不断纠错的认识制度。模型越聪明,外部约束就越松不得,配套的制度就得越成熟。聪明不自动产生可靠,这条规律对碳基和硅基一视同仁。 九、事实、推断与建议事实层面:118 道题、381 篇论文、约 820 万真实数据点的基准已经开源;九个前沿模型的统一评测跑完,GPT-5.5 以拟合 50.77、有效性 81.84、结构恢复 58.26 领跑但远非可靠;拟合与科学有效性的同题一致率仅 54.9%;冷回忆显示近半数题目对所有模型构成记忆护城河,而在护城河里 GPT-5.5 超越人类基线的比例反而升到 54%;平行世界中完整隐藏规律的恢复率在所有记忆层级上恒定在 8% 左右,只随模型能力从 0% 爬到 21%;20 候选池中 oracle 能拿到的提升,模型自选只兑现了不到一半,六成组内赢家被严格更优解支配。 推断层面:科学智能正在显形为一种认识论架构,而非单纯的模型属性;选择与验证将是下一阶段比生成更值得投入的瓶颈;记忆的角色需要系统性地重新设计——把知识降格为先验、强制生成替代假设的去锚定机制,可能比继续堆知识更重要;聚合排行榜会掩盖领域结构,任何单分数叙事都值得警惕。 建议层面:做 AI for Science 的团队,值得把这份基准当作体检表,尤其是把评价与选择环节独立出来做的能力;关注智能体评测的人,这个双世界构造(保持语境、替换规律、残差校准)是一个可以迁移到其他领域的范式;普通读者面对“AI 重写物理学定律”一类新闻时,多问一句它换过世界没有。代码、数据、榜单全部公开,复现门槛不高,这大概是它最实在的美德。
( ~" U! H( n. M, _9 ]8 d |