物理思维链基准:800 题、5 步依赖链与反馈循环,新一代推理模型提升 60%
一句话结论
这场 23 分钟的报告给出了一个对选型最有用的结论:在物理领域的多步推理任务上,GPT-5.4 与 Claude Opus 4 相对上一代(GPT-4 与 Claude Sonnet 4)的分数提升约 60%,而上一代相对更早一代只有约 5%——推理模型的代际跃迁真实存在;但反馈循环的证据同时显示,模型在收到纠错提示后仍常常不改进,说明「会表述推理」不等于「理解推理」。对要在专业领域部署推理模型的人来说,这个基准的方法论(链式拆题 + 路径校验 + 反馈循环)比分数本身更值得抄。

为什么物理研究需要自己的推理基准
讲者是密歇根大学计算物理硕士生 Filomela Geru,这项工作是她过去一年在阿贡国家实验室(Argonne National Lab)与 Nesar Ramachandra、Aston Wells 合作完成的。她的出发点很实际:科研人员现在不只拿大模型做重复劳动,还用它做研究选题、问题求解、甚至论文撰写——研究者要保住自己的学术信誉,就必须依赖可信的工具,也就必须理解模型如何得出它的输出。
现有的主流基准几乎都是选择题(MCQ)格式,原因是可扩展、易生成、每题独立可判分。但她指出两个关键缺陷:第一,选择题不反映真实的研究工作流——真实科研是与导师、合作者来回讨论、不断收到反馈修正的过程,不是一次性作答;第二,评测方式只有人工(可靠但无法规模化)和 LLM 评阅(可规模化但牺牲可靠性)两条路,领域覆盖都受限。更专业的基准(如博士级资格考试题库)深度够,但题量小、扩展难,因为只能靠领域专家出题。
于是核心问题变成:人类如何定义「一道自己也不知道标准答案的新研究题」的正确解法?她的答案是看过程——把问题拆成复杂度递增的多步,逐步检查是否一致地应用了正确的物理定律和数学方法。把这个过程内置到基准里,才能建立「模型走了一条物理上可靠的解题路径」的信心,而不是只看最终答案碰对了没有。

设计一:链式问题,5 步依赖强制暴露推理过程
基准的核心单元不是独立的选择题,而是「链问题」(chain problem):每条链拆成 5 个子问题,必须先答对 1.1 才能进入 1.2——因为如果不知道怎么解第一步,就不可能知道怎么解第二步。这与传统基准「答完第一题无论对错都进第二题、最后按答对百分比打分」形成鲜明对比。
每一步同时校验两样东西:字母选项(最终答案)和 rationale(解题路径的表述)。两者都对才能前进;任何一项错了,就进入反馈循环。这个设计直接改变了随机猜测的底线:传统四选一瞎蒙有 25% 的得分率,而链式结构下要连续蒙对 5 个子问题、还要靠 rationale 质量得分或扣分,底线被压到 4%。
题目素材覆盖宇宙学、统计力学、凝聚态理论等领域。讲者展示的例子是量子场论中费曼图与圈计算题:每个选项旁都附有标准 rationale,选 B 会被自动提示「你用错了质量量纲」——这就是反馈循环的第一层提示,模型需要据此重新表述解题路径。同时系统会检查模型是否至少识别出了正确的整体概念(这是量子场论题、用了费曼图方法、数学方法正确),即使表述不完全一致也能得到部分识别分。
跨领域的表现相当均匀:不同模型在宇宙学、统计力学、凝聚态上的推理分数差异只有约 5%,天体物理略好、量子力学略弱。这说明链式结构测出的是通用推理能力,而不是领域知识背诵。
设计二:反馈循环模拟导师,LLM 陪审团补盲区
反馈循环是第二大贡献,模拟的是学生与导师的互动:模型答错后收到提示,重新表述,再评估。评测分两层:先做规则比对(硬编码地比对答案与 rationale 的关键要素),再做逐案的 rationale 评分——按一系列质量因素给分或扣分。
规则层之外,还部署了 LLM 陪审团(jury),专门处理地面真值里没有的方法:如果测试模型用了一条出题人没预想到、但独立求解后确认正确的解题路径,陪审团可以识别并给分。陪审团的评分细则包括:全程连贯且切题、不重复、技术表述精确、思路有复杂度、具体不空泛、引用正确的物理来源、有对自身过程的反思;反面——过度泛化、光抄方程不解释、不反思过程——则扣分。
效率维度也被跟踪:回答延迟(含内部计算时间)、token 数(按 rationale 长度折算,不信任各家 API 自报的 token 计数口径)、重试次数,以及每步 rationale 的相关性、是否回溯、是否吸收了提示并取得进展。每道题对每个模型独立跑 15 次取误差棒。

结果:代际跃迁真实,但深挖后发现三类缺陷
整体规模:8 个模型、800 道选择题(对应 160 条链问题)、总计消耗 20 亿 token。四个评分轴是推理质量(单看 rationale 本身)、答案正确性、元指标(延迟、token、重试)与三者聚合的总分。
最重要的趋势:表现最好的 GPT-5.4 与 Claude Opus 4 相对上一代的 GPT-4 与 Claude Sonnet 4 提升约 60%,而上一代相对更早一代只提升约 5%。但讲者特别指出一个细节:答案正确率的提升幅度跟不上推理表述质量的提升——新模型更会「表述」推理,但不一定更会「应用」推理。token 花费在各代模型间相当一致,说明提升来自模型本身而非砸更多输出。
翻 rationale 跟踪日志后,团队总结出三类深层缺陷:
第一,缺乏深度理解。证据是「非渐进式错误推理」:提示明确指出该往哪个方向改进 rationale,模型却不照做——说明它没理解提示,也没真正理解题目。
第二,代数缺陷。会出现方法学完全正确、数值输出却错误的情况——推理框架对,计算执行错。
第三,内部计算与输出表述不一致。反过来也会出现最终答案对、数学推理表述却错的情况——答案可能不是从那条展示的推理路径算出来的。
这三条对任何用 AI 做专业计算的人都是直接警示:最终答案对不能作为过程可信的证据,必须核验中间步骤。
局限与下一步
讲者坦承两个局限:为了覆盖广必须用 LLM 陪审团,牺牲了一部分可靠性;题目最终仍是选择题格式(虽然是增强版)。关于第一点值得展开:陪审团面对的是「地面真值里没有的解法」这一开放集合,评委模型自身的物理水平就成了评分上限——这就是为什么团队坚持双轨制,规则层处理一切可硬编码的比对,陪审团只兜底未知方法,把不可靠的暴露面压到最小。这给企业内部做 AI 质检的人一个直接模板:能写成规则的绝不用 LLM 判,LLM 只判规则写不出来的那部分。
后续方向有两个:把基准用于物理场景下的智能体(agent)性能评测;把反馈循环结构改造成强化学习平台,用于训练领域个性化模型,减少对商业工具的依赖。第二个方向的实际意义是:反馈循环天然产生「提示—响应—改进与否」的轨迹数据,这正是训练领域模型需要的监督信号,基准用着用着就把训练数据攒出来了。
问答环节补充了实现细节:延迟按提问到返回的全时长计算(包含模型内部计算时间);token 简洁性只针对实际输出的 rationale——公司不公开的内部思考步骤无法计费也无法评测,所以要求输出尽可能精炼完整。提示的第一层来自题目自带的标准提示(如「质量量纲用错」),第二层才由 LLM 评委以导师口吻给出方向性建议。

对普通使用者的启示
即使不做物理研究,这套方法论也能直接迁移:评估任何 AI 工具在专业任务上的表现时,把大任务拆成依赖链条、每步同时看结论和依据、答错后给出定向提示再看是否改进——「提示后不改进」是最便宜也最有效的能力试金石。反过来,选模型时不要只看单项分数榜,多步依赖加反馈吸收的复合测试才能区分「会表述」和「会推理」。
具体可以落成一个五步操作清单。第一步,从你的真实业务里挑一个需要多步推理的任务,把它拆成五个前后依赖的子问题,后一步必须用到前一步的结论。第二步,让待评估的模型依次作答,每步都要求它先写解题依据、再给最终结论,两样分开记录。第三步,人为核对每一步的依据是否引用了正确的业务规则或数据字段,而不只看结论对错。第四步,对答错的步骤给一条定向提示(例如「你用错了统计口径」),观察模型重新作答时是否吸收了提示。第五步,统计「提示吸收率」——收到提示后真正改进的比例,这个指标比任何跑分都更能预测模型在你业务里的真实可用性。
这套流程的成本极低:一次完整评估通常只需要十几个业务问题、一个下午的人工核对。但它能暴露出跑分榜完全看不见的问题——比如模型结论经常对但依据是编的(内部计算与输出表述不一致)、比如提示说到脸上仍然重复原错(缺乏深度理解)。团队采购推理模型、或者决定「这个岗位能不能用 AI 兜底」之前,先跑一遍这个迷你基准,能省下大量试错成本。
还有一个给内容创作者的间接启示:这套基准的评分细则(连贯、切题、不重复、精确、具体、有反思)本身就是高质量技术写作的检查表。用这六条标准审自己的稿件,比凭感觉改稿有效得多。
原文信息
- 原视频标题:2026 Conference on Physics and AI: Chain of Thought Physics Benchmark for Reasoning Models
- 频道:Stanford HAI
- 讲者:Filomela Geru(密歇根大学计算物理硕士生,阿贡国家实验室)
- 发布日期:2026-06-30
- 视频时长:22.8 分钟
讲解得很细致,新手也能看懂。
有没有更详细的教程,期待后续。