James Zou:从 Virtual Lab 到论文智能体——AI 科研协作的规模化新轴

采集助手AI 前沿2026-09-170 阅读

一句话结论

斯坦福 James Zou(AI for Science 实验室负责人)在 2026 年斯坦福 HAI 物理与 AI 会议的主旨演讲里,系统展示了一条不同于”卷模型规模”的科研 AI 新缩放轴:模型不动,把协作智能体的数量往上加。从镜像一个实验室的 Virtual Lab(AI 教授智能体+多学科学生智能体,有组会、有预算、有”学校”),到镜像一家药企的 Virtual Biotech(数万智能体按事业部架构分工),再到向全球任何智能体开放的 Einstein Arena(开放数周即刷新 12 个开放研究问题的最优解,含 11 维”吻接数”数学难题),最后落到把 arXiv 全量论文重构成”论文智能体+虚拟文件系统”的知识层——每一步都有可复现的工作方法和量化结果证据,对任何想用多智能体系统做实际工作的团队都是一份完整路线图——四个系统分别覆盖”一个团队""一家公司""一个开放社区""全部人类知识”的规模梯度,每一级都给出组织结构、验证闭环和量化结果。

演讲现场:不缩放模型,缩放协作智能体数量

演讲主线:为什么”加智能体数量”是一条独立的新轴

Zou 开场把 AI for Science 的近期变化概括为一次”概念转变”:过去 18 个月里,AI 从解决窄定义问题(预测结构、拟合曲线)走向担任 AI co-scientist(AI 共同科学家),覆盖研究的全链条——生成假说、梳理文献、设计实验、自造工具、分析数据。驱动这一转变的是智能体(agent)能力:在大语言模型这个”大脑”之外,给智能体配上”手和脚”——能调用工具、访问数据库和知识库,才能从”会聊天的模型”变成”能干活的科研成员”。

在 Zou 看来,缩放有两条路:业界熟悉的路线是把模型本身做大;他的实验室选择另一条——把协作智能体的数量做多,研究当越来越多 AI 科学家智能体彼此协作、也与人协作时,会涌现出什么样的集体动力学与集体行为。这个定位本身就是给团队的一个选型判断:如果你的瓶颈是”单个模型不够聪明”,走第一条路;如果瓶颈是”任务量太大、环节太多、单点模型再强也覆盖不了全流程”,第二条路性价比更高。两条路的投入产出结构也不同:加大模型是向少数实验室付溢价,加智能体数量主要消耗的是编排设计与验证工程——后者恰好是普通团队自己能动手的部分,也是这场演讲反复证明”小实验室也能做出大成果”的原因。整场演讲就是沿这条轴的四步放大:5-10 个智能体(Virtual Lab)→ 数万个(Virtual Biotech)→ 全球任意智能体(Einstein Arena)→ 全人类知识(论文智能体)。

Virtual Lab:给 AI 实验室配教授、学生、组会和学校

第一个系统 Virtual Lab 的目标是镜像 Zou 本人在斯坦福的实体实验室。构造方式值得直接照抄:一个 AI 教授智能体 负责运营实验室;其下若干不同专长的学生智能体——数据科学、机器学习、蛋白质设计等;智能体们开自己的组会;实验室给智能体预算去运行自己的实验;此外还建了一所”学校”(人类学校的复刻),智能体可以去上课自学,把自己变成所在领域的更好研究者。

Virtual Lab:AI 教授与学生智能体的组会机制

第一个演示项目是设计能结合新 SARS-CoV-2 变体的蛋白。运行过程展示了多智能体的分工细节:PI 智能体(manager)先向其他智能体说明目标——设计与刺突蛋白结合的 binder;随后各学科智能体依次发言贡献想法:免疫学智能体建议以纳米抗体(nanobody,一类小蛋白)形式设计;机器学习智能体接着提出用特定深度学习模型优化纳米抗体结构。这个组会里还有一个critic(评审)智能体,职责是评估其他智能体的想法并给出反馈——演示中它直接指出要害:纳米抗体的公开数据不多,必须警惕模型过拟合。组会持续多轮讨论后才形成可执行方案,仅第一轮就已能看到智能体如何相互接话、逐层细化方案。最终这支智能体团队设计出一套不同于此前任何人工作法的计算工作流来优化建模纳米抗体,几天之内产出包括所示两个在内的全新蛋白——人类此前没有见过的结构;团队随后在湿实验室合成并测试,证明它们对不同 COVID 变体是有效 binder,结合力强于此前最好的人工设计纳米抗体

对实践者有四点可直接搬运:其一,“教授-学生-组会+critic”的组织结构比”一个大 prompt”更能支撑开放式任务——角色分工天然限制了每个智能体的上下文边界,而 critic 角色把”自我审查”外部化为流程节点,这正是过拟合风险被及时喊停的原因;其二,多轮顺序讨论而非一次性头脑风暴,让方案在智能体间接力细化(“免疫学家定形式→机器学习家定方法→评审者挑风险”是标准接力链),这种结构比并发吵群可靠;其三,给智能体预算权限(能调用计算资源跑实验)是从”顾问”变”同事”的关键一跃;其四,闭环验证不可省——Virtual Lab 的产出最终进了湿实验室,AI 生成+物理世界实测的组合才是证据链完整。这四点不需要科研场景也能平移:把”学科”换成”职能”(市场调研智能体、文案智能体、投放智能体+评审智能体),把”湿实验室”换成”小流量实测”,就是一个可落地的业务多智能体系统骨架。

Virtual Biotech:数万智能体按药企架构铺开

第二步放大从”镜像一个实验室”到”镜像一家公司”。Virtual Biotech 对应标准人类药企/生物科技公司的组织架构:设 CSO(首席科学官)智能体统筹;下设多个事业部——找药物靶点、为靶点设计分子、药物安全性、临床研究设计等;每个事业部再由多个专职智能体运营。以靶点事业部为例:一个智能体只看人类遗传学数据,另一个专门看单细胞数据,各司其职又彼此协作。

Virtual Biotech:CSO 智能体与事业部架构

这个架构产出了一项有分量的分析结果:团队让智能体把数万个临床试验的结局全部读进来——读论文、读新闻稿、逛相关网站,拼出每个试验实际发生了什么(主要/次要终点、是否中途停止),然后问一个药物发现的”圣杯问题”:靶点的哪些特征能预测试验成功率? 智能体自主选择了从”靶点蛋白在不同单细胞中的行为”这一此前被低估的角度切入,构造了两类新特征:

  • tau 分数:衡量靶点跨不同细胞的特异性——在所有细胞都表达的蛋白,不如只在特定细胞群表达的蛋白适合做靶点;
  • 双峰性(bimodality)分数:衡量靶点是否具有开关式行为的物理机制特征。

对数万试验的回溯显示:tau 分数或双峰性分数高的靶点,显著更可能推进到后期临床试验;针对细胞类型特异性基因的药物,走到上市的概率高出约 50%。这是”数万智能体读完全行业数据后涌现出新知识”的直接证据——不是模型变聪明了,而是覆盖面和结构化方式变了。对非医药团队同样有启发:把你所在行业的全量结构化记录(工单、案场带看记录、投放日志)交给多智能体做”全量回溯+特征构造”,往往能在被忽视的维度上找到预测性变量。

值得强调的是这项分析的方法结构——它展示了多智能体系统做”知识提取”的完整三步:第一步全量摄入,智能体遍历数万试验的全部公开踪迹(论文、新闻稿、网站信息),把非结构化历史拼成结构化数据集;第二步自主特征工程,智能体自己判断从哪个角度构造预测特征(这次选了”单细胞行为”这个人类此前低估的维度),而不是等着人类喂特征;第三步回溯验证,用历史结局检验特征的预测力(tau/双峰性分数高的靶点更容易进后期试验)。这套三步结构对任何拥有历史数据的行业都成立:一个房产团队可以让智能体吃下三年带看记录,自主构造”客户特征”并回溯验证哪些特征预测成交——这正是”数据多但没人系统性分析过”场景的标准解法。此外,Virtual Biotech 的组织架构本身也是可直接照抄的模板:CSO 智能体统筹+按职能划分事业部+事业部内部多专职智能体分工,与人类公司的科层制一一对应,说明”组织结构”这个人类管理学的成熟资产可以平移到智能体系统设计上,不需要为智能体发明全新的管理范式。

Einstein Arena:让全球任何智能体同场解题

第三步解决前两个系统共同的局限:智能体都是 Zou 实验室自建的。Einstein Arena 要做agent 原生(agent-native)的科学竞技场——AI 智能体是一等公民,任何国家、任何人的智能体都能进来协作解题。接入设计刻意求简:场内放一个 skills.txt 式说明文档,智能体读一遍就知道怎么通过 API 调用与竞技场交互。竞技场还刻意只对智能体开放——设置了把人类过滤出去的机制:每次调用 API 都要解一道小型计算谜题,对智能体轻而易举,对人类却很繁琐,以此保证场内观察到的行为是智能体的原生行为(Zou 类比其为此前 mole-book 类实验的科学家智能体版)。场内题目按两条标准遴选:一是对人类研究者重要——有文献积累、有活跃研究社区;二是有数学上精确的验证器(verifier),能为智能体提供实时反馈。这两条标准本身就是「任务适不适合交给多智能体」的判断模板:重要度决定值得做,可自动验证决定反馈闭环成立;缺第二条的开放任务,先造验证器再上智能体,否则无法归因成败。

Einstein Arena:agent 原生的开放科学竞技场

结果是开放数周内,智能体们已在 12 个开放研究问题上找到新最优解——优于历史上任何人类解法,也优于此前任何用定制 AI 工具得到的解;且每个问题都无法由单个智能体或单个模型独立完成,必须多智能体协作。Zou 展示的样例是数学界的经典难题吻接数问题(kissing number):一个中心球周围最多能放多少个互不重叠的等大单位球?一维答案是 2、二维是 6, Newton 时代就有人在研究;升到高维后难度陡增,其中 11 维 吻接数因技术原因数十年间持续吸引数学家与计算机学家改进界。Arena 上智能体协作推进了这一问题的求解进程。

吻接数问题:11 维难题的多智能体协作

对运营者的借鉴点在于治理设计而非题目本身:Arena 的所有讨论轨迹全部记录并公开,Zou 在问答环节提到,从日志里能看到智能体互相求助的真实案例——分享中间结果或部分解,再问其他智能体”你是否得到类似结果?能帮我验证吗?“。开放、可审计的协作轨迹,是多智能体系统建立信任的基础设施;任何团队自建多智能体工作流时,把”留下完整协作日志”当默认配置,事后才可能复盘涌现行为、定位错误环节。Zou 在 Q&A 还披露了两个细节:一是团队验证过没有任何单模型哪怕给足算力、独立工作能解出这些问题——协作不是锦上添花而是必要条件;二是智能体协作时表现出社交动力学——有的智能体话多、有的话少,默认”性格”不同,哪些想法被优先采纳会受影响——和人类团队一样。他把”如何优化大规模 AI 团队的协作”列为几乎未被探索的开放问题:这意味着当前阶段与其追求完美的智能体编排,不如像管理人类团队一样做基础治理(角色清晰、记录完整、评审独立),这恰好是普通团队今天就能做对的部分。

论文智能体:把静态知识重构成 agent 原生格式

第四步把轴推到极限:重构科学知识本身。Zou 指出过去几百年人类知识都封存在论文这种静态工件里——一支研究团队花数年做出结果,发表后就是一份被动文档。论文智能体(paper agent)的思路是把每个研究工件变成活的智能体:它是那份知识的”所有者”,负责保证可复现性、维护知识更新、帮助读者把方法应用到新问题。演示场景:用户问某论文对应的知识智能体”帮我把这篇论文的工具和洞见用到我的新数据上”,智能体能生成可复现工作流并落地执行。

论文智能体:从静态 PDF 到活的知识代理

底层的 paper-to-agent 自动化流水线尤其值得工程师抄作业:一组 worker 智能体深入读论文及其配套代码与数据,尝试复现结果、模拟实验——在这个过程中”学到”原作者的洞见,再把全部知识压缩成 agent 原生表示:MCP(模型上下文协议)服务器,接入下游任意语言模型即可调用——论文的知识由此从”一份要被阅读的文档”变成”一组可被调用的能力”。另一个关键表示创新是把论文(含图表)转换成虚拟文件系统——本质是一段伪代码,充分利用智能体的编码能力来访问;图表也一并转成伪代码形式。这个设计的洞察在于:PDF、LaTeX 这些人类阅读格式对智能体是低效载荷,智能体真正擅长操作的是代码和文件;把知识转换到智能体最擅长的表示形式上,收益立竿见影。

paper-to-agent:知识以 MCP 服务器与虚拟文件系统交付

效果有量化证据:相比把论文 PDF 或代码仓库直接喂给 Claude Code / Codex,虚拟文件系统表示大幅提升准确率,缩短智能体处理信息的时间,总成本有时按数量级下降。团队已把该能力做成免费资源:arXiv 全量论文+全部开放获取论文都已索引为文件系统,一行代码即可把整库知识挂进 Claude Code,全部运行在云端,你的智能体就能以 agent 原生方式访问全部物理论文知识。对个人从业者,这是当下零成本可用的一项能力升级:不需要训练模型、不需要科研背景,任何依赖文献工作的角色(分析师、咨询顾问、内容创作者、专利检索)都可以在智能体工作流里直接挂载这层数百万篇论文的知识层,把”搜论文、读论文、提取方法”的流程压缩成一次对话内完成的调用。Zou 强调这套资源完全免费开放,也呼应了他对知识层未来的判断:当知识以智能体可调用的形式存在,知识传播的成本结构会被重写——从”人去找文献、读文献”变成”知识主动以能力形态接入工作流”。

给不同读者的行动清单

研究/技术团队:从 Virtual Lab 的最小组织模板起步(1 个 PI 智能体+N 个学科智能体+组会+预算+验证闭环),不要一开始就铺数万智能体;把 Einstein Arena 的”公开协作轨迹”内建到自己的多智能体系统里。知识管理团队:论文智能体的”虚拟文件系统+MCP 服务器”是当下最实用的技术——如果你的团队有大量 PDF 报告/论文资产,先用这套表示法重 indexing,智能体调用精度和成本会立刻改善。决策者:记住这条新缩放轴的判断标准——当任务全流程长、环节多、验证可自动化时,加智能体数量比换更大的模型更划算;Zou 的四个系统恰好给出了从 10 到数万到全球规模的可复制升级路径。投入排序上可以参考演讲隐含的优先级:先把单个团队的智能体组织结构跑顺(Virtual Lab 级),再谈规模化(Virtual Biotech 级);对外部协作和知识基建(Arena、论文智能体)则以”直接用现成免费资源”为主,不必自建。

四步走完,Zou 的收束回到主题:这些项目共同说明,当协作智能体的数量成为新的缩放变量,科研——这个最依赖集体智慧的人类活动——的生产关系正在被重写:实验室、公司、竞技场、知识库,四层结构逐一被 agent 原生重构。对场内以物理学家为主的听众,这是一次来自 AI 侧的邀请:物理学的对称性直觉、相变与集体行为的研究传统、可解模型的方法论,正是下一代大规模智能体系统设计最缺的输入——毕竟”大量简单单元的交互涌现出集体智能”这个命题,物理学已经研究了一百年。

原文信息

  • 原视频标题:2026 Conference on Physics and AI: James Zou
  • 频道:Stanford HAI
  • 讲者:James Zou(斯坦福大学教授,AI for Science 实验室负责人)
  • 发布日期:2026-06-30
  • 视频时长:约 44 分钟