MadEvolve:用大模型进化宇宙学算法,每代不到 0.3 美元,但人类起点仍然重要
一句话结论
这场 28 分钟的 spotlight 报告证明了一件事:大语言模型可以当「不知疲倦的博士生」用,以每代不到 0.3 美元的成本进化宇宙学算法,且产出的算法完全可解释、便于控制系统误差;但同样的实验也给出反直觉的另一半结论——进化起点用更好的人类算法,几千代之后的最终成绩更好,所以人类专家不是被替代,而是变成了进化的初始值和启发式来源。这套框架已经开源,并且同一批人已经把它拿去找量化交易系统了。

宇宙学为什么是大模型进化算法的好场景
讲者 Shihui Zhang 来自名古屋大学。她先铺了一个背景:宇宙学数据处理管线的典型形态。望远镜(卫星或地面)采集的原始光谱数据以 TB 计,映射到笛卡尔或球面坐标后降到 GB 级——笔记本都装得下;下一步是从这些场数据里提取统计量,最终目标是推断几个宇宙学参数。这个流程里每一环都是成熟的数值计算代码,版本控制、单元测试、评估函数一应俱全,天然适合「代码即基因」的进化范式——这是宇宙学区别于很多行业场景的先天优势。
这个「从海量观测场推断少量物理参数」的过程,对准确度(避免系统误差)和精度(尽量榨取数据信息量)双重要求,而它高度依赖管线中算法的质量。传统做法是「让博士生和博士后去调」,但巡天项目产出的数据越来越大、小尺度结构来自非线性动力学、管线越来越复杂,而研究生「要休息、要睡觉、有时状态不好不想干活」——效率有上限。她的幽默说法是:AI 智能体不知疲倦,一天能工作 25 小时。
那为什么不用神经网络端到端解决?她给出了两条理由:神经网络缺乏可解释性;系统误差难以控制。而进化搜索产出的仍是人类可读的算法代码,每一步改动都看得见,这正是物理数据分析最看重的性质。
方法:进化循环 + 一个关键创新(参数预调优)
此前已有两条相关工作:FunSearch(DeepMind)用 LLM 当变异算子搜索更好的函数,AlphaEvolve(Google)把搜索空间从函数扩展到代码库。两者在数学问题上都很成功。MadEvolve 的基本循环沿用这一范式,她用一个信号去噪的例子讲透了流程:
第一步从数据库选一个父代程序(首次就是初始算法,比如高斯滤波);第二步构造 prompt 问大模型「这是现有算法和代码,目标是最小化估计信号与真值的差异,请给出更好的」——模型可能推荐维纳滤波并写好代码;第三步评估新算法(关键:算法可能更好、更差、甚至根本跑不通);第四步连同得分写回数据库,循环重启。

MadEvolve 的独有创新在第三步之前插入了一道「参数优化」工序。动机:物理算法普遍带可调参数(比如高斯滤波的平滑尺度 R)——同一个好算法,参数调好是蓝色曲线,调差就是远离真值的绿色曲线。如果直接拿「参数没调好的好算法」去评分,它可能被进化过程错杀。
解法:要求所有输入算法用 JAX 编写,这样就能对损失函数关于自由参数求梯度,用 Adam 优化器把参数调到最优(实测约 10 到 50 轮迭代就收敛),保证每个候选算法都以自己的最佳状态接受评估。这一步让评分对所有算法公平,好算法不会因为「没调好」而被漏掉。
三个任务全部提升,成本几十到几百美元
框架应用在三个物理过程迥异的宇宙学任务上:重子声学振荡(BAO)重建——早期宇宙的「声学尺度环」经非线性引力演化变形,环的大小和形状与宇宙膨胀史的关键参数直接挂钩,目标是估算引力作用后反推重建初始场,这对当前大规模结构巡天至关重要;21 厘米前景重建——强度测绘的关键环节,要从混入强前景污染的观测信号里还原宇宙再电离时期的微弱信号;重子场建模——用便宜的方式做模拟,省去动辄昂贵的高分辨率流体模拟。BAO 那个「环」可以这么理解:早期宇宙等离子体里的声波在宇宙冷却瞬间冻结成一个标准尺度的统计花纹,几十亿年的引力演化把它拉变形了,重建算法就是做「引力反向运算」,把变形的花纹还原回初始模样——还原得越准,这把「标准尺」就能量得越准。
三个任务物理不同,但结构同构:都是从观测场推断底层场。结果是在数百到一千代的进化后全部取得显著提升。BAO 重建用了两个起点:业界最常用的标准算法,和一个更好但没被广泛采用的迭代算法。两条进化线都显著提升,且都超越了各自的人类起点。JAX 的约束在这里还带来一个隐性收益:所有进化产物天然可微,后续想把发现的算法再嵌进端到端训练管线,不需要重写。

成本核算是全场最有传播力的部分:以前这套活是研究生干的,一名研究生一年约 4 万美元助学金加 2 万美元学费;现在单个任务几十到几百美元就能跑完,每代进化不到 30 美分。她的原话自嘲:「坏消息是我们可能要失业了,既然这么便宜的 LLM 智能体存在,为什么还要雇研究生。」
但紧接着的数据推翻了这个玩笑:标准起点进化一千代达到约 0.924 的分数,仍不及「迭代算法起点」的进化成绩——给进化喂更好的人类算法,最终结果更好。结论:人类算法仍然重要,它提供初始状态和启发式方向。「所以我们还有用,至少现在还不会失业。」
边界、下一步与可迁移性
她明确划了边界:目前所有任务都在模拟数据上完成;真实观测数据有不规则边界、更复杂的观测效应,模拟的周期边界和简化物理覆盖不了,下一步正在把 BAO 重建进化应用到真实巡天数据(进行中)。这条边界对借鉴者同样重要:如果你的业务场景分布和训练评估用的历史分布有系统性偏移(比如新增渠道、改版后的页面),进化出的算法在新分布上未必保持优势,上线前要拿新分布数据重新验证一轮,否则「模拟最优」会变成「线上翻车」。进化管线本身不限于宇宙学——研究组已经用同一框架搜索更好的量化交易系统,另有一篇论文,欢迎关注。

问答环节补了两个细节:BAO 重建上模型实际学到的是对高阶位移项和非线性场的建模方式(细节在官网任务报告里);被问到「设计智能体时什么最重要」时,她强调了任务定义与评估指标设计(物理上合理的评分函数)是一切的前提——评分函数设计不当,进化就会朝着错误方向狂奔,这一点对所有自动化优化系统同样成立。
对非科研读者的启示
这个案例对所有「有评估指标、有既有代码、想持续改进」的场景都成立:把大模型当变异算子、把你的业务指标当适应度函数、把参数调优和评分分开(先调参再评分,避免错杀好算法)、用更好的初始代码启动进化。营销素材生成、数据清洗管线、风控规则优化,都是同构问题。预算参考:每代不到三毛钱美元,一个完整任务的搜索成本大约等于一名应届生一个月工资的几分之一。
设想一个具体的落地例子:一家电商公司想优化商品标题生成规则。现有规则是运营手写的十条模板,效果停滞已久。套用 MadEvolve 的思路:把「点击率预估」当适应度函数,把现有十条模板当初始种群,让大模型每轮提出模板变体,离线评估前先用历史数据把每个变体的参数(关键词权重、长度阈值)调到最优,再统一评分入库。跑几百代后得到的模板集,成本可能不到一顿团队聚餐的钱,而每条规则都是人类可读的文案结构,运营能看懂、能干预、能回滚——这是黑盒神经网络给不了的性质。
还有一条容易忽略的工程细节:MadEvolve 把「代码改写」和「参数调优」分成两层——大模型只负责改代码结构,梯度下降负责调参数。这个分工对任何想落地进化搜索的团队都是现成架构:不要让大模型猜参数值(它不擅长),让可微编程框架算出来;大模型做它最擅长的(提出新的代码思路),数值优化做它最擅长的(把参数顶到最优)。两层各司其职,进化搜索才不会因为参数错杀好想法。同理,「评估前先归一化每个候选的参数状态」这个习惯,放到对比测试里就是「先把两个方案都调到各自最优再比效果」,能避免大量伪结论。
最后是人才层面的判断:起点算法的质量决定进化上限,意味着「有存量专业经验的人」在 AI 时代的角色从「写代码的人」变成「提供高质量初始值和启发式的人」。你的经验不再被直接消耗在逐行写代码上,而是被封装成进化的起点——这既是研究生的好消息(不会失业),也是对所有经验型岗位的重新定价。
原文信息
- 原视频标题:2026 Conference on Physics and AI: MadEvolve, Evolutionary Optimization of Cosmological Algorithms with Large Language Models
- 频道:Stanford HAI
- 讲者:Shihui Zhang(名古屋大学)
- 发布日期:2026-06-30
- 视频时长:28.4 分钟
思路清晰,干货满满。
有没有更详细的教程,期待后续。
点赞,必须点赞