Cursor Composer 打造实录:RL 训练里跑十万个虚拟机、混合专家架构与「快到能纠错」的智能体设计

星海拾光AI 前沿📡 觉醒AI2026-09-21667 阅读💛 1 收藏

一句话结论

Cursor 研究负责人 Sasha Rush(前 Cornell 教授、transformers 库作者之一)在这场访谈里拆解了 Composer 智能体模型的构建逻辑:它不是又一个通用大模型,而是用强化学习专门训练出来的编码智能体;训练环境是把整个 Cursor 产品装进虚拟机、一次跑几十万个实例;基础设施五个环节用 Ray 串联;混合专家架构解决了「又快又聪明」的矛盾。对理解前沿 AI 编程工具内部如何运转,这是一手材料。

访谈开场:Composer 的定位

为什么做 Composer:把 Tab 补全的爽感带进智能体

Sasha 介绍了产品起点。Cursor 之前最受欢迎的功能是 Tab 补全模型——快、跟手、开发者能立刻判断建议好坏。团队想做智能体模型时,目标就是把这种体验带过来:足够聪明,可以放心把代码交给它写;同时足够快,答案立刻出来,你能持续迭代、随时给反馈。

这里有一个关键的产品判断:此前市面上出现过一些快模型,但编码质量没到「敢信任」的程度。Cursor 的取舍是两者都要——智能体时代的模型速度不只是生成 token 的速度,还有实际使用的墙钟时间,包括并行工具调用、合理利用上下文,这些行为都可以通过训练塑造。

主持人补充了自己试用 Cursor 2.0 的第一反应是「快得离谱」,Sasha 确认这是有意为之,而且内部试用时公司同事的偏好给了团队信心。

专攻一件事:强化学习如何造出编码专家

通用大模型追求什么都会:写文章、给建议、答问题。Composer 的路线相反——做一个只擅长「当编码智能体」的专用模型。实现手段就是强化学习:不必在全网数据上继续预训练,而是聚焦一个细分领域,用 RL 把这个任务做到极致。

Sasha 特别强调了智能体场景的工具调用强度:进入编码模型领域后他才意识到这些系统的能力有多夸张——模型会随手调用 150 个工具来回答一个问题。在大代码库里,它会连续调搜索工具、跑终端命令,做人会做腻但机器不会累的持久挖掘。他对智能体能力的定义就是「为找到答案而持续努力的持久性」。

智能体训练与工具调用

训练环境就是产品本身:几十万个虚拟机里跑 Cursor

这是访谈里技术含量最高的部分。Composer 的 RL 训练要求模型在真实产品环境里完成任务,所以 Cursor 把完整的 Cursor 应用封装进虚拟机,然后一次性启动几十万个这样的虚拟机做训练。

为什么要这么重?因为要模拟真实用户体验——模型在训练中看到的环境必须和用户实际用的一致,学到行为才能迁移。这套基础设施的工程挑战具体而真实:规模要能横向扩展、环境要有状态、跑起来要稳。Sasha 指出这是 RL 特有的难题,其他类型训练不会遇到。

Ray 的五个落点:从 RL 控制器到数据分析

主持人追问分布式层用了什么库。Sasha 的回答是「整个频谱都在用 Ray」,并明确列出五个环节,访谈中展开讲了两个核心。

第一个是 RL 控制器。强化学习的 rollout 管理是个典型的不等长任务问题:一次跑一百个 rollout,有的很快得到答案,有的执行一堆终端调用拖很久。Ray 天然适合这种时长参差的任务编排,控制整个 rollout 生命周期的代码就建立在 Ray 上。

第二个是 Ray Data 做训练数据分析。团队内部建了一套系统,用 Ray Data 批处理海量 rollout 结果:哪些赢了、哪些输了、哪些看起来好、哪些有问题,再调用 LLM 逐批评分,理解训练中什么有效什么无效。这种「训完回头看数据」的能力,直接决定了迭代速度。

分布式训练基础设施

配套的硬件规模也值得记录:整套系统动用数千 GPU,CPU 数量还要再高一个数量级。

混合专家通俗版:Transformer 时代少数真正变了的东西

主持人请 Sasha 用外行能懂的话解释混合专家(MoE)。作为教过多年 transformer 课程的教授,他先给了背景:transformer 统治 AI 已约八年,核心架构其实变化不大,混合专家是少数真正的架构级例外。

解释本身很干净:把某层里的单个标准神经网络,换成一组的分布式神经网络;每次前向传播不再动用全部参数,而是只选一个子集。收益有二:计算上不为全部专家付费;工程上可以把不同专家分片到不同 GPU,用到哪个调哪个。机器学习与系统的交叉在这里特别典型——架构设计与集群效率互相成就。

给开发者的用法建议:慢模型规划、快模型执行

对已经在用 Cursor 2.0 的开发者,Sasha 给出了社区验证过的组合拳:让一个较慢的模型在 plan 模式里起草大改动方案,长时间思考后产出策略级计划;再让 Composer 这样的快模型去执行计划。因为 Composer 快,你能在它跑偏时即时纠正,甚至直接插手改。多智能体并行试用同一个问题、云端智能体离线跑长任务,都是新版本提供的实验空间——他自己也强调「最终形态还没定型」。

模型使用策略与展望

对想自研模型的团队:开源 RL 门槛在快速下降

访谈最后谈建议。Sasha 认为最值得关注的是专用模型的多点开花:Thinking Machines 发布了好用的 RL API;开源 RL 框架(如 SkyRL)也在快速发展。做自己的专用智能体模型的门槛在降低,他会预期看到更多类似 Composer 的专用模型出现。开源库对这一切至关重要——PyTorch、vLLM 这些项目是 Cursor 这类产品能快速迭代的地基。

对普通开发者的启示落在使用层:理解「快模型+慢模型」分工、敢于让智能体长时间并行试错、把工具调用持久性当作选型指标,这些来自一线构建者的经验比参数表更有参考价值。

产品与研究的日常咬合:构建者视角的组织细节

访谈里反复出现一个值得注意的组织观察:Cursor 是「新一代 AI 原生产品」的样本——构建系统的人、日常使用系统的人、做机器学习的人几乎是一群人,彼此之间是日常的、高频的对话。Sasha 举的例子:模型行为的很多决策本质是产品决策——多快算够快、上下文怎么用、什么时候并行调工具,这些判断来自「我们自己就是最重度用户」的直觉,再由研究侧落地成训练目标。

这种咬合解释了 Composer 为何把「速度」当成第一性设计目标。Sasha 对此的展开是:速度改变的是使用行为——模型慢的时候你只能等,模型快的时候你会自然而然地边跑边看、随手纠偏、并行开几个试验。这与访谈开头「Tab 模型的爽感」首尾呼应:Cursor 想把交互式补全的使用习惯,原样搬运到智能体时代。

这场访谈适合谁看、怎么看

三个群体的观看建议。正在选 AI 编程工具的开发者:重点看「用法建议」一节的分工策略,慢模型规划加快模型执行,是被社区验证过的组合,也直接适用于其他工具的组合使用。做 AI 产品的团队:重点看训练环境与基础设施部分——把完整产品装进虚拟机做 RL 训练,是「智能体训练要贴近真实使用环境」这个理念的极端落地,对产品行为如何反哺模型能力有直接参考。关注开源生态的人:Sasha 对开源 RL 框架(SkyRL 等)门槛下降的判断,预示专用智能体模型会在更多垂直场景批量出现,这是接下来一到两年的确定性趋势。

一点观看提示:这场对话信息密度高但语速快,自动字幕在专业术语上有少量转写失真(如 Ray Data 被转成 array data、MoE 相关表述),本文已按上下文校正;访谈中提到的 Cursor 2.0 功能(plan 模式、多智能体并行、云端智能体)在产品里都可以直接试用,边看边动手对照效果最好。

原文信息

  • 原视频标题:Sasha Rush on Building Cursor Composer and the Future of Agentic Coding
  • 频道:Anyscale
  • 讲者:Sasha Rush(Cursor 研究负责人,前 Cornell 大学教授)
  • 发布日期:2026-01-12
  • 视频时长:约 12 分钟

文章评论(0

暂无评论,快来抢沙发~