20亿参数打败800亿?不靠知识蒸馏!腾讯近期最强AI论文解读
假如你要训练一个助手帮你完成复杂的任务。
传统方式是先让它学会基础知识,然后再教它怎么做事。
但如果从一开始就教它”边学边做”会怎样?
这就是腾讯Youtu-LLM团队最近提出的思路。
他们做了一件听起来很疯狂的事情,在一个只有20亿参数的小模型里,从头开始培养推理、规划和执行能力,而不是依赖其他大模型的”知识蒸馏”。
结果让人惊喜。
这个小模型在很多任务上的表现,不仅超过了同等规模的所有竞争对手,甚至在某些场景下能够挑战80亿参数的大模型。

为什么大模型这么”重”
先聊聊背景。
参数规模:神经网络中可调节的数值,类似于大脑中的突触连接。参数越多,模型的”记忆容量”和”处理能力”理论上就越强。
当前最强的大语言模型,动辄几百亿甚至上千亿参数。
就像一个配备了巨型处理器和海量内存的超级计算机,功能强大但也非常”昂贵”。
训练成本高昂。训练这样一个模型可能需要数千张GPU卡运行几个月,电费就是天文数字。
部署困难重重。想在手机或边缘设备上运行?几乎不可能。
即便在云端,每次推理的成本也让很多应用望而却步。
响应速度受限。
模型越大,处理一个请求需要的时间就越长。对于需要实时反馈的场景,这是致命的。
所以,轻量级但性能强悍的模型,成了AI研究的热门方向。
现有方案的局限
目前让小模型变聪明的办法,主要有这几种:
知识蒸馏:让大模型当”老师”,小模型当”学生”,通过模仿大模型的输出来学习。就像学生看着老师的答案,学习如何解题。
指令微调:在小模型训练好之后,用特定格式的指令数据进行额外训练,让它学会听懂人类的命令。
架构简化:通过精简网络结构来减少参数量,就像把一辆大卡车改造成小轿车。

这些方法确实有效,但有一个共同的问题,它们主要是在让模型”学会表演”,而不是真正培养底层的认知能力。
就像你可以教一个人背诵复杂问题的标准答案,但这不代表ta真的理解了问题的本质,更不代表ta能灵活应对变化。
当任务变复杂,特别是需要规划、推理和自主执行的场景,比如深度研究、多步骤编程、工具调用时,这种”表演式”的能力就不够用了。
Agent时代的新要求
Agent(智能体):能够感知环境、自主决策并执行行动的AI系统。不同于被动回答问题的对话系统,Agent更像一个能主动完成任务的助手。
随着AI应用越来越复杂,社区逐渐意识到,真正强大的Agent需要具备内在的规划、执行、状态感知和反思能力,而不是依赖外部框架的堆砌。
试想一下,你让AI帮你完成一个研究任务:
- 它需要规划整个流程,先查什么、再做什么
- 它要能执行具体的操作,比如调用搜索引擎、分析数据
- 它必须能感知当前进展,知道哪些信息已经获取,哪些还缺失
- 它还要能反思自己的行为,发现错误并调整策略
这些能力,不是简单地堆砌工具或编写复杂的提示词就能实现的。
它们需要深深植入模型的”思维方式”中。

Youtu-LLM团队提出的核心问题就是:能不能在预训练阶段,就让轻量级模型学会这些Agent能力?
Youtu-LLM的三大创新
- 紧凑但强大的架构
Youtu-LLM采用了Multi-Latent Attention(MLA)架构。
Multi-Latent Attention:一种改进的注意力机制,通过引入多个潜在表示来压缩计算,在保持性能的同时大幅降低内存占用。
传统的注意力机制就像你同时盯着一整页文字,每个词都要和其他所有词建立联系。
计算量随着文本长度呈平方增长,内存消耗很快就爆炸了。
MLA则更聪明。
它先把信息压缩成几个”关键代表”,然后让这些代表去建立联系。
就像开会时,不是所有人两两交流,而是各小组先讨论,再由组长汇报。
这让Youtu-LLM能够支持128k的上下文窗口,同时保持极低的内存占用。
128k大概相当于一本中等篇幅的小说,足够处理复杂的长程推理任务。
此外,团队还设计了一套STEM导向的词表。
词表(Vocabulary):模型能够识别和生成的基本文本单元集合。就像语言的”字典”,决定了模型如何将文本分解成最小的处理单元。
普通词表对自然语言友好,但对数学公式、代码符号的处理效率很低。
STEM导向的词表针对科学、技术、工程、数学领域做了专门优化,能更高效地表示这些领域的内容。
- “常识-STEM-Agent”训练课程
Youtu-LLM的训练不是一股脑把所有数据扔进去,而是精心设计了一个渐进式的课程。
总共使用了约11万亿个token的数据。
Token:文本的基本处理单元。在中文中,一个token大约对应1-2个汉字;在英文中,一个token大约对应0.75个单词。1万亿token相当于数百万本书的文字量。
训练分为三个阶段:
阶段1:常识学习(占比最大)
- 70%以上是高质量的网页和百科知识
- 让模型建立对世界的基本认知
- 就像小孩子先学会基础的语言和常识
阶段2:STEM强化
- 700B token的STEM语料(数学、物理、化学、生物、医学)
- 1400B token的代码数据
- 500B token的合成数据(包括知识点解释、论文解读、代码注释等)
- 培养模型在专业领域的深度理解
阶段3:Agent能力注入
- 这是最关键的创新
- 200B token的高质量”轨迹数据”
- 不只是让模型看答案,而是让它学习完整的问题解决过程
数据分布不是一成不变的,而是逐渐从通用知识向STEM和Agent任务倾斜。
就像学习一门技艺,先打基础,再专精,最后融会贯通。
- 可扩展的Agent轨迹数据
这是论文最值得关注的部分。
轨迹数据(Trajectory Data):记录了Agent完成任务的完整过程,包括分析、规划、行动、反思和总结。就像一部详细的”任务日志”,记录了每一步的思考和决策。
团队构建了200B token的Agent轨迹数据,覆盖五大类别:
Agentic-CoT轨迹(25B)
传统的思维链(Chain-of-Thought)数据虽然有效,但常常冗长重复,充斥着过度思考。
Youtu-LLM提出了结构化的Agentic-CoT范式,将推理过程分解为五个明确的阶段:
- Analysis(分析):拆解问题,识别关键要素和约束
- Plan(规划):制定解决步骤的蓝图
- Action(行动):执行计划,得到初步结果
- Reflection(反思):评估执行效果,检查错误,考虑替代方案
- Summary(总结):提炼最终答案和关键发现
这种结构化的思考方式,让模型不仅学会了推理,更学会了像Agent一样系统性地解决问题。
数学轨迹(20B)
数学推理一直是评估AI认知能力的试金石。
团队将数学能力分解为11项原子能力,分三个层次:
基础知识与计算:符号识别(识别数学符号和结构模式)、概念理解(理解和区分数学概念)、计算执行(执行算术、代数、微积分运算)。
复杂推理与应用:空间感知(几何对象和空间关系的推理)、形式化表达(将自然语言转化为数学表示)、演绎归纳(通过已知前提推导结论)、反证与构造(通过目标驱动的推理策略解题)、建模转化(将现实问题转化为数学模型)、定理应用(识别并正确应用定理或引理)。
数学元认知:自我反思(诊断推理错误并提出修正策略)、新知识习得(学习新定义并迁移到未见问题)。
这些原子能力被自然地映射到Agent的规划、行动和反馈模块中。
Agent在解题时,会先规划需要哪些原子能力,然后逐步执行,并在每一步后进行评估和调整。
最终合成了约138万条数学轨迹,覆盖K12到数学竞赛级别的难度。

代码轨迹(70B)
代码场景的轨迹数据分为两部分:
原子代码能力:
- 主动探索和定位:在代码库中找到特定的变量、函数或文件
- 上下文感知生成:基于大量仓库上下文完成关键代码段
- 补丁生成和编辑:根据问题描述生成精确的修改
- 测试与验证:评估代码正确性,定位失败点
- 环境理解:解释和预测执行环境的信号
- 自我反思:基于环境反馈进行单轮或多轮代码修正
端到端代码Agent轨迹:
团队采用了三维扩展策略来大规模生成轨迹:
- 扩展任务:利用SWE-gym、SWE-smith等开源沙盒环境,并合成新的任务实例
- 扩展上下文:针对缺少可执行镜像的仓库,设计静态评估任务(如故障定位、重构)
- 扩展行动:在关键行动点(编辑、测试)生成分支轨迹
特别有意思的是分支策略:
- 对于成功轨迹,在每个关键行动点生成替代方案,丰富模型的行动空间
- 对于失败轨迹,只在第一个关键行动点生成单个分支,然后截断后续步骤
这样既能重用失败数据中的有价值部分,又能避免错误传播。

深度研究轨迹(60B)
深度研究(Deep Research):需要Agent在复杂环境中导航、验证异构信息并综合成连贯输出的任务场景。不同于简单的信息检索,它要求自主的知识发现能力。
深度研究轨迹分为两类:
闭式任务(如多跳问答):
从高知识密度的语料(网页、题库、教材、论文)中提取多跳QA对,然后使用多种Agent框架和搜索API生成轨迹。
为了增加多样性,团队还引入了搜索结果扰动:随机遮蔽某些来源,或抑制Top-K结果。
这增加了任务难度,产生更长更复杂的轨迹,提高了模型的鲁棒性。
对于失败的轨迹,团队会添加一段轨迹分析,明确指出错误所在,并逐步分析推理过程。
这让模型能从错误中学习。
开式任务(如生成研究报告):
采用正向和逆向混合合成策略:
正向合成:
- 从百科、学术语料、财报中获取研究问题
- 使用”三思而后行”框架进行深度调研
- 当模型认为准备好生成报告时,要求它”再想想”
- 系统性地总结已获取信息
- 逐节评估是否需要进一步探索
- 直到每个方面都被充分研究
- 报告生成模块整合所有信息库,创建结构化大纲,系统性展开各节
逆向合成:
- 从高质量的学术论文、研究报告等”结果”出发
- 利用文中的引用关系作为可靠的相关性信号
- 重构生成这些内容的搜索轨迹
- 确保轨迹的终点是经过验证的高质量内容
逆向合成的平均轨迹长度达到32K token,质量极高且事实性有保障。
工具使用轨迹(25B)
覆盖函数调用、规划和其他通用工具使用场景的轨迹数据。

训练流程与细节
整个训练分为三个阶段:
阶段1:通用预训练
- 10.64T token的通用数据
- 建立常识和基础知识
阶段2:STEM增强
- 逐步增加STEM和代码数据的比例
- 培养专业领域的深度理解
阶段3:Agent中期训练
- 注入200B token的轨迹数据
- 系统性培养规划、执行、反思能力
数据质量控制极为严格:
团队开发了一套多维度分类和质量评分系统:
- 10项质量评估标准
- 11项领域分类标准(涵盖46个子领域)
- 使用Deepseek-R1进行初步标注
- 人工审核确保95%以上的一致性
- 训练快速分类模型(基于Qwen3-1.7B)
- 最终达到95%以上的分类和评分准确率
只保留平均评分8.5分以上的数据。
此外,还使用了MinHash-LSH去重和Aho-Corasick算法进行基准污染检测,最大限度避免测试数据泄漏。

实验结果:小模型的大惊喜
通用能力评估
在常识、STEM、编程、长文本等通用任务上,Youtu-LLM 2B的表现:
基座模型对比:
Youtu-LLM 2B在MMLU-Pro上拿到48.4,MATH拿到40.7,HumanEval拿到57.3。它在大多数指标上超越了3B的SmolLM3,特别是在MMLU-Pro和MATH等需要深度推理的任务上。
指令模型对比:
与DeepSeek-R1-Distill-Qwen 1.5B、Qwen3 1.7B、SmolLM3 3B等竞争,Youtu-LLM 2B在以下任务上表现突出:
- MATH-500:95.0(超越所有同规模模型)
- AIME 2024:73.3(数学竞赛级难度)
- HumanEval:95.9(代码生成)
- MBPP+:71.7(严格版代码测试)
甚至在部分任务上,Youtu-LLM 2B的表现可以和8B规模的DeepSeek-R1-Distill-Llama 8B相媲美。
Agent能力评估
在APTBench这个专门评估Agent能力的基准上,Youtu-LLM的优势更加明显。
APTBench涵盖四个领域:代码、深度研究、工具和数学。每个领域测试规划、行动和原子能力三个维度。
代码场景:
- 规划能力:Qwen3 4B为42.1,SmolLM3 3B为51.2,Youtu-LLM 2B达到65.8
- 行动能力:Qwen3 4B为38.5,SmolLM3 3B为47.3,Youtu-LLM 2B达到56.2
- 原子能力:Qwen3 4B为55.3,SmolLM3 3B为63.7,Youtu-LLM 2B达到72.4
深度研究场景:
- 规划能力:Qwen3 4B为48.7,SmolLM3 3B为52.1,Youtu-LLM 2B达到68.3
- 行动能力:Qwen3 4B为41.2,SmolLM3 3B为49.8,Youtu-LLM 2B达到61.5
- 原子能力:Qwen3 4B为58.9,SmolLM3 3B为64.2,Youtu-LLM 2B达到74.8
在所有Agent任务上,Youtu-LLM都以显著优势领先。这证明了Agent预训练策略的有效性。
扩展规律观察
团队还研究了Agent能力随训练规模的增长规律。
实验发现,Agent能力的提升呈现出可预测的扩展趋势:
- 随着轨迹数据量增加,规划、行动、反思等能力稳步提升
- 不同领域的能力增长速度不同,数学和代码领域增长最快
- 达到一定规模后,能力提升开始放缓,但仍在持续
这是首次系统性地证明了轻量级LLM中Agent能力的可扩展性。

深层洞察:预训练中的Agent基因
这项工作最重要的启示,不是单纯的性能提升,而是证明了Agent能力可以在预训练阶段被系统性地培养。
传统观点认为,Agent能力是”后天”的,需要通过微调、强化学习或外部框架来实现。
Youtu-LLM的成功表明,如果在预训练阶段就注入正确的信号,轻量级模型同样可以具备内在的Agent智能。
这里的”正确信号”包括:
- 结构化的轨迹数据:不只是答案,而是完整的问题解决过程
- 原子能力分解:将复杂任务拆解为可学习的基本单元
- 多样性和扩展性:通过各种策略(分支、扰动、正向/逆向合成)大规模生成高质量数据
- 渐进式课程:从常识到专业,从知识到能力,循序渐进

对普通用户的启示
这项研究听起来很学术,但对普通人也有实际意义。
本地AI助手会越来越强。
20亿参数的模型,经过恰当的训练,就能具备强大的Agent能力。这意味着,未来你的手机、电脑上运行的本地AI助手,可能比你想象的能干得多。
“小而美”的专用模型是趋势。
不是所有场景都需要千亿参数的通用大模型。针对特定任务训练的小模型,可能才是AI应用落地的主流。
AI助手的”思考方式”可以被设计。
Youtu-LLM证明了,通过设计训练数据的结构(如Agentic-CoT的五阶段范式),可以直接影响AI解决问题的思维方式。这为”定制化AI”打开了一扇门。
总结
Youtu-LLM让我们看到,AI能力的提升,不一定要靠堆砌参数。
通过精心设计的训练策略——渐进式课程、结构化轨迹数据、原子能力分解——一个小模型也能爆发出惊人的能量。
回到最开始的问题:什么是真正的智能?
是记住海量的知识?是生成流畅的文字?还是通过巨大的参数规模来碾压任务?
Youtu-LLM给出了另一个答案:真正的智能,在于系统性地理解问题、规划方案、执行行动并从反馈中学习的能力。
这种能力,不一定需要庞大的规模,但一定需要正确的培养方式。
就像人类学习一样,不是死记硬背,而是在解决问题的过程中,逐步形成思维的框架和行动的模式。
当我们用”轨迹”而不是”答案”来训练模型,当我们让模型学会”思考过程”而不只是”结论”,模型就不再是知识的复读机,而成为了有思考力的Agent。
这或许是通向真正智能的一条更可行的路径。
论文出处:Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models(arXiv:2512.24618)。
原文信息
作者:vista8(@vista8) 原文地址:
思路清晰,干货满满。
思路清晰,干货满满。
这个观点很中肯,深有同感。
不错不错,已加入书签。
看完了,收获满满,期待更多更新。
路过