20亿参数打败800亿?不靠知识蒸馏!腾讯近期最强AI论文解读

AI小蝌蚪AI 前沿2026-09-17265 阅读💛 242 收藏

假如你要训练一个助手帮你完成复杂的任务。

传统方式是先让它学会基础知识,然后再教它怎么做事。

但如果从一开始就教它”边学边做”会怎样?

这就是腾讯Youtu-LLM团队最近提出的思路。

他们做了一件听起来很疯狂的事情,在一个只有20亿参数的小模型里,从头开始培养推理、规划和执行能力,而不是依赖其他大模型的”知识蒸馏”。

结果让人惊喜。

这个小模型在很多任务上的表现,不仅超过了同等规模的所有竞争对手,甚至在某些场景下能够挑战80亿参数的大模型。

图片

为什么大模型这么”重”

先聊聊背景。

参数规模:神经网络中可调节的数值,类似于大脑中的突触连接。参数越多,模型的”记忆容量”和”处理能力”理论上就越强。

当前最强的大语言模型,动辄几百亿甚至上千亿参数。

就像一个配备了巨型处理器和海量内存的超级计算机,功能强大但也非常”昂贵”。

训练成本高昂。训练这样一个模型可能需要数千张GPU卡运行几个月,电费就是天文数字。

部署困难重重。想在手机或边缘设备上运行?几乎不可能。

即便在云端,每次推理的成本也让很多应用望而却步。

响应速度受限

模型越大,处理一个请求需要的时间就越长。对于需要实时反馈的场景,这是致命的。

所以,轻量级但性能强悍的模型,成了AI研究的热门方向

现有方案的局限

目前让小模型变聪明的办法,主要有这几种:

知识蒸馏:让大模型当”老师”,小模型当”学生”,通过模仿大模型的输出来学习。就像学生看着老师的答案,学习如何解题。

指令微调:在小模型训练好之后,用特定格式的指令数据进行额外训练,让它学会听懂人类的命令。

架构简化:通过精简网络结构来减少参数量,就像把一辆大卡车改造成小轿车。

图片

这些方法确实有效,但有一个共同的问题,它们主要是在让模型”学会表演”,而不是真正培养底层的认知能力

就像你可以教一个人背诵复杂问题的标准答案,但这不代表ta真的理解了问题的本质,更不代表ta能灵活应对变化。

当任务变复杂,特别是需要规划、推理和自主执行的场景,比如深度研究、多步骤编程、工具调用时,这种”表演式”的能力就不够用了。

Agent时代的新要求

Agent(智能体):能够感知环境、自主决策并执行行动的AI系统。不同于被动回答问题的对话系统,Agent更像一个能主动完成任务的助手。

随着AI应用越来越复杂,社区逐渐意识到,真正强大的Agent需要具备内在的规划、执行、状态感知和反思能力,而不是依赖外部框架的堆砌。

试想一下,你让AI帮你完成一个研究任务:

  • 它需要规划整个流程,先查什么、再做什么
  • 它要能执行具体的操作,比如调用搜索引擎、分析数据
  • 它必须能感知当前进展,知道哪些信息已经获取,哪些还缺失
  • 它还要能反思自己的行为,发现错误并调整策略

这些能力,不是简单地堆砌工具或编写复杂的提示词就能实现的。

它们需要深深植入模型的”思维方式”中。

图片

Youtu-LLM团队提出的核心问题就是:能不能在预训练阶段,就让轻量级模型学会这些Agent能力?

Youtu-LLM的三大创新

  1. 紧凑但强大的架构

Youtu-LLM采用了Multi-Latent Attention(MLA)架构

Multi-Latent Attention:一种改进的注意力机制,通过引入多个潜在表示来压缩计算,在保持性能的同时大幅降低内存占用。

传统的注意力机制就像你同时盯着一整页文字,每个词都要和其他所有词建立联系。

计算量随着文本长度呈平方增长,内存消耗很快就爆炸了。

MLA则更聪明。

它先把信息压缩成几个”关键代表”,然后让这些代表去建立联系。

就像开会时,不是所有人两两交流,而是各小组先讨论,再由组长汇报。

这让Youtu-LLM能够支持128k的上下文窗口,同时保持极低的内存占用。

128k大概相当于一本中等篇幅的小说,足够处理复杂的长程推理任务。

此外,团队还设计了一套STEM导向的词表

词表(Vocabulary):模型能够识别和生成的基本文本单元集合。就像语言的”字典”,决定了模型如何将文本分解成最小的处理单元。

普通词表对自然语言友好,但对数学公式、代码符号的处理效率很低。

STEM导向的词表针对科学、技术、工程、数学领域做了专门优化,能更高效地表示这些领域的内容。

  1. “常识-STEM-Agent”训练课程

Youtu-LLM的训练不是一股脑把所有数据扔进去,而是精心设计了一个渐进式的课程

总共使用了约11万亿个token的数据

Token:文本的基本处理单元。在中文中,一个token大约对应1-2个汉字;在英文中,一个token大约对应0.75个单词。1万亿token相当于数百万本书的文字量。

训练分为三个阶段:

阶段1:常识学习(占比最大)

  • 70%以上是高质量的网页和百科知识
  • 让模型建立对世界的基本认知
  • 就像小孩子先学会基础的语言和常识

阶段2:STEM强化

  • 700B token的STEM语料(数学、物理、化学、生物、医学)
  • 1400B token的代码数据
  • 500B token的合成数据(包括知识点解释、论文解读、代码注释等)
  • 培养模型在专业领域的深度理解

阶段3:Agent能力注入

  • 这是最关键的创新
  • 200B token的高质量”轨迹数据”
  • 不只是让模型看答案,而是让它学习完整的问题解决过程

数据分布不是一成不变的,而是逐渐从通用知识向STEM和Agent任务倾斜

就像学习一门技艺,先打基础,再专精,最后融会贯通。

  1. 可扩展的Agent轨迹数据

这是论文最值得关注的部分。

轨迹数据(Trajectory Data):记录了Agent完成任务的完整过程,包括分析、规划、行动、反思和总结。就像一部详细的”任务日志”,记录了每一步的思考和决策。

团队构建了200B token的Agent轨迹数据,覆盖五大类别:

Agentic-CoT轨迹(25B)

传统的思维链(Chain-of-Thought)数据虽然有效,但常常冗长重复,充斥着过度思考。

Youtu-LLM提出了结构化的Agentic-CoT范式,将推理过程分解为五个明确的阶段:

  • Analysis(分析):拆解问题,识别关键要素和约束
  • Plan(规划):制定解决步骤的蓝图
  • Action(行动):执行计划,得到初步结果
  • Reflection(反思):评估执行效果,检查错误,考虑替代方案
  • Summary(总结):提炼最终答案和关键发现

这种结构化的思考方式,让模型不仅学会了推理,更学会了像Agent一样系统性地解决问题

数学轨迹(20B)

数学推理一直是评估AI认知能力的试金石。

团队将数学能力分解为11项原子能力,分三个层次:

基础知识与计算:符号识别(识别数学符号和结构模式)、概念理解(理解和区分数学概念)、计算执行(执行算术、代数、微积分运算)。

复杂推理与应用:空间感知(几何对象和空间关系的推理)、形式化表达(将自然语言转化为数学表示)、演绎归纳(通过已知前提推导结论)、反证与构造(通过目标驱动的推理策略解题)、建模转化(将现实问题转化为数学模型)、定理应用(识别并正确应用定理或引理)。

数学元认知:自我反思(诊断推理错误并提出修正策略)、新知识习得(学习新定义并迁移到未见问题)。

这些原子能力被自然地映射到Agent的规划、行动和反馈模块中。

Agent在解题时,会先规划需要哪些原子能力,然后逐步执行,并在每一步后进行评估和调整

最终合成了约138万条数学轨迹,覆盖K12到数学竞赛级别的难度。

图片

代码轨迹(70B)

代码场景的轨迹数据分为两部分:

原子代码能力

  • 主动探索和定位:在代码库中找到特定的变量、函数或文件
  • 上下文感知生成:基于大量仓库上下文完成关键代码段
  • 补丁生成和编辑:根据问题描述生成精确的修改
  • 测试与验证:评估代码正确性,定位失败点
  • 环境理解:解释和预测执行环境的信号
  • 自我反思:基于环境反馈进行单轮或多轮代码修正

端到端代码Agent轨迹

团队采用了三维扩展策略来大规模生成轨迹:

  • 扩展任务:利用SWE-gym、SWE-smith等开源沙盒环境,并合成新的任务实例
  • 扩展上下文:针对缺少可执行镜像的仓库,设计静态评估任务(如故障定位、重构)
  • 扩展行动:在关键行动点(编辑、测试)生成分支轨迹

特别有意思的是分支策略

  • 对于成功轨迹,在每个关键行动点生成替代方案,丰富模型的行动空间
  • 对于失败轨迹,只在第一个关键行动点生成单个分支,然后截断后续步骤

这样既能重用失败数据中的有价值部分,又能避免错误传播。

图片

深度研究轨迹(60B)

深度研究(Deep Research):需要Agent在复杂环境中导航、验证异构信息并综合成连贯输出的任务场景。不同于简单的信息检索,它要求自主的知识发现能力。

深度研究轨迹分为两类:

闭式任务(如多跳问答):

从高知识密度的语料(网页、题库、教材、论文)中提取多跳QA对,然后使用多种Agent框架和搜索API生成轨迹。

为了增加多样性,团队还引入了搜索结果扰动:随机遮蔽某些来源,或抑制Top-K结果。

这增加了任务难度,产生更长更复杂的轨迹,提高了模型的鲁棒性。

对于失败的轨迹,团队会添加一段轨迹分析,明确指出错误所在,并逐步分析推理过程。

这让模型能从错误中学习。

开式任务(如生成研究报告):

采用正向和逆向混合合成策略

正向合成:

  • 从百科、学术语料、财报中获取研究问题
  • 使用”三思而后行”框架进行深度调研
  • 当模型认为准备好生成报告时,要求它”再想想”
    • 系统性地总结已获取信息
    • 逐节评估是否需要进一步探索
    • 直到每个方面都被充分研究
  • 报告生成模块整合所有信息库,创建结构化大纲,系统性展开各节

逆向合成:

  • 从高质量的学术论文、研究报告等”结果”出发
  • 利用文中的引用关系作为可靠的相关性信号
  • 重构生成这些内容的搜索轨迹
  • 确保轨迹的终点是经过验证的高质量内容

逆向合成的平均轨迹长度达到32K token,质量极高且事实性有保障。

工具使用轨迹(25B)

覆盖函数调用、规划和其他通用工具使用场景的轨迹数据。

图片

训练流程与细节

整个训练分为三个阶段:

阶段1:通用预训练

  • 10.64T token的通用数据
  • 建立常识和基础知识

阶段2:STEM增强

  • 逐步增加STEM和代码数据的比例
  • 培养专业领域的深度理解

阶段3:Agent中期训练

  • 注入200B token的轨迹数据
  • 系统性培养规划、执行、反思能力

数据质量控制极为严格

团队开发了一套多维度分类和质量评分系统

  • 10项质量评估标准
  • 11项领域分类标准(涵盖46个子领域)
  • 使用Deepseek-R1进行初步标注
  • 人工审核确保95%以上的一致性
  • 训练快速分类模型(基于Qwen3-1.7B)
  • 最终达到95%以上的分类和评分准确率

只保留平均评分8.5分以上的数据。

此外,还使用了MinHash-LSH去重Aho-Corasick算法进行基准污染检测,最大限度避免测试数据泄漏。

图片

实验结果:小模型的大惊喜

通用能力评估

在常识、STEM、编程、长文本等通用任务上,Youtu-LLM 2B的表现:

基座模型对比

Youtu-LLM 2B在MMLU-Pro上拿到48.4,MATH拿到40.7,HumanEval拿到57.3。它在大多数指标上超越了3B的SmolLM3,特别是在MMLU-Pro和MATH等需要深度推理的任务上

指令模型对比

与DeepSeek-R1-Distill-Qwen 1.5B、Qwen3 1.7B、SmolLM3 3B等竞争,Youtu-LLM 2B在以下任务上表现突出:

  • MATH-500:95.0(超越所有同规模模型)
  • AIME 2024:73.3(数学竞赛级难度)
  • HumanEval:95.9(代码生成)
  • MBPP+:71.7(严格版代码测试)

甚至在部分任务上,Youtu-LLM 2B的表现可以和8B规模的DeepSeek-R1-Distill-Llama 8B相媲美

Agent能力评估

在APTBench这个专门评估Agent能力的基准上,Youtu-LLM的优势更加明显。

APTBench涵盖四个领域:代码、深度研究、工具和数学。每个领域测试规划、行动和原子能力三个维度。

代码场景

  • 规划能力:Qwen3 4B为42.1,SmolLM3 3B为51.2,Youtu-LLM 2B达到65.8
  • 行动能力:Qwen3 4B为38.5,SmolLM3 3B为47.3,Youtu-LLM 2B达到56.2
  • 原子能力:Qwen3 4B为55.3,SmolLM3 3B为63.7,Youtu-LLM 2B达到72.4

深度研究场景

  • 规划能力:Qwen3 4B为48.7,SmolLM3 3B为52.1,Youtu-LLM 2B达到68.3
  • 行动能力:Qwen3 4B为41.2,SmolLM3 3B为49.8,Youtu-LLM 2B达到61.5
  • 原子能力:Qwen3 4B为58.9,SmolLM3 3B为64.2,Youtu-LLM 2B达到74.8

在所有Agent任务上,Youtu-LLM都以显著优势领先。这证明了Agent预训练策略的有效性。

扩展规律观察

团队还研究了Agent能力随训练规模的增长规律。

实验发现,Agent能力的提升呈现出可预测的扩展趋势

  • 随着轨迹数据量增加,规划、行动、反思等能力稳步提升
  • 不同领域的能力增长速度不同,数学和代码领域增长最快
  • 达到一定规模后,能力提升开始放缓,但仍在持续

这是首次系统性地证明了轻量级LLM中Agent能力的可扩展性

图片

深层洞察:预训练中的Agent基因

这项工作最重要的启示,不是单纯的性能提升,而是证明了Agent能力可以在预训练阶段被系统性地培养

传统观点认为,Agent能力是”后天”的,需要通过微调、强化学习或外部框架来实现。

Youtu-LLM的成功表明,如果在预训练阶段就注入正确的信号,轻量级模型同样可以具备内在的Agent智能

这里的”正确信号”包括:

  • 结构化的轨迹数据:不只是答案,而是完整的问题解决过程
  • 原子能力分解:将复杂任务拆解为可学习的基本单元
  • 多样性和扩展性:通过各种策略(分支、扰动、正向/逆向合成)大规模生成高质量数据
  • 渐进式课程:从常识到专业,从知识到能力,循序渐进

图片

对普通用户的启示

这项研究听起来很学术,但对普通人也有实际意义。

本地AI助手会越来越强

20亿参数的模型,经过恰当的训练,就能具备强大的Agent能力。这意味着,未来你的手机、电脑上运行的本地AI助手,可能比你想象的能干得多。

“小而美”的专用模型是趋势

不是所有场景都需要千亿参数的通用大模型。针对特定任务训练的小模型,可能才是AI应用落地的主流。

AI助手的”思考方式”可以被设计

Youtu-LLM证明了,通过设计训练数据的结构(如Agentic-CoT的五阶段范式),可以直接影响AI解决问题的思维方式。这为”定制化AI”打开了一扇门。

总结

Youtu-LLM让我们看到,AI能力的提升,不一定要靠堆砌参数

通过精心设计的训练策略——渐进式课程、结构化轨迹数据、原子能力分解——一个小模型也能爆发出惊人的能量。

回到最开始的问题:什么是真正的智能?

是记住海量的知识?是生成流畅的文字?还是通过巨大的参数规模来碾压任务?

Youtu-LLM给出了另一个答案:真正的智能,在于系统性地理解问题、规划方案、执行行动并从反馈中学习的能力

这种能力,不一定需要庞大的规模,但一定需要正确的培养方式。

就像人类学习一样,不是死记硬背,而是在解决问题的过程中,逐步形成思维的框架和行动的模式。

当我们用”轨迹”而不是”答案”来训练模型,当我们让模型学会”思考过程”而不只是”结论”,模型就不再是知识的复读机,而成为了有思考力的Agent

这或许是通向真正智能的一条更可行的路径。

论文出处:Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models(arXiv:2512.24618)。

原文信息

作者:vista8(@vista8) 原文地址:

文章评论(6

雪知秋4 分钟前

思路清晰,干货满满。

回复
晨沐雨17 分钟前

思路清晰,干货满满。

回复
拾贝者43 分钟前

这个观点很中肯,深有同感。

回复
风倚栏20 分钟前

不错不错,已加入书签。

回复
雪知秋50 分钟前

看完了,收获满满,期待更多更新。

回复
星寻梦24 分钟前

路过

回复