Transformer 九年进化史:从 2017 年一篇论文到 ChatGPT 与更远

山止川行AI 前沿📡 觉醒AI2026-09-18696 阅读💛 66 收藏

2017 年,一篇研究论文引入了 Transformer,一种如今驱动几乎所有现代 AI 系统的人工智能模型。在那篇论文之前,Transformer 并不存在,AI 的语言处理方式也完全不同。

Transformer 之前的 AI 模型在一个基础问题上苦苦挣扎:读一篇长文时,读到结尾就记不住开头的信息。Transformer 用一种巧妙的方式解决了这个问题,而这一解决方案改变了 AI 的进程。

本文解释 Transformer 是什么、它为何是突破、以及它如何从一篇论文进化成当今最先进生成式 AI 系统背后的技术。

Transformer 解决的问题

2017 年之前,处理语言的 AI 模型一次只能处理一个词。想象一下逐词阅读一个句子,每读完一个词就闭上眼睛,读到最后一个词时再回忆第一个词是什么——这就是循环神经网络(RNN)这类旧方法的局限。

这些模型存在训练难题。处理长段落时,模型的内部连接会随着文本增多而减弱,使模型难以学会在长序列中保留信息。这被称为梯度消失问题。实际表现是:旧方法在短语上表现不错,在长文上举步维艰。

图片

2014 年,序列到序列(seq2seq)模型带来改进,用两个 RNN 协同工作:一个读输入,一个生成输出。但瓶颈依旧:模型必须在生成响应前把读到的所有内容压缩成一份单一摘要。对长文本而言,太多信息在这种压缩中丢失。

2015 年,研究者加入了一种叫注意力(attention)的机制,让模型在生成每个词时回看原文。这是向前一步,但底层模型仍然逐词处理。这种串行处理让训练缓慢,也限制了模型的规模上限。

突破:一次性处理全部内容

2017 年 Google 团队发表的 Transformer 论文提出了一个激进想法:如果不逐词处理呢?如果同时看到文本中的每个词,并让每个词自行判断其他每个词有多重要呢?

这叫自注意力(self-attention)。它的工作方式如下。

想象你在读这句话:「The cat sat on the mat because it was tired.」(猫坐在垫子上,因为它累了。)「it」指什么?人类知道指「猫」而不是「垫子」。自注意力让模型通过计算文本中每对词之间的相关性分数,建立同样的关联。

图片

Transformer 并行处理这些关系。它不是从左到右阅读,而是同时把所有词与其他所有词进行比较。这快得多,也让模型能处理长得多的文本。

原始 Transformer 有两部分:编码器负责读入输入并构建丰富的表示,解码器负责逐词生成输出。两部分都使用自注意力。模型还使用多个并行注意力计算,称为多头注意力,让它能同时聚焦不同类型的关系:一个「头」可能追踪语法,另一个追踪语义。

由于 Transformer 并行而非串行处理词,它没有内置的词序概念。RNN 从处理顺序得知 token 位置,而 Transformer 把输入看作集合而非序列。研究者通过添加位置编码解决这一问题——一种告知模型每个词在序列中位置的信号。

Transformer 立即证明了价值。在标准机器翻译测试中,最大版 Transformer 在英译法上得到 41.8 BLEU、英译德 28.4 BLEU,两项都高于此前任何系统。Transformer 的训练也远快于旧方法,因为它能高效利用现代图形处理器(GPU)。

两条路线:GPT 与 BERT

Transformer 论文之后,研究者意识到可以做一些更有威力的事:不再为每个任务单独训练模型,而是先在海量文本上训练一个大模型,再适配到具体工作。这叫预训练加微调。

2018 年出现两条路线。

图片

OpenAI 的 GPT-1 只用 Transformer 的解码器部分,训练目标是预测句子中的下一个词。通过在大量书籍上学习这一个简单任务,它发展出对语言的广泛理解,然后可以微调到问答、文本分类等具体任务,在 12 项主流语言基准中的 9 项上达到当时最优。

Google 的 BERT 只用编码器部分。BERT 不是预测下一个词,而是被训练填空:模型看到随机挖掉词的句子,必须猜出缺失内容。这迫使它同时从两个方向理解上下文。BERT 在 11 项语言理解基准上刷新纪录。

这两条路线定义了这个领域多年。GPT 式模型在生成文本上更强,BERT 式模型在理解文本上更强,两种路线长期并行发展。但随着模型变大,GPT 使用的纯解码器路线被证明更容易扩展。

规模化:更大的模型,意外的能力

2019 年 OpenAI 发布 GPT-2,参数量 15 亿。(参数是模型的内部设置,训练中被调整的数字。)GPT-2 能执行从未训练过的任务,只需在提示词里给几个示例。模型流利程度之高,让 OpenAI 一度拒绝放出完整版本,担心被用于生成误导性文本。

2020 年 GPT-3 把这一路线推到 1750 亿参数。结果令人震惊:GPT-3 会写代码、作诗、答 trivia、做算术——全部无需任何任务专项训练。你只需用自然语言描述需求,可选地给几个示例,模型就会尽力照办。

图片

这些结果引出一个实际问题:模型应该做多大?是造一个用较少数据训练的巨型模型,还是用更多数据训练的较小模型?

两篇论文给出答案。第一篇来自 OpenAI(2020),显示模型性能随模型规模、数据规模和算力的增加而可预测地提升。这一发现被称为缩放定律,鼓励各机构建造自己负担得起的最大模型。

第二篇来自 DeepMind(2022),修正了第一篇。DeepMind 发现大多数现有模型训练不足。在给定算力预算下,用更多数据训练的较小模型一致优于用较少数据训练的较大模型。他们的 Chinchilla 模型只有 700 亿参数,却击败了规模两倍以上的 GPT-3。在 DeepMind 的算力预算下,最优比例约为每个参数配 20 个 token 的训练数据。这一发现成为领域内广泛使用的经验法则。

教模型变得有用

原始能力不等于有用行为。在互联网文本上训练的大模型可能产出有毒、错误或无用的回复。解决之道是在初始预训练之后增加一个新的训练阶段。

突破来自一种叫「基于人类反馈的强化学习」(RLHF)的技术。它分三步工作。

第一步,人类示范者写出展示模型应如何行为的示例回复,模型在这些示例上微调。第二步,模型对同一提示词生成多个回复,人类从好到差排序。这些数据训练出一个奖励模型,能预测人类会如何评价任意回复。第三步,用强化学习算法优化语言模型,使其最大化来自奖励模型的得分。

图片

效果是戏剧性的。OpenAI 展示:13 亿参数模型经 RLHF 训练后,被人类评估者认为优于 1750 亿参数的 GPT-3。决定感知质量的是对齐,而不只是规模。

Anthropic 开发了替代方案「宪法 AI」(Constitutional AI),让模型依据一套书面原则自我批评和修订输出,减少对人类标注的依赖,训练中仍使用强化学习。这一路线成为 Claude 模型家族的基础。

一切改变的时刻

2022 年 11 月 30 日,OpenAI 发布 ChatGPT——构建在 GPT-3.5 之上、整合 InstructGPT 研究中 RLHF 技术的聊天机器人。ChatGPT 两个月内月活破亿,成为当时消费级应用的最快 adoption 纪录。

图片

这次发布引发了重新定义 AI 行业的投资与公众认知浪潮。Google 发布 Bard,Anthropic 发布 Claude。一年之内,每家大型科技公司都推出了自己的 AI 助手。「大语言模型」一词进入了日常词汇。

不破产地做大模型

随着模型变大,问题出现了:稠密模型(每个输入都激活全部参数)的训练和运行成本变得高得离谱。另一种架构提供了出路。

混合专家(MoE)对任意输入只激活模型参数的一小部分。可以把它想象成一家拥有专家的公司:财务问题进来,只有财务专家被叫来;医学问题进来,只有医学专家被叫来。公司名册上有很多员工,但任何给定任务只由相关的那些处理。

图片

Google 的 Switch Transformer(2021)证明把每个输入路由到单一专家能简化训练。GLaM(2021)把规模推到超过一万亿总参数,能耗却只有同等能力稠密模型的三分之一。DeepSeek-V3(2024)进一步精炼,6710 亿参数中每个输入只激活 370 亿。

Mistral AI 用 2023 年的 Mixtral 8x7B 把 MoE 带入开放权重社区,以几分之一的成本匹敌大得多的模型。

今天的 Transformer 怎么造

Transformer 架构自 2017 年以来不断演化。一项对 53 个模型的个人分析识别出多数现代模型共享的组件集。

多数模型不再用层归一化,改用更简单、训练更稳定的 RMSNorm。不再用可学习位置嵌入,改用处理更长序列更好的旋转位置编码(RoPE)。不再用 ReLU 激活函数,改用提升质量的 SwiGLU。不再用完整多头注意力,改用减少文本生成时内存占用的分组查询注意力(GQA)。

图片

并非每个模型都遵循此模式。DeepSeek 的模型使用一种不同的注意力机制——多头潜在注意力(MLA)。但总体趋势是向一组标准组件收敛。

两项支撑性创新让这些大模型变得实际可行。2022 年的 FlashAttention 重新实现了注意力计算以减少缓慢的内存操作,让某些模型训练提速至多三倍。2023 年的 PagedAttention 把操作系统内存管理概念应用于模型内部缓存,减少内存浪费,服务模型时吞吐量大幅提升。

人人可用的开放模型

最初几年,能力最强的模型是闭源的,只有建造它们的公司能用。2023 年这改变了。

Meta 于 2023 年 2 月发布 Llama。虽以非商业许可发布,几天内就外流到更广的研究社区,引爆了微调、优化和部署工作。后续版本加入了商业许可、更大模型尺寸和原生多模态。

图片

Mistral AI 成为另一股重要力量。2023 年 9 月发布的 70 亿参数模型,凭巧妙的架构选择击败了 Meta 的 130 亿参数模型。其 MoE 模型 Mixtral 8x7B 证明开放权重模型能与专有系统竞争。

DeepSeek 这家中国 AI 实验室为 V2、V3、R1 模型发布了详细技术报告,在 MoE 架构和推理能力上都有推进。其他机构——阿里的 Qwen、零一万物的 Yi、阿联酋 TII 的 Falcon、Google 的 Gemma——共同贡献了一个快速扩张的开放权重生态。

同样重要的还有开源工具链。2019 年发布的 Hugging Face Transformers 库为数千个模型提供了统一接口。硬件侧,NVIDIA GPU 和 Google TPU 提供了缩放定律所要求的算力。

超越文本:看、听与创作

Transformer 为语言设计,却自然泛化到其他领域。

视觉 Transformer(ViT)把同样的自注意力机制应用于图像块而非单词,在图像分类上追平或超越旧的卷积方法。DALL-E 和 Stable Diffusion 用 Transformer 组件从文字描述生成图像。

图片

更大的转变发生在语言模型直接吸收视觉之时。2023 年 3 月发布的 GPT-4 能接受图像输入,理解图表、照片和文档。Google 的 Gemini 从底层设计为多模态模型,在文本、图像、音频和视频上联合训练。2024 年 5 月的 GPT-4o 用单一模型端到端贯通文本、视觉和音频。

回答之前先思考

最近一项主要进展是一类新的模型:回答前花更多时间思考。

OpenAI 的 o1(2024 年 9 月)被训练为在响应前产生长长的内部推理链。它不是立即生成答案,而是逐步解决问题、沿途检查自身逻辑。这一路线被称为测试时计算扩展,在复杂数学、编程和逻辑问题上大幅提升准确率。

DeepSeek-R1 项目更进一步。第一版 R1-Zero 证明推理能力可以从纯强化学习中涌现,无需任何人类提供的示例。模型学会验证自己的步骤、发现错误时回溯。完整版 R1 再加入少量监督训练以提升可读性,同时保留驱动其推理能力的强化学习方法。

现状

领域已收敛到一份标准配方:带现代组件的纯解码器 Transformer,在数万亿 token 上预训练,经人类反馈做指令微调,可选地用测试时计算增强推理。前沿模型有数千亿到数万亿参数,上下文窗口可达一百万 token。

图片

若干问题仍然开放。指导 2020 到 2024 年领域的缩放定律,对纯预训练似乎正在显示收益递减。推理模型范式打开了新的扩展轴,但能延伸到数学和编程之外多远尚不清楚。Mamba 等替代架构为长序列提供线性而非二次复杂度,潜在挑战 Transformer 的统治地位。前沿模型不断攀升的成本,则引出谁能负担建造它们的问题。

明确的是,Transformer 背后的核心思想——并行处理的自注意力——已被证明极为耐久。

过去九年的每一项主要进展都建立在 2017 年奠定的地基上。细节变了,原则长存。

原文信息

  • 作者:Mayhem4Markets(@Mayhem4Markets),AI 模型架构技术分析
  • 发布时间:2026-07-16 原文地址:

文章评论(0

暂无评论,快来抢沙发~