通过构建微型合约守卫来学习工具调用类型漂移

📌 One-Sentence Summary 语言模型的分词器并非预处理工具,而是一个冻结的、不可分割的模型组件,它将文本压缩成整数 ID,这对跨语言、JSON 负载和生产系统中的令牌计数有重大影响。 📝 Summary 本文解释了语言模型的分词器为何与软件预处理存在根本区别。作者从编译器背景出发,将编译器的词法分析器与模型的分词器进行类比:两者都将文本转换为结构化表示,但模型的分词器目标不同——压缩而非结构识别。 💡 Main Points 分词器是模型组件的一部分,而非预处理 与软件中解析器与数据分离不同,模型的分词器在训练时是冻结的,并与权重耦合。交换分词器会改变模型看到的内容和意义,实际上从相同的权重中产生了一个不同的模型。 BPE 通过从语料库频率中学习合并来压缩文本 字节对编码从 256 个字节标记开始,迭代地合并最频繁相邻的字节对,直到达到目标词汇量。编码是一个简单的贪心算法,总是选择最低排名的合并,而训练则选择最频繁的合并。 令牌计数在不同语言和格式中差异巨大 西班牙语在 GPT-2 下的成本约为英语的 1.7 倍,在新编码下的成本约为英语的 1.2 倍;JSON 的成本在所有三个测试的分词器中约为英语的 2.3 倍,因为大括号和引号等结构字符无法独立压缩。 分词器的选择对生产有直接影响 按令牌计费的上下文窗口在西班牙语或 JSON 中的令牌数量少于英语;每令牌定价是每语言定价;包含结构化元数据的提示模板每次调用都会支付 JSON 费用。当分词器和模型版本漂移时,会发生静默失败。 💬 Key Quotes 语言模型从未见过字母。它看到的只是整数。在你的字符串和第一次矩阵乘法之间,有一个函数将文本转换为 ID 列表,这个函数在模型训练的那一天就被冻结了。这不是预处理。这是模型的一部分。 词汇表是合并列表,按顺序排列。这个顺序就是语言的整个模型。编码重播它:将输入拆分为字节,找到具有最低合并排名的相邻对,合并它,重复直到没有合并。 GPT-2 将`1234567`分词为`123`、`45`、`67`,因为合并排名恰好产生了这种情况。`cl100k_base`改变了正则表达式,将数字运行限制在三个以内,这限制了损害但没有解决问题。 西班牙语在 GPT-2 下的成本约为英语的 1.7 倍,在最新编码下的成本仍为英语的 1.2 倍。JSON 的成本在所有三个分词器中约为英语的 2.3 倍:大括号、引号和键无法压缩。 模型文件和分词器文件是同一件事的两半,当它们漂移时,失败模式是静默的:模型会生成关于错误输入的流畅文本。 📊 Article Meta AI Screening: 88 Source: DEV Community: machinelearning Author: Alex Chen Category: 人工智能 Language: 英文 Read Time: 8 min Word Count: 1894 Tags: AI 与智能应用 , 模型训练与推理 , AI基础设施 , AI与智能应用 , AI工程 Read Full Article
暂无评论,快来抢沙发~