您的智能体选择其中一个选项。您可以测试这个选择吗?

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-09-231366 阅读💛 291 收藏
您的智能体选择其中一个选项。您可以测试这个选择吗?

📌 One-Sentence Summary 语言模型的 tokenizer 不是预处理,而是冻结在模型 artifact 中,压缩文本为整数 ID,具有重大影响力,跨语言、JSON 负载和生产系统的 token 计数。 📝 Summary 本文解释了为什么语言模型的 tokenizer 与软件预处理有本质区别。作者,来自编译器背景,绘制了一个编译器的 lexer 和模型的 tokenizer 之间的类比:两者都将文本转换为结构化表示,但模型的 tokenizer 有不同的目标——压缩而不是结构识别。 💡 Main Points tokenizer 是模型 artifact 的一部分,而不是预处理 与软件不同,模型的 tokenizer 在训练时间冻结并与权重耦合。交换它会改变模型看到的内容和含义,从而创建一个与同一权重不同的模型。 BPE 通过从语料库频率学习合并来压缩文本 字节对编码从 256 字节 token 开始,迭代合并最频繁的相邻对,直到达到目标词汇大小。编码是一个简单的贪婪算法,总是选择排名最低的合并,而训练时选择最频繁的。 token 计数在语言和格式上有巨大的差异 西班牙语在 GPT-2 下花费约 1.7 倍于英语,在新编码下花费约 1.2 倍;JSON 在所有三个 tokenizer 测试中花费约 2.3 倍,因为结构字符如花括号和引号无法独立压缩。 tokenizer 选择有直接生产后果 上下文窗口引用的 token 中包含的西班牙语或 JSON 比英语少;按 token 计价是按语言计价;带有结构元数据的提示模板在每次调用中都会按 JSON 计价。silent 失败发生在 tokenizer 和模型版本漂移时。 💬 Key Quotes 语言模型从未见过一个字母。它看到的是整数。 somewhere 之间的字符串和第一个矩阵乘法之间有一种函数,它将文本转换为 id 列表,而该函数在模型训练时冻结。它不是预处理。它是 artifact 的一部分。 词汇是合并列表,按顺序排列。该顺序是语言模型的整个模型。编码重放它:将输入分解为字节,找到排名最低的合并对,合并它,重复直到无法合并。 GPT-2 将`1234567`token 化为`123`、`45`、`67`,因为合并排名恰好产生了这样的结果。`cl100k_base`改变了正则表达式以限制数字块在三个字符内,这样就可以限制损害而不解决问题。 西班牙语在 GPT-2 下花费约 1.7 倍于英语,仍然在最新编码下花费约 1.2 倍。JSON 在所有三个编码下花费约 2.3 倍:花括号、引号和键无法压缩。 模型文件和 tokenizer 文件是同一个东西的两个半部分,当它们漂移时,失败模式是静默的:模型产生了关于错误输入的流畅文本。 📊 Article Meta AI Screening: 88 Source: DEV Community: machinelearning Author: TuringCorp Category: 人工智能 Language: 英文 Read Time: 4 min Word Count: 909 Tags: AI 与智能应用 , 模型训练与推理 , 测试与质量 , 期权与衍生品 , 人工智能与智能应用 Read Full Article

#AI 与智能应用# 模型训练与推理# 测试与质量# 期权与衍生品# 人工智能与智能应用

文章评论(0

暂无评论,快来抢沙发~