GitHub - sshah03/shrewd:将 LLM 判决转化为用于固定任务的小型、快速、本地文本模型

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-23316 阅读💛 248 收藏
GitHub - sshah03/shrewd:将 LLM 判决转化为用于固定任务的小型、快速、本地文本模型

📌 One-Sentence Summary Shrewd 是一个流水线,它使用 LLM 作为教师来标记数据,然后将这些判断蒸馏到一个微型本地分类器或校准决策面板中,并提供了关于提示优化、主动学习和学生模型选择的实用发现。 📝 Summary 文章介绍了 shrewd,这是一个开源工具,可将 LLM 判断转化为用于固定分类任务的紧凑、快速本地模型。它提供两种工作流程:基本分类器(每个文档一个标签)和校准决策面板(一起回答多个类型化问题)。该流水线支持通过 GEPA 进行提示优化、选择信息性行的主动学习、不确定标签的人工审查,以及多种学生后端(TF-IDF、静态嵌入、SetFit、微调 ModernBERT)。作者分享了实证发现:提示优化的增益往往在保留数据上消失;选择信息性行优于更便宜的标签;更好的教师标签并不总能改善学生;校准可能掩盖较差的区分能力。提供了四个预构建面板(SMS 垃圾邮件、电子邮件分诊、AI 输入护栏、PII 检测),并附有 AUROC/ECE 指标和已知失败案例。该工具强调本地推理、成本控制和数据保留在设备上。 💡 Main Points Shrewd 将 LLM 教师判断蒸馏为用于固定分类任务的小型、快速本地模型。 该流水线采用几百个手工标记的种子数据和一个更大的未标记池,使用 LLM(通过 LiteLLM)来标记或判断该池,然后训练一个紧凑的学生模型(TF-IDF、嵌入或微调 ModernBERT),该模型可在本地运行,无需 LLM 参与。 两种不同的工作流程:基本分类器和带有多个类型化问题的校准决策面板。 分类器为每个文档分配一个标签。决策面板在一次通过中回答一组固定的选项(选择一个)、Noul(是否概率)和评分(顺序评级)问题,并在锁定的测试集上根据人类标签校准概率。 关键实证发现挑战了关于蒸馏流水线的常见假设。 提示优化(GEPA)的改进往往无法泛化到保留数据。主动学习(选择教师不确定的行)在相同准确率下减少教师调用 1.1 倍至 2.3 倍。更好的教师标签并不总是产生更好的学生——改变学生架构或添加更多数据可能更有帮助。校准使概率与人类标签一致,但低 ECE 可能掩盖一个几乎无法区分示例的模型。 四个预构建决策面板展示了现实世界效用并揭示了具体的失败模式。 SMS 垃圾邮件、电子邮件分诊、设备内护栏和 PII 检测面板附带 AUROC/ECE/延迟指标。SMS 面板显示,尽管在 2011 年测试集上持平,但微调编码器在现代诈骗上优于 TF-IDF。PII 面板在带空格/破折号的信用卡号上失败,说明了对训练数据格式的敏感性。 工具支持迭代开发:主动学习、人工审查、学生比较、零样本堆叠和自动预算约束搜索。 功能包括预算感知标记、低置信度教师答案的审查队列、开发分割上的学生模型比较、每个问题的可选 NLI 零样本头,以及在支出上限下提升教师层级的自动调优函数。 💬 Key Quotes 将 LLM 判决转化为用于固定任务的小型、快速、本地文本模型。 提示优化帮助了一些教师,但开发分割上的增益往往在保留数据上消失。 在测试成本的两个任务中,从好的教师中选择信息性行比购买更便宜的标签或升级不确定的标签更有效。 更好的教师标签并不总能改善学生。改变学生或给予更多训练数据有时更有帮助。 校准帮助概率与人类标签匹配,但低校准误差有时掩盖了一个几乎无法区分一个示例与另一个示例的模型。 📊 Article Meta AI Screening: 86 Source: Hacker News - Newest: "LLM" Author: sshah03 Category: 人工智能 Language: 英文 Read Time: 20 min Word Count: 4919 Tags: AI 与智能应用 , AI 工程 , 提示工程 , 开发者工具 , LLM 推理优化 Read Full Article

#AI 与智能应用# AI 工程# 提示工程# 开发者工具# LLM 推理优化

文章评论(0

暂无评论,快来抢沙发~