GitHub - nwjang/psychosis-guard: LLM 聊天机器人中的轨迹感知安全边界: 捕捉到局部安全过滤器所遗漏的逐渐幻觉强化

📌 One-Sentence Summary
一个聊天机器人可以在每次回合中稍微验证一下用户的妄想信念,而不会让任何单个消息触发内容过滤器。
📝 Summary
本文介绍了 psychosis-guard,一个针对长期 LLM 会话的轨迹感知安全中间件。它跟踪整个会话,评估它的方向,并在漂移积累之前以渐进的干预介入
💡 Main Points
Shrewd 将 LLM 教师判断蒸馏成小型、快速的本地模型用于固定分类任务
管道使用几百个手动标记的种子和一个更大的未标记池,使用 LLM (通过 LiteLLM) 标记或评估池,然后训练一个紧凑的学生模型(TF-IDF、嵌入或微调 ModernBERT),该模型在本地运行,未在 LLM 循环中
两个不同的工作流程:基本分类器和多类型问题的校准决策面板
分类器为每个文档分配一个标签。决策面板以单次通过回答固定选择(选择一个)、Noul(是/否概率)和分数(顺序评级)问题的方式回答,概率与人类标签在锁定测试集上进行了校准
关键经验发现挑战了蒸馏管道的常见假设
提示优化(GEPA)改进通常不会在保留数据上普遍适用。主动学习(选择教师对其不确定的行)可以将教师调用减少 1.1x–2.3x 以获得相同的准确性。更好的教师标签并不总是会产生更好的学生——改变学生架构或添加更多数据可以帮助更多。校准使概率与人类标签一致,但低 ECE 可以掩盖一个几乎区分例子之间的模型
四个预建决策面板展示了现实世界的实用性并揭示了具体的失败模式
SMS 垃圾短信、电子邮件过滤、设备端安全边界和 PII 检测的面板与 AUROC/ECE/延迟度量一起提供。SMS 面板显示微调编码器在现代诈骗中超过 TF-IDF,尽管在 2011 年测试集上打平。 PII 面板在分隔/破折号信用卡号上失败,说明对训练数据格式的敏感性
工具支持迭代开发:主动学习、人类审阅、学生比较、零样本堆叠和自动预算受限搜索
功能包括预算意识的标记、低自信度教师回答的审阅队列、学生模型在开发拆分上的比较、可选 NLI 零样本头部每个问题以及自动调节功能,该功能在预算限制下升级教师等级
💬 Key Quotes
将 LLM 判断转换为一个小型、快速的本地文本模型用于一个固定任务
提示优化帮助了一些教师,但在保留数据上获得的收益通常在保留数据上消失
在两个测试任务中选择了有信息的行比购买更便宜的标签或升级不确定的行更有效
更好的教师标签并不总是会产生更好的学生——改变学生或给它更多的训练数据有时会更有效
校准帮助概率与人类标签一致,但低校准误有时会掩盖一个几乎区分例子之间的模型
📊 Article Meta
AI Screening: 87
Source: Hacker News - Newest: "LLM"
Author: nwjang
Category: 人工智能
Language: 英文
Read Time: 8 min
Word Count: 1866
Tags:
AI 与智能应用 , AI 安全与对齐 , 开源项目 , 开发者工具 , 人工智能 & 智能应用
赞同,实践出真知。
内容翔实,正好需要,先收藏再看。
实测过类似工具,作者说的基本属实。
点赞,必须点赞
作者写得真不错,学到了不少。
内容翔实,正好需要,先收藏再看。
作者写得真不错,学到了不少。
这篇文章分析得很透彻,收藏了!
这个观点很中肯,深有同感。
很有价值的分享,感谢整理。
有没有更详细的教程,期待后续。
刚好最近在找这方面的资料,太及时了。