模型负责观察,表格负责决策:让 LLM 远离宠物分诊
📌 One-Sentence Summary
TailStory 在宠物健康分诊中严格分离 LLM 观察与基于规则的决策,以确保确定性、可审查性和安全性。
📝 Summary
这篇工程博客详细介绍了 TailStory 宠物健康分诊功能的技术架构,该功能使用视觉模型描述症状,但依赖确定性的 TypeScript 查找表来分配紧急程度。作者认为,对于医疗相关应用,将 LLM 排除在决策循环之外至关重要,因为需要一致的输出、可人工审查的逻辑以及可测试性。文章通过具体示例加以说明,包括粪便颜色映射、需要最小历史窗口以避免误报的趋势规则,以及一个因移动平均目标体重而将肥胖猫错误评为理想体重的 bug。文章最后承认了这一权衡:基于表格的系统不如模型驱动的系统灵活,但为担忧的宠物主人提供了必要的安全保障。
💡 Main Points
将观察与决策分离,可确保高风险领域的确定性与可审查性。
系统仅使用视觉模型通过封闭枚举 schema 提取结构化观察结果(例如「黑色柏油样便」)。一个独立的静态 TypeScript 表格将这些观察结果映射到紧急程度分级。这防止了非确定性的 LLM 行为影响关键健康警报,并允许兽医直接审计和纠正逻辑。
趋势分析需要严格的历史基线,以防止警报疲劳。
检测随时间变化的规则(例如饮水量激增)包含一个 `min_days` 字段。这确保警报不会基于不充分的数据(如仅两天的记录)触发,否则会侵蚀用户信任。系统还区分物种特异性风险,例如猫与狗的肝脂沉积症。
朴素的统计目标可能导致危险的错误分类。
当体况评分使用近期称重的平均值作为目标体重时,出现了一个 bug,导致长期肥胖的宠物因其体重稳定而被评为「理想」。修复方案涉及使用外部参考区间或主人设定的目标,这凸显了健康监测中自我参照指标的危险性。
优雅降级优先考虑安全性而非聪明。
如果模型失败、超时或产生无效输出,系统会默认进入安全状态(「监测」)而非猜测。作者承认基于规则的表格不如 LLM 灵活,但认为「始终表现良好」比「95% 的时间聪明,5% 的时间自信地犯错」更安全。
💬 Key Quotes
模型负责观察,表格负责决策。
一个 95% 的时间更聪明、另外 5% 的时间自信地犯错的模型,对担忧的主人来说,比一个始终表现良好的表格更糟糕。
沉默不是症状。「食欲下降」和「48 小时内未记录排便」对每个只是停止使用应用的主人都触发了。
缺失的数字比自信的错误数字更好。
📊 Article Meta
AI Screening: 86
Source: Hacker News - Newest: "LLM"
Author: TailStory team
Category: 人工智能
Language: 英文
Read Time: 9 min
Word Count: 2038
Tags:
AI 与智能应用 , AI 安全与对齐 , AI 工程 , 多模态 AI , AI 产品与应用
暂无评论,快来抢沙发~