Skill Engineering 的暗黑技艺:Paul Bakaus 如何让 Impeccable 成为可靠的智能体 Harness

空逐月行业资讯📡 BestBlogs·全站精选⭐ 912026-09-22776 阅读💛 26 收藏
Skill Engineering 的暗黑技艺:Paul Bakaus 如何让 Impeccable 成为可靠的智能体 Harness

📌 One-Sentence Summary Paul Bakaus 展示了 Impeccable 如何借助独立评审、反吸引子、任务路由、持久记忆、可执行上下文、Hooks、实时交互和模型专属构建,将设计提示转化为可靠的智能体 Harness。 📝 Summary Paul Bakaus 将 Skill Engineering 定义为 Harness Engineering:可靠的智能体行为并非靠无限加长提示词,而是靠在提示词周围加入一套机制。以他的 Impeccable 设计 Skill 为例,他说明模型为何会被熟悉的默认方案吸引,以及如何通过反吸引子、生成种子和独立排序的候选集制造有价值的分歧。他主张把不同工作拆分为经路由的专家指令,在会话之间保存评审意见和用户决策,并用脚本把抽象指南转化为针对当前仓库的即时行动。演讲还将 Hooks 视为主动护栏:对于不可靠的修复行为,在写入前阻断;对于智能体可自行纠正的问题,则在写入后提供反馈,并为误报保留范围严格的豁免通道。Live Mode 连接浏览器与本地事件服务器,让用户直接指向界面元素、请求多个变体并选择结果,无需在对话中描述像素细节。Bakaus 还解释了分发型 Skill 为何必须针对不同 Harness 的权限、生命周期、工具语法和模型习性分别编译。最后,他提出以端到端测试、模拟交互用户、视觉评审器、竞品比较和消融测试构成评估体系,同时承认人的审美判断依然难以自动化。 💡 Main Points 当 Skill 扩展 Harness 时会更可靠 Bakaus 将不断膨胀的指令文件,与由智能体、脚本、状态、强制机制和交互界面协同构成的系统对照,认为每次失败都不应自动换来一条新的文字禁令。 独立证据能对抗模型自我验证式的偏差 Impeccable 在汇总前,将具备浏览器感知能力的设计总监评审与确定性的 Lint 证据保持独立,因此既不会把存在机械问题的精美页面误判为合格,也不会把没有警告的空白页面误判为合格。 用分歧生成和任务路由替代通用默认方案 舍弃可预测的选项、从精选输入中为生成过程提供种子、由新的智能体对候选结果排序,以及加载针对任务的规则集,能让同一系统避开审美趋同和巨型条件提示词这两类问题。 可执行反馈让指令遵循与具体情境绑定 具备仓库感知能力的脚本可以在关键时刻报告缺失的上下文和下一步行动,而 Hooks 则将设计规则变为被动反馈回路:编辑后发出警告,或在高风险写入前直接阻断。 跨 Harness 的 Skill 需要可度量的定制构建 Codex、Claude Code、Cursor 和 Gemini 在权限、后台完成行为、提问工具、Hook 生命周期和模型习性上各不相同,因此 Bakaus 倡导针对各 Harness 分别编译和评估,而不是假定一次安装便可通用。 💬 Key Quotes 模型的中位数是一种引力。 第一原则很简单:两个盲目的意见可以胜过一个自信的猜测。 核心结论是,被动护栏优于一条没人记得执行的命令。 更广泛的规则是:只要一道关卡可以被跳过,模型就可能跳过它。 📊 Article Meta AI Screening: 91 Featured: Yes Source: AI Engineer Author: AI Engineer Category: 人工智能 Language: 英文 Read Time: 23 min Word Count: 5625 Tags: AI 与智能应用 , Harness工程 , 设计系统 , AI Agent , 自主编码 Play Full Video

#AI 与智能应用# Harness工程# 设计系统# AI Agent# 自主编码

文章评论(0

暂无评论,快来抢沙发~