如果你感觉不到前沿模型的差距,说明你的提示词还太窄

📌 One-Sentence Summary Theo 认为前沿编程模型的价值在于抬高智能体的可靠性地板,从而支持更宽的提示词与更长的无人值守运行;若切回 Opus 或 Sonnet 感觉差不多,说明你的提示词仍然太窄。 📝 Summary Theo 反驳 David Cramer(Zeeg)等观点,即从 Fable 或 Astra 这类前沿编程模型降级到 Opus 或 Sonnet,对多数工作几乎无感。他把 Astra 高低起伏的表现,与更干净的 Fable 对 Opus 对比区分开,并主张前沿模型主要买到的是更高的地板:更少犯蠢,而不只是更高的峰值演示。窄的 Jira 工单式提示词落在两条地板之下,模型选择看起来可互换;从模糊截图做到带测试与证明视频的 PR,这类端到端宽任务才需要更高地板。他敦促开发者少盯着智能体逐步监工,拓宽提示范围,在长跑失败时修代码库,并把个人时间看得比 token 更贵。借助自己的智能体日志,他展示中位数与 P95 运行时长随地板提升显著拉长,并说明窗口失败率哪怕只降几个点,也会在无人干预可持续时长上复利成指数收益。 💡 Main Points 前沿模型主要买到的是更高的地板,而不只是更高的天花板。 Theo 认为,对智能体工作而言,少犯蠢比偶尔的峰值表现更重要;只盯天花板会误导 Fable 对 Opus 这类模型对比。 如果降级模型感觉差不多,说明你的提示词太窄。 短工单式提示词落在两条地板之下,Opus 看起来也够用;更宽的端到端任务会暴露低地板模型,因为跑得越久越容易撞上边缘失败。 拓宽提示词并修代码库,而不是每一步都监工。 他建议让智能体自己找文件、验证构建并附上证明视频,同时用长跑失败来加固系统,让无人值守从几分钟拉向数小时。 地板的小幅提升,会对可持续运行时长产生指数级影响。 他的日志显示中位数与 P95 智能体运行显著变长;窗口失败率哪怕只降几个点,也会在多小时会话中复利成高得多的成功率。 开发者时间通常比 token 账单更贵。 对负担得起前沿订阅的全职西方工程师来说,为更高地板模型付钱、让任务更早开跑更晚收工,往往比额外人工准备、审查与监工更划算。 💬 Key Quotes 抬高地板比抬高天花板更有益。 更宽的提示词需要更高的地板。 他喜欢 Fable 不是因为它聪明得多,而是因为它不那么蠢。 提示词微调一点,代码库大改一通。 他说地板提升带来的影响是指数级的。 📊 Article Meta AI Screening: 90 Featured: Yes Source: Theo - t3․gg Author: Theo - t3․gg Category: 人工智能 Language: 英文 Read Time: 14 min Word Count: 3467 Tags: AI 与智能应用 , 提示工程 , 自主编码 , AI 编程 , AI Agent Play Full Video
这个比较实用,已转发给同事。