LLM 成功通关 NetHack

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 892026-09-221144 阅读💛 297 收藏
LLM 成功通关 NetHack

📌 One-Sentence Summary 一个 LLM 智能体(GPT-6 Astra)通过自主构建软件框架和工具,弥补了游戏知识与可靠执行之间的差距,实现了 NetHack 3.6.7 版本中首次有记录的通关(Ascension)。 📝 Summary 作者记录了一个里程碑事件:LLM 智能体 GPT-6 Astra 成功通关了以极高难度著称的 Roguelike 游戏 NetHack。与以往依赖人工设计接口的尝试不同,该智能体自主设计了自己的框架,包括用于检查批处理移动的受保护执行循环、用于路径规划和物品管理的专用助手,以及用于长期状态跟踪的基于文件的记忆系统。该智能体能够访问游戏的 Wiki 和源代码,并利用它们实时研究规则。该项目证明,编码智能体迭代改进自身工具的能力,是解决需要高精度且在数万个回合中保持可靠执行的复杂长程任务的关键因素。 💡 Main Points 知识与执行之间的差距是 NetHack 等复杂游戏的主要障碍。 虽然 LLM 可以完美地解释游戏规则,但由于观察结果过时或导航错误,它们在执行时经常失败;获胜的智能体通过构建可靠的软件工具而非依赖原始提示词克服了这一问题。 自主框架工程比人工设计的静态接口更有效。 该智能体构建了自己的 Python 封装,在状态解析器于新关卡失效时自行更新,并为 Sokoban 谜题和物品管理创建了特定助手,将软件工程视为任务的一部分。 「检查批处理」的混合方法优化了效率与安全性。 为了避免每一步调用 LLM 带来的成本并防止盲目死亡,该框架使用了一种由伪代码驱动的循环,在每次移动步骤前后验证终端状态谓词(如 HP、周围生物)。 外部基于文件的记忆对于长程任务至关重要。 通过在磁盘上维护 Markdown 和 JSON 日志而非依赖单一的对话上下文,智能体可以在跨越数日的游戏中恢复进度,并保持对已识别物品和目标的准确记录。 💬 Key Quotes 「获胜的智能体在无需人工干预的情况下构建了自己的框架。」 「脚手架确实有帮助,但构建这些脚手架本身就是 LLM 可以完成的工作。」 「如果同一个小操作一直出错,就写一段代码来可靠地执行它。」 「在数万个游戏回合中,将规则转化为正确状态下的正确行动,正是之前系统一直失败的地方。」 📊 Article Meta AI Screening: 89 Source: Hacker News - Newest: "LLM" Author: Kenny Category: 人工智能 Language: 英文 Read Time: 10 min Word Count: 2479 Tags: AI 与智能应用 , AI Agent , AI 工程 , 自主编码 , 开发者工具 Read Full Article

#AI 与智能应用# AI Agent# AI 工程# 自主编码# 开发者工具

文章评论(0

暂无评论,快来抢沙发~