Dependency Bench:图规模达到多大时,LLM 会在 CI 流水线推理中迷失?

📌 One-Sentence Summary
Dependency Bench 评估了在大语言模型(LLM)处理故障传播、耗时估算、版本解析和增量重建等任务时,随着图规模扩大,模型在何种节点数量下会丧失对 CI 流水线和依赖图的推理能力。
📝 Summary
Dependency Bench 是一个用于测试 LLM 在依赖图上推理能力的评估套件。该基准无需 LLM 作为裁判,而是通过确定性参考模拟器进行精确评分。它涵盖五大任务类别(YAML 故障传播、纯文本故障传播、受限 Runner 耗时估算、版本解析以及增量重建)和四个规模层级(10 到 200 个任务/目标),共计 60 个合成测试任务,旨在探索模型推理能力的崩溃边界。对轻量级到旗舰级模型的评测表明,准确率的下降主要受图规模影响,而非规则复杂度。中端模型经常出现细微错误,例如将跳过的任务误判为失败;相比结构化的 YAML,纯文本描述会导致性能显著下降;此外,即使对于前沿旗舰模型,增量重建中的提前截断逻辑仍然是最大的挑战。
💡 Main Points
模型准确率主要随依赖图规模下降,而非规则复杂度
诸如 gpt-5.6-terra 这类中端模型在规则完全相同的小型图上能取得满分,但在超大图(200 个任务)上的得分急剧跌至 6/15,表明它们在超长推理链中逐渐失去追踪能力。
CI 推理中的细微分类错误具有极高的实操风险
错误的回答往往仍保有较高的部分分(约 98%),常见的错误是将因上游跳过的任务误标为失败,从而生成看似合理实则错误的故障复盘分析。
相比自然语言,结构化语法能显著辅助 LLM 进行推理
同一个包含 200 个任务的流水线,使用结构化 YAML 描述时的成功率为 3/3,而用纯英文文本描述时则降至 0/3,表明模型高度依赖显式的结构化格式。
带有提前截断逻辑的增量重建代表了最高难度的推理边界
即使是能力最强的旗舰模型,在处理中间输出未变从而阻止下游传播的增量重建时也表现挣扎,普遍存在过度传播的倾向。
💬 Key Quotes
准确率随图的规模扩大而下降,而不是因为规则本身变难。
模型理解规则,但会在过长的推理链中迷失方向。
在包含 200 个任务的流水线中,当以 YAML 格式呈现时 terra 得分为 3/3,而以英文描述完全相同的流水线时,得分却为 0/3。
增量重建是唯一一个难倒最强模型的任务大类。
📊 Article Meta
AI Screening: 85
Source: DEV Community: machinelearning
Author: Muhammad Owais Warsi
Category: 人工智能
Language: 英文
Read Time: 4 min
Word Count: 958
Tags:
AI 与智能应用 , 测试与质量 , AI Agent , 大语言模型 (LLM) , AI 评测与基准
支持作者,持续关注中。
写得挺用心的,支持一下。
实话,说的不明不白
不错不错,已加入书签。