Dependency Bench:图规模达到多大时,LLM 会在 CI 流水线推理中迷失?

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 852026-10-111055 阅读💛 287 收藏
Dependency Bench:图规模达到多大时,LLM 会在 CI 流水线推理中迷失?

📌 One-Sentence Summary

Dependency Bench 评估了在大语言模型(LLM)处理故障传播、耗时估算、版本解析和增量重建等任务时,随着图规模扩大,模型在何种节点数量下会丧失对 CI 流水线和依赖图的推理能力。

📝 Summary

Dependency Bench 是一个用于测试 LLM 在依赖图上推理能力的评估套件。该基准无需 LLM 作为裁判,而是通过确定性参考模拟器进行精确评分。它涵盖五大任务类别(YAML 故障传播、纯文本故障传播、受限 Runner 耗时估算、版本解析以及增量重建)和四个规模层级(10 到 200 个任务/目标),共计 60 个合成测试任务,旨在探索模型推理能力的崩溃边界。对轻量级到旗舰级模型的评测表明,准确率的下降主要受图规模影响,而非规则复杂度。中端模型经常出现细微错误,例如将跳过的任务误判为失败;相比结构化的 YAML,纯文本描述会导致性能显著下降;此外,即使对于前沿旗舰模型,增量重建中的提前截断逻辑仍然是最大的挑战。

💡 Main Points

模型准确率主要随依赖图规模下降,而非规则复杂度

诸如 gpt-5.6-terra 这类中端模型在规则完全相同的小型图上能取得满分,但在超大图(200 个任务)上的得分急剧跌至 6/15,表明它们在超长推理链中逐渐失去追踪能力。

CI 推理中的细微分类错误具有极高的实操风险

错误的回答往往仍保有较高的部分分(约 98%),常见的错误是将因上游跳过的任务误标为失败,从而生成看似合理实则错误的故障复盘分析。

相比自然语言,结构化语法能显著辅助 LLM 进行推理

同一个包含 200 个任务的流水线,使用结构化 YAML 描述时的成功率为 3/3,而用纯英文文本描述时则降至 0/3,表明模型高度依赖显式的结构化格式。

带有提前截断逻辑的增量重建代表了最高难度的推理边界

即使是能力最强的旗舰模型,在处理中间输出未变从而阻止下游传播的增量重建时也表现挣扎,普遍存在过度传播的倾向。

💬 Key Quotes

准确率随图的规模扩大而下降,而不是因为规则本身变难。

模型理解规则,但会在过长的推理链中迷失方向。

在包含 200 个任务的流水线中,当以 YAML 格式呈现时 terra 得分为 3/3,而以英文描述完全相同的流水线时,得分却为 0/3。

增量重建是唯一一个难倒最强模型的任务大类。

📊 Article Meta

AI Screening: 85

Source: DEV Community: machinelearning

Author: Muhammad Owais Warsi

Category: 人工智能

Language: 英文

Read Time: 4 min

Word Count: 958

Tags:

AI 与智能应用 , 测试与质量 , AI Agent , 大语言模型 (LLM) , AI 评测与基准

#AI 与智能应用# 测试与质量# AI Agent# 大语言模型 (LLM)# AI 评测与基准

文章评论(4)

暮拾贝1 小时前

支持作者,持续关注中。

回复
墨沐雨2 小时前

写得挺用心的,支持一下。

回复
林观澜1 小时前

实话,说的不明不白

回复
雪知秋2 小时前

不错不错,已加入书签。

回复