KernelQuest 基准:AI 智能体离独立完成 GPU 内核优化还有多远
Turing Frontier Research Lab 发布了 KernelQuest,一个用于测试 AI 智能体能否完成 GPU 内核优化完整工作的基准。它不是又一套编程选择题,而是把真实工程里最硬核的那部分——为 GPU 写出更快内核——原样搬进了考场。
KernelQuest 是什么
KernelQuest 包含 100 个 Triton 任务,覆盖 21 个内核家族,任务来源包括前沿实验室、对冲基金与领先公司的真实工作负载。它的关键设计在于:每个任务都锚定一个已认证由人类 Triton 方案达成的加速比。也就是说,及格线不是人为拍脑袋定的,而是人类工程师真实做到过的成绩。
评估配套了严格的验证流程,并发布了可复现的排行榜。团队共执行了约 1200 次评估,其中 565 次在验证阶段被拒——其中约 170 次其实已经达到目标加速比,但没能通过正确性验证。「跑得快但算得错」的内核依然会被判不合格。

四个前沿智能体的成绩单
主榜单由前沿智能体与终端环境组合而成:
- Claude Opus 5 + Claude Code:通过率 67.0%
- GPT-5.6 Sol + Codex:通过率 26.0%
- Gemini 3.7 Flash + Terminus 2:通过率 20.7%
- Grok 4.5 + GrokBuild:通过率 15.3%
第一名与第二名之间横着一道 41 个百分点的鸿沟。在 GPU 内核这种容不得半点错误的领域,模型间的工程能力差距被放大得非常明显。
任务层面的分化
100 个任务的通过情况呈现明显的两极分化:
- 8 个任务:四个智能体全部解出
- 25 个任务:四个智能体全军覆没
- 67 个任务:部分解出
团队还发布了按内核家族分解的技能剖析,能看到各模型在不同类型计算上的强项与短板。
深入发现
配套技术报告给出了若干值得注意的观察:
- 通过逆向工程人类提交者的 PR,可以提取出可迁移的专家策略——这些策略注入智能体后能带来提升,说明人类经验仍是宝贵的监督信号
- 一个验证器智能体能以 92% 的分类准确率复现整个验证流程,验证工作本身也可以自动化
- 不同终端环境对同一模型的影响差异显著,工程脚手架不是配角
开源与可复现
KernelQuest 已完整开源:排行榜、验证流程、数据集与评估工具链全部公开,代码库支持一键复现所有实验,还包含一个用于测试验证器的小型圣杯测试集。对任何想认真测试智能体内核工程能力的团队来说,这是一套可以直接上手的开源基建。
GPU 内核优化曾被认为是 AI 最后无法攻克的工程堡垒之一。KernelQuest 的答案很直白:最强者已经拿到 67% 的通过率,但距离「交给他就不管」的那一天,还有相当长的路。
原文信息
作者:turingcom(@turingcom) 原文地址:
暂无评论,快来抢沙发~