Turing 发布 CEO Bench:让前沿 AI 智能体做真实公司工作的新基准

溪行者AI 前沿📡 觉醒AI2026-09-201276 阅读💛 144 收藏

今天,Turing 发布 CEO Bench——一项新评估,检验前沿 AI 智能体能否完成公司所依赖的复杂、长周期财务与运营工作。

大多数基准测试的是智能体能否完成一个定义清晰的任务并给出正确答案。真实的公司工作很少这么干净。它要求智能体整合不完整的信息、调和冲突的数据、行使合理判断、遵守治理约束,并产出经得起审视的决策。

这就是我们构建 CEO Bench 的原因——一套建立在完整的、专家撰写的虚构公司之上的评估套件。它是首个构建于 SVC(Simulated Virtual Company,模拟虚拟公司)之上的基准,SVC 是 Turing 用于把整家公司构造为评估环境的平台。

我们的第一家虚拟公司 Cirrus Sleep, Inc. 是一个模拟的直达消费者睡眠品牌,拥有完整的第一个财年。其语料库包含 1100+ 份文件,覆盖会计、财务、合同、HR 与薪酬、董事会材料、运营、市场、客户支持,以及一整年的内部 Slack。

CEO Bench 包含 500+ 道撰写的部门级与高管级任务,本版本发布并对六个前沿模型评分的是其中 40 道 L2 任务。另有 70+ 道高管级 L3 任务以目录条目形式发布,评分运行随后跟上。任务、黄金解与评分细则由财务和运营从业者创作。

图片

在这个环境里,智能体必须判断哪些冲突数字具有权威性、识别董事会批准了什么、跨部门调和证据,并决定什么应当披露。

CEO Bench 依据专家撰写的评分细则标准为这些工作打分,而非单一字符串匹配答案。

更广的任务库横跨部门级工作与高管综合,但本版本只对已发布的 40 道 L2 任务评分。每道任务独立可解、独立评分。智能体可能需要调查一个问题、跨多个系统收集证据、执行分析、沟通发现,并组装一份面向高管的成套材料。

早期结果显示出一个关键缺口。GPT-5.6 Terra 在六个受测模型中得分最高,在 40 道任务上也只平均拿下专家评分标准的 41%。而且短板不属于某一个模型:40 道任务中的 20 道,六个模型里最好的成绩仍不足 50%。

在 CEO Bench 网站上探索该基准与任务详情。

原文信息

作者:turingcom(@turingcom) 原文地址:

文章评论(0

暂无评论,快来抢沙发~