我将 4 款模型的推理档位调至「高」:只解决了一个问题,却为所有消耗买了单

邱宇AI 前沿📡 BestBlogs·AI高分精选⭐ 902026-10-11489 阅读💛 48 收藏
我将 4 款模型的推理档位调至「高」:只解决了一个问题,却为所有消耗买了单

📌 One-Sentence Summary

一项针对 4 款 LLM 的实证基准测试表明,将推理力度调至「高」除了在复杂逻辑谜题上有所斩获外,极少能提升任务准确率,却会显著增加 Token 消耗和推理成本。

📝 Summary

本研究推出了 Reasoning Dial,这是一个在 Kaggle 上预注册的基准测试,旨在评估在 4 款模型(gpt-5.4-mini、gemini-3.7-flash、claude-haiku-5.5 和 gpt-oss-120b)上调整 `reasoning_effort` API 参数的实际影响。在 1,800 次评分调用中,该实验保持提示词、测试集和确定性正则表达式评估一致,评测了演绎推理谜题、算术对照组以及充满干扰项的计数任务。研究结果发现,将推理力度调至「高」仅带来了一项具有统计学显著性的准确率提升(gpt-5.4-mini 在演绎推理任务中从 15% 跃升至 97.5%),而在 12 组模型与任务组合中,有 7 组准确率基本持平,但每个正确答案的成本却飙升了 1.5 到 3.4 倍。此外,不同供应商对该参数的实现存在严重不一致,表现从直接报 HTTP 400 错误到基线状态下默认隐藏思考不等。

💡 Main Points

不同模型供应商对推理力度参数的实现存在根本性不一致

该调节档位并没有统一的标准,各家供应商的理解大相径庭:部分供应商大幅增加了 Token 数量,某个模型在设置为「none」时会直接抛出 HTTP 400 错误,还有些模型即使设为「none」也会进行内部思考。

高推理力度在非演绎类任务上准确率提升微乎其微,却大幅推高了成本

在评估的 12 组模型与任务组合中,将推理力度设为「高」仅获得了一次经统计学验证的准确率提升,而有 7 组组合的准确率完全没有变化,每个正确答案的成本却增加了 1.5 到 3.4 倍。

严格且确定性的评估流程避免了 LLM 裁判的偏见与数据泄露

该基准测试依赖代码生成的测试项并通过 SHA-256 哈希锁定,采用预注册假设与配对 Wilcoxon 统计检验,并使用基于正则表达式的答案提取,而非依赖主观的 LLM 评判。

💬 Key Quotes

在针对 4 款模型的 1,800 次评分调用中,「高」档位只带来了一次具有统计学意义的真实准确率提升:gpt-5.4-mini 在逻辑谜题上从 15% 提升至 97.5%。

在 12 个「模型 × 任务」测试单元中,有 7 个准确率毫无变化,而每个正确答案的成本却上升了 1.5 到 3.4 倍。

推理调节档位有时至关重要,但大多数时候,它只会让你的账单变得更庞大。

纯文本加上自己编写的解析器,是唯一在全部四家供应商之间表现完全一致的方案。

📊 Article Meta

AI Screening: 90

Featured: Yes

Source: DEV Community: machinelearning

Author: Abeera Lodhi

Category: 人工智能

Language: 英文

Read Time: 15 min

Word Count: 3607

Tags:

AI 与智能应用 , AI 工程 , 大语言模型 (LLM) , LLM 推理优化 , 测试与质量

#AI 与智能应用# AI 工程# 大语言模型 (LLM)# LLM 推理优化# 测试与质量

文章评论(3)

星寻梦1 小时前

路过

回复
墨沐雨1 小时前

看标题就点进来了,内容果然没让人失望。

回复
北岛渔夫2 小时前

支持作者,持续关注中。

回复