Nex-N2.5-Pro 免费版实测:157 题仅 51.6 分,免费但不等于能用
一句话结论
Nex-AGI 发布当天就把 Nex-N2.5-Pro 免费版挂上 OpenRouter(nex-agi/nex-n2.5-pro:free),157 题严格基准实测 81/157(51.6%):数学 1/30、12 次 429 限流、花费 0 美元——免费额度适合尝鲜和技术验证,但数学密集或稳定生产任务别指望它。
背景:发布当天的免费 slug
Nex-AGI 于 2026 年 9 月 8 日发布 Nex-N2.5,OpenRouter 同日上线免费 Pro slug:nex-agi/nex-n2.5-pro:free,26.2 万上下文,0 美元,文本+图像输入、文本输出,Nex AGI 端点 FP8。
Hugging Face 有模型卡和图表,但还没有权重。
本文是 smf-bench Official A:157 题,strict_v01,思考关闭。排名保持思考关闭口径,记录实际发送的模拟设置。
测试问题
一款智能体编码模型发布当天就以免费 slug 上 OpenRouter,它是落在 Grok 和 Fable 那个档次,还是单发思考关闭下展现的是与 Terminal-Bench 完全不同的另一台机器?
模型栈信息
模型 nex-agi/nex-n2.5-pro:free,提供商 OpenRouter 到 Nex AGI(nex-agi/fp8)。上下文 262,144(来自 /v1/models)。定价 0/0。发布 2026-09-08。分词器 Qwen3(OpenRouter 架构字段)。
许可证 Apache-2.0(HF cardData)。权重发布时未公开(仅 README+图表)。测试框架 smf-bench Official A strict_v01,157 题。
思考「关闭模拟」——厂商原生非思考模式。传输 SSE(stream=true),非流式会挂在空白保活上。
超时 420 秒。标签 cal-nex-n25-pro-or-strict-v01。日期 2026-09-08 跑、2026-09-09 成文。
厂商思考模式(Nex-N2.5 README):none 为非思考,medium 为自适应(默认),high 为始终思考。我们没有把 nex 加进 reasoning_indicators——那会让每题膨胀到 4096 token。
冒烟测试
第一次调用(effort=none,流式):240 秒的 OPENROUTER PROCESSING,0 token,分配了生成 ID。第二次同参数调用:内容 NEX_OK,推理 token 0,finish_reason stop,19+4 token,0 美元,ID gen-1788922973-ScqupbSASQLN2qpkGJna,响应模型与请求 slug 一致。
非流式 POST:HTTP 200 带空白保活,无 JSON,90 秒超时。
接入时端点快照:状态 -5,5 分钟在线率 55.3%,p50 延迟 13.0 秒,p90 163 秒,p99 281 秒,p50 约 16 tok/s,30 分钟内 5,080 次文本请求。
Official A 成绩:思考关闭
墙钟 4715.3 秒(78.6 分钟)。12 个错误,全部是 HTTP 429(免费 slug 被限流)。平均延迟 27.3 秒,中位数 4.5 秒。成本 0 美元。
分类对比(Nex free vs Fable 5.1 vs Grok 4.6 vs DSV4 本地):编码 16/30(53.3%)对 26/30、30/30、22/30;指令 25/30(83.3%)对 27/30、30/30、26/30;数学 1/30(3.3%)对 26/30、28/30、13/30;散文 26/30(86.7%)对 27/30、28/30、27/30;推理 9/30(30.0%)对 30/30、30/30、24/30;工具调用 0/2 对 2/2、2/2、2/2;写作 4/5(80.0%)对 4/5、5/5、3/5。总计 81/157(51.6%)。
剔除 12 个限流错误后,剩余题目通过率 81/145(55.9%)——仍是榜上垫底。
排名榜(Official A,思考关闭)
Grok 4.6 153/157(97.5%)150 分钟;Grok 4.5 152/157(96.8%)112 分钟;Gemini 3.8 Flash 与 Muse Spark 1.3 并列 145/157(92.4%);Fable 5.1 142/157(90.4%);Kimi K3 140/157(89.2%);Qwen3.8-Flash-Next 137/157(87.3%);GLM-5.2 121/157(77.1%);DSV4 Vision-Exp 117/157(74.5%);垫底的 Nex-N2.5-Pro free 81/157(51.6%),78.6 分钟。
按难度拆分
简单档(10 题)8/10,80%。中档(15 题)7/15,46.7%。难档(25 题)12/25,48.0%。专家档(40 题)22/40,55.0%。前沿档(60 题)28/60,46.7%。
其他(7 题)4/7,57.1%。简单档守住了,其余都在一半附近。
哪里崩了
数学 1/30——思考关闭下的崩塌。27 个正则未命中、2 次 429。唯一通过的是 v3.math.easy.01。这是其他模型强制关闭 CoT 时的同款模式,不是 Terminal-Bench 的成绩。
推理 9/30——16 个正则未命中、5 次 429,单发无工具。
编码 16/30——0 个 SyntaxError。14 个未通过里 5 个是 429。两道题约 300 秒无代码可提取(medium.02、expert.04)。
其余是断言/NameError/TypeError 失败。剔除 429,编码 16/25(64.0%)。
指令 25/30——五个结构失误,包括 Fable 也答错的 obsidian-caravel 与 a9gre9dni9ckk13 同族 token 题,外加一个 300 秒空返回(frontier.07)。
散文 26/30——四个计数/正则失误。写作 4/5——writing_format 漏掉 JSON 关键词。工具 0/2——get_weather 用错了地点,calculator 没发出工具调用。
失败构成:12 次 HTTP 429、0 SyntaxError、2 次空代码、2 次工具失误,其余为正则/断言/计数。
这不是什么
它不是 Terminal-Bench、SWE-Bench 或 OSWorld 成绩。Nex-AGI 在模型卡上公布的是 Pro 版 Terminal-Bench 2.1 得 82.7、SWE-Bench Pro 61.2、OSWorld-Verified 82.2——那些是智能体循环,Official A 是单发思考关闭。
它不是本地 Spark 数字,无权重可加载;厂商服务 Pro 用 SGLang、—tp 8、8 张 H100。
它不是思考开启成绩,数学 1/30 就是关闭路径。
它也不是「免费端点可用于生产」的背书——状态 -5、429 限流、首测 240 秒排队,是实测的服务状况,不是感觉。
成本与延迟
Nex free:墙钟 78.6 分钟,平均/中位延迟 27.3/4.5 秒,12 个 429 错误,花费 0 美元。
Fable 5.1:35.0 分钟,13.4/12.3 秒,0 错误,6.85 美元(前次运行)。Grok 4.6:150 分钟,56.5 秒平均,0 错误。
免费就是免费。但发布当天的免费端点也确实在排队和限流。
如何复现
原始 JSON、运行日志、冒烟测试与目录快照存于 NemoKnowledgebase / nex-n2.5-pro,标签 cal-nex-n25-pro-or-strict-v01。
进入 smf-bench 目录,导出 SMF_SERVE_RECIPE_ID=OpenRouter-cloud,运行 run_stage1.py,参数 —endpoint https://openrouter.ai/api/v1 —model nex-agi/nex-n2.5-pro:free —tag cal-nex-n25-pro-or-strict-v01 —core-profile strict_v01 —thinking off —timeout 420,加上 API key。
当 —thinking off 且模型 ID 含 nex 时,运行器发送 reasoning effort none 并强制 stream=true。这个 slug 的非流式请求完不成。框架在 GitHub 开源(smfworks/smf-bench,MIT)。
验证说明
总成绩来自 results/stage1_cal-nex-n25-pro-or-strict-v01_20260909_030620.json(summary 81/157,pass_rate 51.6,error 12,墙钟 4715.3 秒)。模型 ID、26.2 万上下文、0 定价、Qwen3 分词器、文本+图像来自 2026-09-08 OpenRouter /v1/models。
端点健康与延迟分位来自同日 endpoints 接口。
Hugging Face nex-agi/Nex-N2.5-Pro:Apache-2.0,创建于 2026-09-08T11:01:41Z,仅 README 与图表文件,无 safetensors,接入时下载量 0。
厂商采样与 reasoning_effort 表来自 Nex-N2.5 README。模型卡基准数字是 Nex-AGI 的表,不是我们的测量。
云端对比项来自此前 Official A 系列(Grok 4.6、Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3、Kimi K3、GLM-5.2);本地项:Qwen3.8-Flash-Next 137/157、DSV4 Vision-Exp 117/157。冒烟测试 NEX_OK、推理 token 0、ID gen-1788922973-ScqupbSASQLN2qpkGJna。
原文信息
- 作者:Michael Gannotti(@MichaelGannotti),技术评测作者
- 原文标题:Official A: Nex-N2.5-Pro Free Scores 51.6% on OpenRouter 原文地址:
- 发布日期:2026-09-09
暂无评论,快来抢沙发~