DeepSeek 涨价、Codex 重置回归常态:10 档 GPT,一图帮你根据任务挑出性价比最优那个模型
8 月这一波,开发者手里的预算正在被两头挤压。
一头是 DeepSeek 涨价——走量文本的默认选项开始不便宜了。另一头是 Codex 的重置额度回归常态——之前那种「随便用」的好日子结束了。
两件事一撞,「怎么省着用」就从可选题变成了必修课。
巧的是,OpenAI 在 7 月 30 日悄悄调了 GPT-5.6 家族的价格。调完之后,一组反常识的数据浮出来了。
Luna XHigh,单题成本 3 美分,综合分 50。
Terra High,单题成本 22 美分,综合分 50。
一样的分数,便宜 7 倍。
我盯着这个数字看了很久。不是因为它「真厉害」。是因为我突然意识到,过去一年里,我在 Codex 上默认拉的「高端模型」,多半在做冤大头。
这篇文章把 GPT-5.6 家族在 Codex 上的 10 档模型(横跨 Luna / Terra / Sol 三条线)全部摊开。结论先放这——
没有一档模型在所有场景都最划算。你需要的不是「旗舰信仰」,是一张场景-档位对照表。

先把「分档」这件事说清楚
GPT-5.6 不是一款模型,是一组模型。这组模型被切成三条线、每条线三到四档:
Luna(轻量线):Medium / High / XHigh / Max。便宜、快、走量。
Terra(平衡线):Medium / High / Max。中间档,性价比历史上是它的标签。
Sol(旗舰线):Medium / High / Max。最贵、最慢、最准。
为什么要切这么多档?官方逻辑是「按任务难度付费」。你写一个分类标签,不需要旗舰;你做长程 Agent,需要旗舰。听起来挺合理对吧。
但这条规则在 7 月 30 日之后被破坏了。
因为降价后,Luna XHigh 跑到 50 分这条线。和 Terra High 同分。比 Terra High 便宜 7 倍。
这意味着什么?意味着「按任务难度付费」这套话术里,最该被退钱的是 Terra。Terra 这一档,开始变得「既不如 Luna 便宜,也不如 Sol 省话」。
三条线、单任务成本、速度、综合分,一张表看完

图:横轴是单题成本(对数刻度),纵轴是综合分;气泡越大表示速度越快,右侧给出对应场景的首选档位。图中的数字直接取自上表。
这张表有几件事值得停留一下。

第一,Luna XHigh 是这轮调价后最大的「价值发现」。这档模型综合分 50、单题 3 美分、166 tok/s 速度——三个数字单独看都还行,组合到一起就有点离谱。同样的 50 分,Terra High 要花 22 美分。
第二,Terra Max 是个陷阱档位。综合分 57,确实追平 Sol High。但它的输出量是 96M——也就是评测里它平均写 96M token 完成一道题,而 Sol High 只写 21M。单题成本几乎打平($0.51 vs $0.55),但 Terra Max 在「啰嗦」这件事上更夸张。如果你的真实任务里 Terra Max 也开始绕,总账单可能比 Sol Medium / High 更贵。
第三,Sol Medium 是个被低估的「准旗舰」档模型。56 分,距离 57 分只差 1 分。单题 37 美分,比 Terra Max 便宜 28%。速度 60 tok/s,是慢了点,但 Codex 里这种速度对长程任务反而更舒服——不用滚屏等答案。
按场景怎么选
把「你大概率会做的事」拆成 8 个场景,每个场景给一个首选、一个「不要首选」。

有几个反常识点要单独说一下。
长文档和代码仓库,不要用 Luna
LayerLens 的 12 项评测里,Luna 在 256K 以上长上下文召回掉到 41%。Terra 和 Sol 还能维持在 90% 左右。
翻译成人话:你喂 50 万字的代码仓库让 Luna「读完再回答」,它大概率会编——不是它不努力,是它「看不见」后半段。
这种任务老老实实上 Terra High 以上,或者直接 Sol。
电脑操作和安全审计,不要用 Luna
OSWorld(电脑操作)榜单:Sol 62.6% / Terra 50.2% / Luna 45.6%。ExploitBench(漏洞审计):Sol 73.5% / Terra 52.9% / Luna 33.2%。
这是能力差距,不是「够不够便宜」的取舍。Luna 在这两个场景的失败率高到不可接受。
真正「贵」的场景用 Sol Max
只有两类场景你必须上 Sol Max:
一、跨多步骤、错一步要重来的长程 Agent;
二、你的产品出了问题,账单是按「返工次数」算的,而不是按「token 单价」算的。
其他时间,Sol Medium 是 90% 的「想用旗舰」场景的正确答案。
三个让账单失控的习惯
光看单价会骗人。「做完一件事的钱」比「每百万 token 的钱」重要得多。
习惯一:默认拉满旗舰
这是最常见的浪费模式。Codex 默认推荐使用什么你就使用什么,从来不思考「这个任务需要 50 分还是 57 分」。
如果你的任务是改一个函数、补一段测试、写一段文档——Luna XHigh 够用,单题 3 美分。用 Sol Max 做这件事,等于花 41 倍的钱买 11 分的提升。
习惯二:盯着单价看,不盯着总账看
Terra Max 单价低吗?低。但评测里它输出 96M token,Sol High 输出 21M。如果你的任务里 Terra Max 也开始「长篇大论」地解释,总账单会反超 Sol。
一个粗糙的经验:实际账单 = 综合分 × 输出 token 数 × 单价。三者要乘起来看,不能只看单价。
习惯三:套餐里和 API 里用同一个判断标准
OpenAI 的 ChatGPT / Codex 套餐里,Terra High / Max 更像「便宜一点的高质量默认档」。套餐的边际成本结构和 API 不同——套餐是固定月费、用多用少都那个钱,所以你应该往「质量上限」上推。
但在 API 里,大多数人应该先试 Luna XHigh 或 Luna Max。这是两套不同的判断逻辑,别混。
三个落地动作
如果你准备在 Codex 上做点什么,这三件事现在就能做。
第一,把默认档改成 Luna XHigh。50 分档里它是最便宜的。批量任务用 Luna High。绝大多数日常工作不需要 Sol。
第二,把「难活」的判断标准写下来。难活包括:长文档(>256K)、电脑操作、长程 Agent、一次做错要返工的任务、安全审计。这些场景升到 Sol Medium,过不去再 Sol High / Max。
第三,在套餐里和 API 里用不同策略。套餐默认推高(Terra High+),API 默认推低(Luna XHigh+)。别用同一套脑回路。
一个还没回答的问题
官方建议是混搭——Sol 处理不确定性和规划,Luna 执行已定义改动、写测试、验收。
但混搭的前提是你能在工作流里切模型。Codex 的 Chat 模式能不能按任务类型自动切档?这是我还没验证的事。如果你有答案,欢迎在评论区告诉我。
我自己倾向的做法是:Codex 默认 Luna XHigh;遇到明确「长程 / 高风险 / 复杂推理」的标志,手动替换为 Sol Medium。一个手动的、双档的工作流。
你主要在哪付钱,以及哪类任务占比最高?这个答案会决定你接下来的默认档是 Luna 还是 Terra。先确定你的问题是什么。
写到这里,我突然意识到一件事。
这一年的 Codex 账单,我多花的钱可能够买三个 Pro 套餐。
不是因为模型贵,是因为我没想过「是不是用错了」。
翻译成大白话:GPT-5.6 家族是一组瑞士军刀,每把刀切不同的东西。你不需要「最好的刀」,你需要的是「知道哪把刀切哪种东西」。
至于哪把刀切哪种——上面那张表已经替你列好了。剩下的事,是你的。
原文信息
作者:Watther(@WattterDjiang),AI 培训与 FDE 从业者 发布日期:2026-08-19 原文地址:
暂无评论,快来抢沙发~