方法论与洞察

推理档位单因归因陷阱:GPT-6 Astra 档位与额度六因子官方查证 · v1

入档:2026-09-09 触发:跳蛛先生转来一篇热传的 GPT-6 Astra「推理等级怎么选」科普文(作者是 Pro 20x 用户,两个号额度烧光),直觉「他在错误归因」,要求从技术层评估并查证 验证状态:⚠️ 首次(OpenAI 官方文档 + Tibo 原推 + Artificial Analysis 分档数据交叉核对;Ultra 实耗只有一例 GitHub issue,未自测) 性质:AI 编码工具的成本机制档案 + 归因纠偏案例(含我自己被官方数据纠正的三处) 对外版:08_对外分发/GPT-6_Astra推理档位怎么选_额度为什么没了_同好版.md(飞书云文档见文末)


一句话律

推理档位是额度六因子之一,不是唯一因子。 把「额度没了」单归到档位,会漏掉 Fast 2.5 倍和上下文体积这两个同量级项,并在 xhigh 与 max 的取舍上给出与实测数据相反的建议。


事实冻结(官方口径,2026-09-09 核)

推理档位(reasoning effort)

Codex / ChatGPT 界面命名

界面档位API 值官方说明
Light(CLI 里叫 Low)lowFast responses with lighter reasoning
Medium(默认)mediumBalances speed and reasoning depth for everyday tasks
HighhighGreater reasoning depth for complex problems
Extra HighxhighExtra high reasoning depth for complex problems
Maxmaxmore time to reason about a single task
Ultra非档位,是模式Maximum reasoning with automatic task delegation

Ultra

额度怎么扣(learn.chatgpt.com/docs/pricing)

模型输入缓存输入输出(含推理)
GPT-6 Astra250251250
GPT-5.6 Sol10010500
GPT-5.6 Terra505300
GPT-5.6 Luna50.530

(单位:积分 / 百万 token)

Tibo 原推(2026-09-07)

To calibrate you all on which reasoning effort to use for Astra, know that GPT-6 Astra on low performs better than GPT-5.6 Sol on high. If you were using high reasoning efforts with Sol and were happy, I suggest you move down to low or medium for Astra.

Artificial Analysis 分档数据(GPT-6 Astra 发布页)

档位智能指数每任务成本
low46$0.82
medium50$1.54
high51$1.72
xhigh53$2.31
max53$3.26

另一版本指数(paddo.dev 转引):low 49 / medium 52 / high 53 / xhigh 54 / max 55,跑完指数的输出 token 分别为 5.4M / 12M / 19M / 30M / 49M。两版排序一致:xhigh 到 max 分数持平或 +1,成本多四到六成,token 多六成。


文章裁决表

文章说法裁决依据
档位=同一模型不同思考预算,不是模型档位✅ 对官方原话 same model with different reasoning token budgets
Ultra=「成立专项工作组」✅ 对官方定义 maximum reasoning + automatic task delegation
Plus 用户聊天走 ChatGPT 不走 Codex,额度分开✅ 对5h 限额范围=Work + Codex,普通聊天单独计
Pro 是 Plus 的 5 倍 / 20 倍✅ 对官方定价页
引 Tibo「Astra low 优于 Sol high」✅ 对原推核实
「最高出计划、降到高执行」✅ 流程可行configuration_update 单代理模式下可中途改档,上下文延续
额度烧快=推理档位太高单因归因官方六因子;作者自己的样本(测试 + 演示 + 全栈重构 + Fast)被工作量与倍率混淆
Fast 只是「拉满」的姿势漏掉倍率项Fast 2.5 倍;基准任务上 medium→high 成本差仅约一成,Fast 一个开关顶三档
「极高没意义,直接最高」与数据相反xhigh 53 vs max 53,成本 $2.31 vs $3.26;官方把 xhigh 定位给长 rollout agent 任务;「max 一轮解决更省」的前提(max 一轮成功率明显高于 xhigh)无数据支持
Pro 用户「高」常驻🟡 与官方建议相反Tibo 建议降到 low/medium;Codex 提示指南推荐 medium;作者自认心理因素
Ultra「不是更聪明只是更贵」🟡 半对Ultra 内含 max,至少和 max 一样聪明;Sol Ultra 在 Terminal-Bench 2.1 上 +3.1 个百分点(88.8→91.9);该不该用取决于任务可不可拆,作者的顺序写密集 Vibe Coding 确实不适合,但理由错了
Ultra 只在额度快重置时清仓用🟡 浪费用法官方适用场景是可拆分的读密集任务;清仓=max × 子代理数 × Fast 2.5,是最贵组合
大号被风控是 OpenAI「莫名其妙」❓ 未核实两个 Pro 号同机高强度自动化是常见触发条件,但无证据

伪机制解释识别_四层拆解法_v1 的四层看:现象✅(额度确实烧得快)/ 机制✅(同模型不同预算是官方口径)/ 根因❌(六因子讲成单因子)/ 药方🟡(档位匹配任务对,xhigh→max 反向)。这是四层框架第三次复用,形态与前两次不同:前两次是「机制编数字」,这次机制层是对的,错在根因层的遗漏而非捏造。


我自己被纠正的三处(诚实记录)

上一轮凭经验给出的评估,有三处被官方文档推翻,一并留档,防止下次再犯:

  1. 「推理档位只是二阶变量,上下文重发才是主因」→ 撤回。 推理 token 按输出计费,Astra 输出费率是未缓存输入的 5 倍、缓存输入的 50 倍;max 的输出 token 约为 medium 的 4 倍。推理档位是一阶变量。正确表述:推理与上下文同为一阶,短会话推理主导,长会话上下文主导。
  2. 「档位是训练出来的策略,不是同一段计算跑久一点」→ 撤回。 官方口径就是 same model, different reasoning token budgets。文章的比喻是对的,我加的修饰是多余的。
  3. 「Ultra 可能是并行采样,若是则更聪明」→ 撤回。 官方定义是任务派发编排。文章的「工作组」比喻准确。

教训:对成本机制的判断,先查费率表再下结论。凭「agent 循环每回合重发上下文」这个正确的机制,推出「上下文主导」这个错误的量级,是因为没查输出与输入的费率比。机制对不等于量级对。


可复用:额度体检四问

额度掉得快,按顺序问:

  1. 开 Fast 了吗? 2.5 倍,先关。
  2. 会话多长、上下文多大? 每回合重发全部上下文,缓存也按 1/10 计;大日志、大 JSON 整段吐进对话是常见肥源。一个任务一个会话。
  3. 档位高于任务需要吗? 官方默认 medium;Astra low 已优于 Sol high。日常 medium,困难调试 high,长 rollout 的 agent 任务 xhigh,max 极少。
  4. Ultra 用在可拆分的读密集任务上了吗? 探索、测试、分诊、总结可拆;顺序写代码不可拆,开了就是纯多付。

前两问是文章漏掉的,后两问文章讲了但第三问的档位排序要修正(xhigh 不是鸡肋,max 才是)。


举一反三:单因归因的识别信号


未核实 / 边界


资料来源


关联文档


版本

升级触发:

类型/协作工具链主题/模型选型主题/查证与核查工具/Codex