Codex 模型到底怎么选?Astra、Sol、Terra、Luna 一篇理顺
刚开始用 Codex 时,很多人会顺着模型列表往上选:既然 Astra 排在前面,那就选 Astra,再把推理强度拉到最高。看起来很稳,实际经常是多花时间和额度。
学长刚蝈判断模型时,更看重两件事:任务有没有说清楚,以及做错以后要返工多少。整理一批固定格式的数据,与接手一个陌生项目并完成上线,显然不该使用同一档模型。
模型决定能力范围,推理强度决定这一次投入多少计算。先把这两个设置分开看,模型列表就没那么吓人了。

上图是用户提供的第三方测试汇总,不是 OpenAI 官方榜单。测试任务、提示词和统计口径都没有完整公开,适合用来观察大致趋势,不能当成所有账户都通用的额度表。
先分清两个设置
选择器里的 Astra 中、Sol 高、Luna 极高,看着像一长串模型,其实只是模型与推理强度的不同组合。
Light 或 Low 适合边界清楚的小任务。Medium 是日常档。任务涉及多个文件、资料或取舍时,再考虑 High 和 Extra High。Max 会让单个模型花更多时间推理;Ultra 会调用子智能体分工,适合能够拆成几块的大任务。
OpenAI 的建议是从账户提供的默认档开始,需要更多规划或检查时再往上调。一个已经写清验收标准的小任务,多想几分钟未必会明显变好。
四个模型分别适合什么工作
Luna:规则写得清楚,就让它快点做
Luna 适合提取、分类、格式转换、结构化摘要和批量修改。判断方法很简单:如果你能把完成标准写成一张清单,而且大部分情况不需要临场决定,Luna 通常够用。
它怕的是“你看着优化一下”。任务里有很多隐含要求,或者需要一边做一边判断时,前面省下来的用量很可能又花在返工上。
Terra:大多数日常任务从这里开始
Terra 的定位比较朴素:能力、速度和成本都照顾到。改一段已有业务逻辑、补测试、整理资料,或者在结构清楚的项目里做常规功能,可以先用 Terra Medium。
学长刚蝈更愿意把 Terra 当成日常起点。它做不动,再换 Sol;任务特别机械,再降到 Luna。这样不用每次打开 Codex 都先研究半天模型。
Sol:事情不够明确,需要它自己判断
Sol 适合复杂功能、疑难 Debug、研究和代码审查。你知道大概要什么,但实现过程里还有不少岔路,需要模型自己找上下文、比较方案并检查细节,这时 Sol 比 Terra 更稳。
Sol Medium 可以处理多数复杂工作。跨文件联调或需要交叉核对资料时,再升到 High。Extra High 留给卡了很久的问题或交付前审查。
Astra:整条工作链都要交出去
Astra 适合跨度更大的端到端工作。比如接手陌生项目,先查架构和历史改动,再修跨模块问题、跑测试、检查风险,最后完成交付。任务会连续使用代码、浏览器和多份资料,途中还可能需要调整方向。
Astra 的价值在于少走弯路。改一句文案、换个按钮颜色,用它没有什么必要。长任务或失败代价高的工作,可以从 Astra Medium 开始;Max 和 Ultra 只在确实遇到难题时开启。
这张图该怎么看
图里最抢眼的是 Astra Ultra:能力分 62,消耗约 320。往下看会发现,Astra Medium 的能力分是 59,消耗约 110。两档只差 3 分,表中的消耗却接近三倍。
类似的情况也出现在 Sol。Sol Medium 是 56 分、消耗约 45,Extra High 是 59 分、消耗约 130。Luna High 的能力分是 47,消耗只有约 5。单看分数,它们排得不高;放到规则清楚的任务里,反而可能更划算。
这些数字不能用来预测你自己的周额度。第三方测试覆盖不了每个人的项目,模型也会更新。它能说明的只有一件事:推理档位升高以后,消耗增加得很快,效果却未必按同样幅度增长。
图中的“消耗/周”也不能直接换算成 API 费用。ChatGPT/Codex 套餐用量和 API 的 token 计费是两套口径。
不想研究时,直接照这张表选
| 任务类型 | 建议起步 | 什么时候升级 |
|---|---|---|
| 提取、分类、格式转换、批量重复操作 | Luna Medium / High | 规则存在例外,需要更多判断时换 Terra |
| 常规改代码、补测试、整理资料、明确功能开发 | Terra Medium | 跨文件复杂度上升或频繁返工时换 Sol |
| 疑难 Debug、复杂功能、深度研究、关键审查 | Sol Medium / High | 任务跨多个工具和阶段,且需要持续统筹时换 Astra |
| 架构改造、长链路 Agent、高风险端到端交付 | Astra Medium / High | 任务特别难时开 Max;能拆成独立部分时再用 Ultra |
不必追求一次选对。先跑一轮,看结果能不能过验收。模型开始漏约束、反复走错方向,再升档也来得及。任务本身没说清楚时,直接开最高档通常也只是让它猜得更久。
记不住就看这一句
任务清楚用 Luna,日常先开 Terra,需要判断换 Sol,整条链路再上 Astra;推理档位从默认开始,不够再加。
学长刚蝈的选择标准很实际:能按要求把事情做完,而且不用来回返工,这一档就够了。下一次遇到相似任务,直接沿用;等它真的不够用,再往上调。
再补四个值得记住的档位

图里圈出的四档都有推荐价值,但适合的任务不一样。表中的能力分、消耗和性价比仍来自第三方样本,只能拿来比较图内趋势。OpenAI 的官方原则更稳妥:先用能够完成任务的最低推理强度,碰到需要更多规划、分析或检查的工作再往上加。
Astra 中:长任务优先从这里起步
图中 Astra 中是 59 分、消耗约 110;Astra 高是 60 分、约 170,极高是 61 分、约 230,Ultra 是 62 分、约 320。为了最后一两分继续往上堆,代价涨得很快。
陌生项目接手、跨多个工具的完整交付、资料多且返工代价高的任务,我会先选 Astra 中。它保留了 Astra 擅长端到端统筹的优势,投入又没有冲到高档。只有它已经出现漏约束、验证不充分或方案反复时,才值得升到高或极高。
Astra 轻度:要求清楚的大工程
Astra 轻度是 57 分、消耗约 60,适合“怎么做已经定了,但事情本身不小”的任务。比如按现成方案跨文件修改、执行一套明确的上线清单,或者在验收标准齐全的前提下完成工程交付。
它不是每个日常任务的默认答案。对照同一张图,Sol 中是 56 分、消耗约 45,少花一些消耗只差 1 分。选择 Astra 轻度的理由,应当是任务虽清楚,却仍需要更长链路的工具调用和全程控场;如果只是普通功能开发,Sol 中或 Terra 中通常更省。
Sol 中:需要判断的日常甜点位
Sol 中在图里是 56 分、消耗约 45。Sol 高只多 1 分,消耗却来到约 80;Sol 极高达到 59 分时,消耗约 130。对大部分需要分析和判断、又没有长到必须交给 Astra 的任务,Sol 中很顺手。
复杂功能、跨文件 Debug、重要文章和有明确边界的研究,都可以从这一档开始。Terra 中仍是更经济的日常起点;当你已经知道 Terra 容易漏掉取舍,又觉得 Astra 太重,Sol 中就是最自然的升级档。
Luna 极高:规则明确时,把便宜用到极致
Luna 极高是 50 分、消耗约 10。它适合规则写得很细、数量不少、单条任务又需要多想一步的工作,例如带例外条件的批量处理、结构化提取、按明确规范改造代码和逐项检查。
“额度性价比之王”这句要稍微收着看。单按图中的比值,Luna 中和 Luna 高反而更高;Luna 极高真正有吸引力的地方,是在保持较低消耗的同时,把能力推到 50 分这一档。它依旧不会因为开到极高就变成 Sol 或 Astra。需求模糊、需要自己定方向的任务,用它省下来的额度很可能又花在返工上。
最后压缩成一张选择表:
| 档位 | 最适合的任务 | 为什么推荐 | 什么时候别选 |
|---|---|---|---|
| Astra 中 | 陌生项目、跨工具长任务、重要端到端交付 | 接近 Astra 高档能力,第三方样本中的消耗明显低一截 | 任务很小或步骤已经非常机械 |
| Astra 轻度 | 方案已定、验收清楚,但工程链路较长 | 保留 Astra 的全程统筹,投入比中档更轻 | 普通常规开发,Sol 中或 Terra 中已经够用 |
| Sol 中 | 复杂功能、Debug、研究和重要写作 | 判断力、成品质量和消耗比较均衡 | 任务横跨多个阶段且失败代价很高 |
| Luna 极高 | 规则清楚、批量重复、存在少量例外 | 低消耗下仍有一定推理余量 | 需求模糊,需要模型自己找方向 |
如果只想记新的补充口诀:长链路先上 Astra 中,方案定了用 Astra 轻,需要判断选 Sol 中,规则写死开 Luna 极高。
参考资料
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或赞助支持!
最后核对于 。AI 产品更新很快,如果页面、价格或规则已经变化,欢迎顺手告诉我。