Courses
OpenAI 刚刚为 GPT‑6 家族新增两款模型:GPT‑6 Sol 和 GPT‑6 Luna,定位低于本月早些时候我们介绍过的旗舰 GPT‑6 Astra。Sol 和 Luna 的价格均大幅下调(较其 GPT‑5.6 价位降 50%),并在编码与工作流自动化方面有所提升。
巧合也好并非巧合也罢,Anthropic 今天(同一天)发布了 Claude Opus 5.5,定位也类似:与旗舰采用相同的训练路线,但在成本与速度上做了优化。
想进一步了解它们所隶属的旗舰模型,请查看我们的 GPT‑6 Astra API 教程 以及 GPT‑6 Astra 与 Claude Fable 5.1 对比。
要点速览
- GPT‑6 Sol 与 Luna 是低于 Astra 的两个档位,采用相同的训练配方,定价为其 GPT‑5.6 前代的一半。
- 最大看点是代理与编码任务的单位成本,而非绝对能力。OpenAI 报告中的几乎所有结果都做了成本校正。
- GPT‑6 Sol 的事实性错误约为 GPT‑5.6 Sol 的一半;Luna 也有提升,但在可靠性上仍落后于 Sol。
- 代理工作流与编码优先用 Sol,高吞吐的日常任务用 Luna。只有当任务能证明其价值时再选择 Astra。
- 如果您已经在用 GPT‑5.6 Sol 或 Luna,因价格请尽快切换;我们动手测试中,能力提升不大,主要体现在能如实指出输入有问题。
GPT‑6 Sol 与 Luna 是什么?
Astra 仍是 OpenAI 能力最强、对齐度最高的模型,面向最苛刻的工作。但 Sol 与 Luna 旨在将其中大部分训练方法,以及在编码、电脑操作等方面的大量性能,下放至更便宜、更快速的档位。
可以把它理解为 Opus 5.5 之于 Fable 5.1 的关系:不是全新前沿,而是“临近前沿”的性能、却只需一小部分成本。
GPT‑6 Sol 与 Luna 的关键特性
有几项值得关注:
整体显著更便宜
Sol 的 API 价格减半。Luna 的价格甚至还不到一半。详细请见下文定价部分。
在业务工作流上表现强劲
在 AutomationBench(覆盖销售、市场、运营、支持、财务等多领域的代理测试)中,Sol 在最高努力等级下优于 Claude Opus 5,且每任务成本仅为 Opus 5 的一小部分。Luna 也较其 GPT‑5.6 前代有实质提升,同时显著降低了每任务成本。OpenAI 提供了一张不错的图表,我在此重绘:

我注意到,该图未包含 Anthropic 在 Opus 5.5 公告中给出的 Opus 5.5 数据,因此我加上了一组新线条。可见最新版本的 Sol 与 Luna 仍然最为高效。OpenAI 之所以没在发布中加入这些信息,原因大概只是时间点——Opus 5.5 早一个小时发布。
编码收益更多体现在成本,而非仅仅准确率
在 FrontierCode 上,Sol 被描述为大致追平 Claude Fable 5.1 的最高分,但价格低得多。在另一项编码基准(DeepSWE)上,Sol 以大幅成本折扣接近 Fable 5 的最佳成绩,而 Luna 在中档努力下被定位为可与 Opus 5 与 Fable 5 相当。
更少的事实性错误
OpenAI 称,在基于真实对话、由用户标记错误构建的内部事实性检查中,Sol 的错误率约为其前代的一半。Luna 也有进步;OpenAI 声称在更高努力下,它能以极低成本匹配 GPT‑5.6 Sol 的事实性。这一点较难外部验证。
更少赘述的写作风格
Astra 更简洁、少行话的沟通风格被带到了 Sol 与 Luna。自从 4o 因过度迎合而受到大量批评后,OpenAI 一直在持续优化其模型的对话风格。
面向代理的更便宜、更聪明的缓存
除了按 token 计价外,OpenAI 强调了提示缓存的改进,旨在帮助代理与长对话更高效地复用上下文,缓存的输入读取约可打 9 折(即 90% 折扣)。新的仪表板与诊断工具可帮助开发者了解缓存何处有效、何处无效。
更少对自身工作的误导性陈述
与 GPT‑5.6 系列相比,这两款模型在编码任务上更不容易误述自己做了什么。
OpenAI 的对齐评估在最大发电努力下运行,故意设置引诱不诚实的场景,而 Sol 与 Luna 在编码欺瞒、搜索损坏、评审绕过、警告规避、未授权交互等测试上的欺瞒率均低于 GPT‑5.6 Sol 与 Luna。
OpenAI 强调这些是对抗性设置,而非常见使用场景的失败率,并在 GPT‑6 系统卡中公布了完整结果。
GPT‑6 Sol 与 Luna 的基准表现如何?
OpenAI 的发布材料大量采用成本校正后的对比。我先前提到过 Sol 在 AutomationBench 上的表现。OpenAI 不仅说它“优于 Opus 5”,还强调它更好,且每任务成本大约便宜 11 倍。
还需要提示的是,OpenAI 自身的数据也显示,在电脑操作任务上 Astra 仍领先于 Sol 与 Luna;同时,与 Claude 系列的一些对比使用了不同的努力等级(例如,Sol 用 “xhigh”,而 Opus 5 用 “medium”),这使得效率方面的结论非常有力,但绝对能力的对比就不那么容易精确锚定。
在此前提下,以下为 OpenAI 报告的结果,按各基准所代表的工作类型分组。
业务工作流与代理
Sol 最强的结果出现在 AutomationBench——Zapier 针对销售、市场、运营、支持、财务与人力等 47 款工具进行端到端代理测试。GPT‑6 Sol 在 xhigh 努力下得分 33.2%,每任务 $0.27,领先于 Claude Opus 5 的最大努力,甚至超过了低努力的 GPT‑6 Astra,同时每任务成本仅为 Opus 5 的一小部分。

需要仔细阅读的是 Fable 5.1 这行。OpenAI 将带有 Opus 5 回退的 Claude Fable 5.1 列在 Sol 之下,但该回退在约 40% 的任务中被触发,其成本并未计入报告数字。
| 模型(与努力等级) | AutomationBench 分数 | 每任务成本 |
|---|---|---|
| GPT‑6 Sol(xhigh) | 33.2% | $0.27 |
| GPT‑6 Astra(low) | 30.3% | 为 GPT‑6 Sol 的 3.9 倍 |
| Claude Fable 5.1(带 Opus 5 回退,max) | 31.4% | 超过 GPT‑6 Sol 的 8.9 倍(未计入回退成本) |
| Claude Opus 5(max) | 26.9% | 为 GPT‑6 Sol 的 11.1 倍 |
Luna 在同一基准上的故事更像代际跃迁。在高努力下,GPT‑6 Luna 较 GPT‑5.6 Luna 提升 5.4 个百分点,同时每任务成本下降 58%。
在 Agents' Last Exam(评测代理在 55 个细分行业中的长周期专业工作流)上,GPT‑6 Sol 在最大努力下得分 56.4%。OpenAI 称这高于 Claude Opus 5 在该评测中的最佳成绩,同时每任务成本低 60%。
真实代码库中的编码
在 DeepSWE v1.1(测试代理在真实代码仓中的长周期软工任务)上,GPT‑6 Sol 在最大努力下得分 68.8%。Claude Fable 5 在该评测的最佳成绩为 xhigh 努力下的 69.9%,因此 Sol 仅落后 1.1 分,但每任务成本大约低 80%。
GPT‑6 Luna 在最大努力下在同一基准得分 66.6%,OpenAI 称其可与中等努力下的 Claude Opus 5 与 Fable 5 相当。与 Opus 5 相比,Luna 每任务成本低 93%,与 Fable 5 相比低 96%。
独立数据目前不多。Artificial Analysis 给出 GPT‑6 Sol 在 Coding Agent Index 上为 57,对应 GPT‑5.6 Sol 的 55;在 Intelligence Index 上为 48,对应前代的 47;每任务预估成本由 $1.99 降至 $1.06。
事实可靠性
OpenAI 的内部事实性评测来自去标识化的 ChatGPT 对话,用户在其中对早期模型的事实性错误进行了标记。在该集合上,GPT‑6 Sol 的错误约为 GPT‑5.6 Sol 的一半;在更高努力下,GPT‑6 Luna 的事实性可与 GPT‑5.6 Sol 匹配,而成本仅其百分之一左右。
Artificial Analysis 的 AA-Omniscience 测试也指向同一趋势,但需注意:Sol 的幻觉率从 GPT‑5.6 Sol 的 92% 降至 60%,但其回答率仅为 83%,而前代为 99%,因此部分改进来自拒答。Luna 在同测中的幻觉率为 77%。
电脑操作
Astra 依然是 OpenAI 最强的电脑操作模型,文中亦明确指出。在 OSWorld 2.0 offline 上,GPT‑6 Sol 在 xhigh 努力下得分 60.5%,而 Claude Opus 5 在 medium 努力下为 60.3%,每任务成本约低 80%。GPT‑6 Luna 在最大努力下超过了 medium 努力下的 GPT‑5.6 Sol,而成本仅其十分之一。
该用哪个档位?
Sol 适合作为大多数开发者与代理工作的默认选择,Luna 面向大批量,Astra 则用于那些错一次代价高于 token 成本的项目。GPT‑6 家族现有三档,训练配方一致,深度、速度与价格有别。

三者在 API 中暴露同一套推理梯度:none、low、medium、high、xhigh 与 max(Sol 与 Luna 可用),Astra 则从 low 起步。更高梯度会为推理投入更多 token,OpenAI 的大多数“头条”结果都运行在 xhigh 或 max。
GPT‑6 还允许您在对话中途调整努力等级而不失效提示缓存,因此代理可以在低努力下进行廉价的后续步骤,仅在困难步骤上提升等级。
| 使用场景 | 档位 | 原因 |
|---|---|---|
| 跨业务应用的多步骤代理 | Sol | 以对手每任务成本的一小部分,领跑 AutomationBench 与 Agents' Last Exam |
| 产出可合并变更的编码代理 | Sol | 相较 GPT‑5.6 Sol,在 FrontierCode 上显著提升;在 DeepSWE 上接近 Fable 5,成本低得多 |
| 高事实要求的撰写与研究摘要 | Sol | 事实性错误约为前代的一半 |
| 大规模分类、抽取与路由 | Luna | 每 100 万 token:输入 $0.10、输出 $0.50;在更高努力下现可匹配 GPT‑5.6 Sol 的事实性 |
| Free 或 Go 计划下的桌面使用 | Luna | 这两类计划唯一可用的 GPT‑6 模型 |
| 长周期电脑操作与最难的端到端工作 | Astra | 仍为 OpenAI 的全能最佳,输入 $10、输出 $50(每 100 万 token) |
关于 Luna 的一个提醒:Artificial Analysis 测得其每任务输出 51,000 个 token,而 GPT‑5.6 Luna 为 41,000 个,因此在未限制输出的工作负载上,降价幅度会小于标称数字所暗示。
上手测试 GPT‑6 Sol 与 Luna:实操示例
上述基准均来自 OpenAI,因此我用完全相同的提示与工具,对四个模型各跑了一个构建任务。
任务:做一个单文件 HTML 可视化器,演示 Dijkstra 算法;每 400ms 动画检查一条边,直到目标节点“收敛”;节点状态清晰可辨,带暂停/单步/重置控件,并输出最终距离表。无需构建步骤、无依赖、无网络。
真正的考点在数据文件。它包含三张图:
- 一张正常图(仅正权重,目标可达)
- 一张目标不可达的图
- 一张包含负权重的图,使 Dijkstra 不适用(会陷入无限循环)
提示中从未点明这些陷阱。能否注意到它们才是关键,这也同时检验两项发布声明:相对 GPT‑5.6 的 FrontierCode 提升,以及关于编码工作误导性陈述的下降。
四个模型均在 OpenCode 中运行,固定工具面(仅读写文件),相同推理努力,一次尝试,独立会话,提示逐字节一致。
以下是 GPT‑6 Sol 在正常图上的产出示例:
主要结论:
- 在干净图上,四者不分伯仲。四个模型都交付了可运行文件,得到距离 24 的正确路径,按顺序收敛节点,并构建了单屏可读的控件。在还原度与布局上全部满分。
- 目标不可达的情形也没有难倒任何一个。四者都会自行终止,并将两个孤岛节点保留为无穷大。
- 场景 3 是关键。每个模型都发现了负边。只有 GPT‑6 Sol 将其视为终止理由:它在屏幕上明确说明“无向负边会使最短路不成立”,并拒绝运行。
我们细看一下。GPT-6 Sol 因负权重拒绝运行算法,并给出了非常醒目的红色错误信息。

GPT‑5.6 Sol 也标出了负权重并给出警告,但随后仍继续运行算法,高亮了一条路径并填充了距离表,仿佛答案是有效的。错误答案旁边加一个警告,仍然是错误答案。GPT‑5.6 Luna 也是如此。

GPT‑6 Luna 的结果介于二者之间:先给出横幅,指出具体边并说明 Dijkstra 不适用,然后给出充满负无穷的距离表。对于无向负边,这一做法勉强说得过去,但可读性较差。

那么 GPT‑6 算不算实质升级?勉强算,且仅体现在一个方面,但这点很重要。在构建任务本身上,几代模型打成平手。差异完全在于各模型如何处理其明知有问题的输入,这更契合 OpenAI 关于诚实性的说法,而非编码能力。两款 Luna 则完全未拉开差距。
另一个教训来自测试本身:当四个模型除一处外全部过关,说明该测试门槛需要进一步提高。
GPT‑6 Sol 与 Luna 的定价与可用性
以下是新的成本结构。两者均较各自 GPT‑5.6 价位下调 50%。
| 每 100 万 token | GPT‑6 Sol | GPT‑5.6 Sol | GPT‑6 Luna | GPT‑5.6 Luna |
|---|---|---|---|---|
| 输入 | $2 | $4 | $0.10 | $0.20 |
| 输出 | $10 | $20 | $0.50 | $1.20 |
在 GPT‑6 上,缓存的输入 token 读取可享 90% 折扣,因此在长时间代理运行中,缓存命中率与标价同样关键。OpenAI 的发布未公布两款模型的批量价率,且二者都低于 GPT‑6 Astra 的每 100 万 token 输入 $10、输出 $50。
OpenAI 发布中仅对计划与产品界面做了访问限制说明,这也是信息更具体之处。
如何获取 GPT‑6 Sol 与 Luna 的访问?
GPT‑6 Sol 与 Luna 已在多平台上推出:
-
ChatGPT Work 与 Codex 面向 Plus、Pro、Business、Enterprise 与 Edu 用户开放;此外,Luna 也在桌面应用中提供给 Free 与 Go 用户。
-
在 API 中,它们的名称为
gpt-6-sol与gpt-6-luna。OpenAI 提醒,ChatGPT 的推送为分批进行,因此全面可见可能需要等待一段时间。 -
此外,这两款模型也可通过 OpenRouter(对应
openai/gpt-6-sol与openai/gpt-6-luna)、GitHub Copilot、Azure AI Foundry 与 AWS Bedrock 获取。
在 API 中,它们可通过 gpt-6-sol 与 gpt-6-luna 获取。OpenAI 提醒 ChatGPT 的推送在一天内分批进行,可能需要一点时间才会向所有人开放。一个最小调用如下:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-sol",
reasoning={"effort": "high"},
input="List the open pull requests that touch billing code and summarize the risk of each.",
)
print(response.output_text)
如果您正从 GPT‑5.6 迁移,OpenAI 的 GPT‑6 模型使用指南(基于 Astra)建议:去掉 temperature 与 top_p;若此前使用 none 或 minimal,则从 low 起步,否则保持当前努力等级;将 prompt_cache_retention 切换为 prompt_cache_options.ttl 并设为 30 分钟。
结语
Sol 与 Luna 将旗舰 Astra 背后的训练配方下放,使下一档位在价格与速度上显著占优。OpenAI 的发布也罕见地直接点名了 Anthropic 的模型,并在成本校正后的基准上给出胜出声明。这一对比颇有意思,因为 Opus 5.5 同样也是一次效率上的胜利。
我的看法是:如果您在 GPT‑5.6 Sol 或 Luna 上运行代理或编码任务,现在就切换。努力梯度一致、价格减半;在我们的测试中,GPT‑6 Sol 相较前代唯一的明显不同,是拒绝对一个算法本身无法回答的问题给出自信的答案。若您在用 Claude,这些成本校正的数字意味着应自行做对比,而非照单全收 OpenAI 的说法。
如果您想基于这些模型构建,我推荐 OpenAI 基础技能路径,该路径用 15 小时覆盖从头到尾的 API 使用。
GPT-6 Sol 与 Luna 常见问题
GPT‑6 Sol 与 Luna 是什么?它们与 GPT‑6 Astra 有何关系?
它们是 GPT‑6 家族的两款新成员,位于 Astra(OpenAI 的顶级模型)之下的价位/能力档。它们采用与 Astra 类似的训练方法,但针对更低成本与更快响应做了优化,面向日常任务,而非 Astra 所保留的最严苛项目。
与上一代相比便宜了多少?
两款模型相较 GPT‑5.6 推广期定价均降 50%。具体而言:Sol 从每百万输入/输出 token $4/$20 降至 $2/$10;Luna 从 $0.20/$1.20 降至 $0.10/$0.50。
与 Claude 等竞品相比表现如何?
OpenAI 声称其成本效率很强——例如在 AutomationBench 上,高努力的 GPT‑6 Sol reportedly 优于 Claude Opus 5,而每任务成本仅为其一小部分。类似的对比也见于编码(FrontierCode、DeepSWE)与电脑操作(OSWorld)基准,整体强调在显著更低成本下获得更好或相当的分数。需注意这些为 OpenAI 自报基准,竞品数据多来自公开报告,而非 OpenAI 自测。
缓存与对齐做了哪些改进?
缓存方面的改进旨在默认获得更高的缓存命中率(缓存的输入 token 最高 90% 折扣),并提供新的工具,如缓存仪表板与可调的推理努力/工具设置,同时保持缓存有效。对齐方面,两款模型据称较 GPT‑5.6 前代在诚实性指标上有所改善(例如更少对编码工作的误导性陈述)。
何时何地可访问这些模型?
它们已在 ChatGPT Work 与 Codex 面向 Plus、Pro、Business、Enterprise 与 Edu 用户开放,其中 Luna 也在桌面应用中向 Free/Go 用户提供。通过 API 可用的名称为 gpt-6-sol 与 gpt-6-luna。目前尚未在标准的 ChatGPT 消费者层开放,且将于当天分批上线。
我该用 GPT‑6 Sol 还是 GPT‑6 Luna?
Sol 适合用于代理工作流、真实代码库中的编码,以及高事实要求的专业工作;OpenAI 在 AutomationBench、DeepSWE 与事实性评测上的结果主要围绕该档位展开。Luna 适用于高规模、对成本敏感的任务,如分类、抽取与路由,其每百万 token 输入 $0.10、输出 $0.50 的价格比峰值能力更重要。Luna 也是 ChatGPT 桌面应用中向 Free 与 Go 用户提供的唯一 GPT‑6 模型。
