跳至内容

GPT‑6 Sol 与 Luna:将 Astra 的能力带到更亲民的档位

OpenAI 以两款更低成本的模型扩充 GPT‑6 阵容,号称在编码、准确性与业务任务上接近 Astra 的表现。
更新 2026年9月23日  · 15分钟

用 AI 探索

ChatGPTClaudePerplexity

OpenAI 刚刚为 GPT‑6 家族新增两款模型:GPT‑6 Sol 和 GPT‑6 Luna,定位低于本月早些时候我们介绍过的旗舰 GPT‑6 Astra。Sol 和 Luna 的价格均大幅下调(较其 GPT‑5.6 价位降 50%),并在编码与工作流自动化方面有所提升。

巧合也好并非巧合也罢,Anthropic 今天(同一天)发布了 Claude Opus 5.5,定位也类似:与旗舰采用相同的训练路线,但在成本与速度上做了优化。

想进一步了解它们所隶属的旗舰模型,请查看我们的 GPT‑6 Astra API 教程 以及 GPT‑6 Astra 与 Claude Fable 5.1 对比

要点速览

  • GPT‑6 Sol 与 Luna 是低于 Astra 的两个档位,采用相同的训练配方,定价为其 GPT‑5.6 前代的一半。
  • 最大看点是代理与编码任务的单位成本,而非绝对能力。OpenAI 报告中的几乎所有结果都做了成本校正。
  • GPT‑6 Sol 的事实性错误约为 GPT‑5.6 Sol 的一半;Luna 也有提升,但在可靠性上仍落后于 Sol。
  • 代理工作流与编码优先用 Sol,高吞吐的日常任务用 Luna。只有当任务能证明其价值时再选择 Astra。
  • 如果您已经在用 GPT‑5.6 Sol 或 Luna,因价格请尽快切换;我们动手测试中,能力提升不大,主要体现在能如实指出输入有问题。

GPT‑6 Sol 与 Luna 是什么?

Astra 仍是 OpenAI 能力最强、对齐度最高的模型,面向最苛刻的工作。但 Sol 与 Luna 旨在将其中大部分训练方法,以及在编码、电脑操作等方面的大量性能,下放至更便宜、更快速的档位。

可以把它理解为 Opus 5.5 之于 Fable 5.1 的关系:不是全新前沿,而是“临近前沿”的性能、却只需一小部分成本。

GPT‑6 Sol 与 Luna 的关键特性

有几项值得关注:

整体显著更便宜

Sol 的 API 价格减半。Luna 的价格甚至还不到一半。详细请见下文定价部分。

在业务工作流上表现强劲

AutomationBench(覆盖销售、市场、运营、支持、财务等多领域的代理测试)中,Sol 在最高努力等级下优于 Claude Opus 5,且每任务成本仅为 Opus 5 的一小部分。Luna 也较其 GPT‑5.6 前代有实质提升,同时显著降低了每任务成本。OpenAI 提供了一张不错的图表,我在此重绘:

我注意到,该图未包含 Anthropic 在 Opus 5.5 公告中给出的 Opus 5.5 数据,因此我加上了一组新线条。可见最新版本的 Sol 与 Luna 仍然最为高效。OpenAI 之所以没在发布中加入这些信息,原因大概只是时间点——Opus 5.5 早一个小时发布。

编码收益更多体现在成本,而非仅仅准确率

FrontierCode 上,Sol 被描述为大致追平 Claude Fable 5.1 的最高分,但价格低得多。在另一项编码基准(DeepSWE)上,Sol 以大幅成本折扣接近 Fable 5 的最佳成绩,而 Luna 在中档努力下被定位为可与 Opus 5 与 Fable 5 相当。

更少的事实性错误

OpenAI 称,在基于真实对话、由用户标记错误构建的内部事实性检查中,Sol 的错误率约为其前代的一半。Luna 也有进步;OpenAI 声称在更高努力下,它能以极低成本匹配 GPT‑5.6 Sol 的事实性。这一点较难外部验证。

更少赘述的写作风格

Astra 更简洁、少行话的沟通风格被带到了 Sol 与 Luna。自从 4o 因过度迎合而受到大量批评后,OpenAI 一直在持续优化其模型的对话风格。

面向代理的更便宜、更聪明的缓存

除了按 token 计价外,OpenAI 强调了提示缓存的改进,旨在帮助代理与长对话更高效地复用上下文,缓存的输入读取约可打 9 折(即 90% 折扣)。新的仪表板与诊断工具可帮助开发者了解缓存何处有效、何处无效。

更少对自身工作的误导性陈述

与 GPT‑5.6 系列相比,这两款模型在编码任务上更不容易误述自己做了什么。

OpenAI 的对齐评估在最大发电努力下运行,故意设置引诱不诚实的场景,而 Sol 与 Luna 在编码欺瞒、搜索损坏、评审绕过、警告规避、未授权交互等测试上的欺瞒率均低于 GPT‑5.6 Sol 与 Luna。

OpenAI 强调这些是对抗性设置,而非常见使用场景的失败率,并在 GPT‑6 系统卡中公布了完整结果。

GPT‑6 Sol 与 Luna 的基准表现如何?

OpenAI 的发布材料大量采用成本校正后的对比。我先前提到过 Sol 在 AutomationBench 上的表现。OpenAI 不仅说它“优于 Opus 5”,还强调它更好,每任务成本大约便宜 11 倍。

还需要提示的是,OpenAI 自身的数据也显示,在电脑操作任务上 Astra 仍领先于 Sol 与 Luna;同时,与 Claude 系列的一些对比使用了不同的努力等级(例如,Sol 用 “xhigh”,而 Opus 5 用 “medium”),这使得效率方面的结论非常有力,但绝对能力的对比就不那么容易精确锚定。

在此前提下,以下为 OpenAI 报告的结果,按各基准所代表的工作类型分组。

业务工作流与代理

Sol 最强的结果出现在 AutomationBench——Zapier 针对销售、市场、运营、支持、财务与人力等 47 款工具进行端到端代理测试。GPT‑6 Sol 在 xhigh 努力下得分 33.2%,每任务 $0.27,领先于 Claude Opus 5 的最大努力,甚至超过了低努力的 GPT‑6 Astra,同时每任务成本仅为 Opus 5 的一小部分。

在 AutomationBench 上,GPT-6 Sol 超过了 Claude Opus 5 和低努力的 Astra

需要仔细阅读的是 Fable 5.1 这行。OpenAI 将带有 Opus 5 回退的 Claude Fable 5.1 列在 Sol 之下,但该回退在约 40% 的任务中被触发,其成本并未计入报告数字。

模型(与努力等级) AutomationBench 分数 每任务成本
GPT‑6 Sol(xhigh) 33.2% $0.27
GPT‑6 Astra(low) 30.3% 为 GPT‑6 Sol 的 3.9 倍
Claude Fable 5.1(带 Opus 5 回退,max) 31.4% 超过 GPT‑6 Sol 的 8.9 倍(未计入回退成本)
Claude Opus 5(max) 26.9% 为 GPT‑6 Sol 的 11.1 倍

Luna 在同一基准上的故事更像代际跃迁。在高努力下,GPT‑6 Luna 较 GPT‑5.6 Luna 提升 5.4 个百分点,同时每任务成本下降 58%。

在 Agents' Last Exam(评测代理在 55 个细分行业中的长周期专业工作流)上,GPT‑6 Sol 在最大努力下得分 56.4%。OpenAI 称这高于 Claude Opus 5 在该评测中的最佳成绩,同时每任务成本低 60%。

真实代码库中的编码

在 DeepSWE v1.1(测试代理在真实代码仓中的长周期软工任务)上,GPT‑6 Sol 在最大努力下得分 68.8%。Claude Fable 5 在该评测的最佳成绩为 xhigh 努力下的 69.9%,因此 Sol 仅落后 1.1 分,但每任务成本大约低 80%。

GPT‑6 Luna 在最大努力下在同一基准得分 66.6%,OpenAI 称其可与中等努力下的 Claude Opus 5 与 Fable 5 相当。与 Opus 5 相比,Luna 每任务成本低 93%,与 Fable 5 相比低 96%。

独立数据目前不多。Artificial Analysis 给出 GPT‑6 Sol 在 Coding Agent Index 上为 57,对应 GPT‑5.6 Sol 的 55;在 Intelligence Index 上为 48,对应前代的 47;每任务预估成本由 $1.99 降至 $1.06。

事实可靠性

OpenAI 的内部事实性评测来自去标识化的 ChatGPT 对话,用户在其中对早期模型的事实性错误进行了标记。在该集合上,GPT‑6 Sol 的错误约为 GPT‑5.6 Sol 的一半;在更高努力下,GPT‑6 Luna 的事实性可与 GPT‑5.6 Sol 匹配,而成本仅其百分之一左右。

Artificial Analysis 的 AA-Omniscience 测试也指向同一趋势,但需注意:Sol 的幻觉率从 GPT‑5.6 Sol 的 92% 降至 60%,但其回答率仅为 83%,而前代为 99%,因此部分改进来自拒答。Luna 在同测中的幻觉率为 77%。

电脑操作

Astra 依然是 OpenAI 最强的电脑操作模型,文中亦明确指出。在 OSWorld 2.0 offline 上,GPT‑6 Sol 在 xhigh 努力下得分 60.5%,而 Claude Opus 5 在 medium 努力下为 60.3%,每任务成本约低 80%。GPT‑6 Luna 在最大努力下超过了 medium 努力下的 GPT‑5.6 Sol,而成本仅其十分之一。

该用哪个档位?

Sol 适合作为大多数开发者与代理工作的默认选择,Luna 面向大批量,Astra 则用于那些错一次代价高于 token 成本的项目。GPT‑6 家族现有三档,训练配方一致,深度、速度与价格有别。

代理与编码默认用 Sol,走量用 Luna,最难的工作用 Astra

三者在 API 中暴露同一套推理梯度:nonelowmediumhighxhighmax(Sol 与 Luna 可用),Astra 则从 low 起步。更高梯度会为推理投入更多 token,OpenAI 的大多数“头条”结果都运行在 xhigh 或 max。

GPT‑6 还允许您在对话中途调整努力等级而不失效提示缓存,因此代理可以在低努力下进行廉价的后续步骤,仅在困难步骤上提升等级。

使用场景 档位 原因
跨业务应用的多步骤代理 Sol 以对手每任务成本的一小部分,领跑 AutomationBench 与 Agents' Last Exam
产出可合并变更的编码代理 Sol 相较 GPT‑5.6 Sol,在 FrontierCode 上显著提升;在 DeepSWE 上接近 Fable 5,成本低得多
高事实要求的撰写与研究摘要 Sol 事实性错误约为前代的一半
大规模分类、抽取与路由 Luna 每 100 万 token:输入 $0.10、输出 $0.50;在更高努力下现可匹配 GPT‑5.6 Sol 的事实性
Free 或 Go 计划下的桌面使用 Luna 这两类计划唯一可用的 GPT‑6 模型
长周期电脑操作与最难的端到端工作 Astra 仍为 OpenAI 的全能最佳,输入 $10、输出 $50(每 100 万 token)

关于 Luna 的一个提醒:Artificial Analysis 测得其每任务输出 51,000 个 token,而 GPT‑5.6 Luna 为 41,000 个,因此在未限制输出的工作负载上,降价幅度会小于标称数字所暗示。

上手测试 GPT‑6 Sol 与 Luna:实操示例

上述基准均来自 OpenAI,因此我用完全相同的提示与工具,对四个模型各跑了一个构建任务。

任务:做一个单文件 HTML 可视化器,演示 Dijkstra 算法;每 400ms 动画检查一条边,直到目标节点“收敛”;节点状态清晰可辨,带暂停/单步/重置控件,并输出最终距离表。无需构建步骤、无依赖、无网络。

真正的考点在数据文件。它包含三张图:

  • 一张正常图(仅正权重,目标可达)
  • 一张目标不可达的图
  • 一张包含负权重的图,使 Dijkstra 不适用(会陷入无限循环)

提示中从未点明这些陷阱。能否注意到它们才是关键,这也同时检验两项发布声明:相对 GPT‑5.6 的 FrontierCode 提升,以及关于编码工作误导性陈述的下降。

四个模型均在 OpenCode 中运行,固定工具面(仅读写文件),相同推理努力,一次尝试,独立会话,提示逐字节一致。

以下是 GPT‑6 Sol 在正常图上的产出示例:

主要结论:

  • 在干净图上,四者不分伯仲。四个模型都交付了可运行文件,得到距离 24 的正确路径,按顺序收敛节点,并构建了单屏可读的控件。在还原度与布局上全部满分。
  • 目标不可达的情形也没有难倒任何一个。四者都会自行终止,并将两个孤岛节点保留为无穷大。
  • 场景 3 是关键。每个模型都发现了负边。只有 GPT‑6 Sol 将其视为终止理由:它在屏幕上明确说明“无向负边会使最短路不成立”,并拒绝运行。

我们细看一下。GPT-6 Sol 因负权重拒绝运行算法,并给出了非常醒目的红色错误信息。

GPT-6 因负权重拒绝运行该图

GPT‑5.6 Sol 也标出了负权重并给出警告,但随后仍继续运行算法,高亮了一条路径并填充了距离表,仿佛答案是有效的。错误答案旁边加一个警告,仍然是错误答案。GPT‑5.6 Luna 也是如此。

GPT-5.6 Sol 承认存在负权重并警告,但仍然运行了算法。GPT-5.6 Luna 亦然。

GPT‑6 Luna 的结果介于二者之间:先给出横幅,指出具体边并说明 Dijkstra 不适用,然后给出充满负无穷的距离表。对于无向负边,这一做法勉强说得过去,但可读性较差。

GPT-6 Luna 运行了算法,但发出警告并将所有节点距离标为负无穷。

那么 GPT‑6 算不算实质升级?勉强算,且仅体现在一个方面,但这点很重要。在构建任务本身上,几代模型打成平手。差异完全在于各模型如何处理其明知有问题的输入,这更契合 OpenAI 关于诚实性的说法,而非编码能力。两款 Luna 则完全未拉开差距。

另一个教训来自测试本身:当四个模型除一处外全部过关,说明该测试门槛需要进一步提高。

GPT‑6 Sol 与 Luna 的定价与可用性

以下是新的成本结构。两者均较各自 GPT‑5.6 价位下调 50%。

每 100 万 token GPT‑6 Sol GPT‑5.6 Sol GPT‑6 Luna GPT‑5.6 Luna
输入 $2 $4 $0.10 $0.20
输出 $10 $20 $0.50 $1.20

在 GPT‑6 上,缓存的输入 token 读取可享 90% 折扣,因此在长时间代理运行中,缓存命中率与标价同样关键。OpenAI 的发布未公布两款模型的批量价率,且二者都低于 GPT‑6 Astra 的每 100 万 token 输入 $10、输出 $50。

OpenAI 发布中仅对计划与产品界面做了访问限制说明,这也是信息更具体之处。

如何获取 GPT‑6 Sol 与 Luna 的访问?

GPT‑6 Sol 与 Luna 已在多平台上推出:

  • ChatGPT Work 与 Codex 面向 Plus、Pro、Business、Enterprise 与 Edu 用户开放;此外,Luna 也在桌面应用中提供给 Free 与 Go 用户。

  • 在 API 中,它们的名称为 gpt-6-solgpt-6-luna。OpenAI 提醒,ChatGPT 的推送为分批进行,因此全面可见可能需要等待一段时间。

  • 此外,这两款模型也可通过 OpenRouter(对应 openai/gpt-6-solopenai/gpt-6-luna)、GitHub Copilot、Azure AI Foundry 与 AWS Bedrock 获取。

在 API 中,它们可通过 gpt-6-solgpt-6-luna 获取。OpenAI 提醒 ChatGPT 的推送在一天内分批进行,可能需要一点时间才会向所有人开放。一个最小调用如下:

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-6-sol",
    reasoning={"effort": "high"},
    input="List the open pull requests that touch billing code and summarize the risk of each.",
)
print(response.output_text)

如果您正从 GPT‑5.6 迁移,OpenAI 的 GPT‑6 模型使用指南(基于 Astra)建议:去掉 temperaturetop_p;若此前使用 noneminimal,则从 low 起步,否则保持当前努力等级;将 prompt_cache_retention 切换为 prompt_cache_options.ttl 并设为 30 分钟。

结语

Sol 与 Luna 将旗舰 Astra 背后的训练配方下放,使下一档位在价格与速度上显著占优。OpenAI 的发布也罕见地直接点名了 Anthropic 的模型,并在成本校正后的基准上给出胜出声明。这一对比颇有意思,因为 Opus 5.5 同样也是一次效率上的胜利。

我的看法是:如果您在 GPT‑5.6 Sol 或 Luna 上运行代理或编码任务,现在就切换。努力梯度一致、价格减半;在我们的测试中,GPT‑6 Sol 相较前代唯一的明显不同,是拒绝对一个算法本身无法回答的问题给出自信的答案。若您在用 Claude,这些成本校正的数字意味着应自行做对比,而非照单全收 OpenAI 的说法。

如果您想基于这些模型构建,我推荐 OpenAI 基础技能路径,该路径用 15 小时覆盖从头到尾的 API 使用。

GPT-6 Sol 与 Luna 常见问题

GPT‑6 Sol 与 Luna 是什么?它们与 GPT‑6 Astra 有何关系?

它们是 GPT‑6 家族的两款新成员,位于 Astra(OpenAI 的顶级模型)之下的价位/能力档。它们采用与 Astra 类似的训练方法,但针对更低成本与更快响应做了优化,面向日常任务,而非 Astra 所保留的最严苛项目。

与上一代相比便宜了多少?

两款模型相较 GPT‑5.6 推广期定价均降 50%。具体而言:Sol 从每百万输入/输出 token $4/$20 降至 $2/$10;Luna 从 $0.20/$1.20 降至 $0.10/$0.50。

与 Claude 等竞品相比表现如何?

OpenAI 声称其成本效率很强——例如在 AutomationBench 上,高努力的 GPT‑6 Sol reportedly 优于 Claude Opus 5,而每任务成本仅为其一小部分。类似的对比也见于编码(FrontierCode、DeepSWE)与电脑操作(OSWorld)基准,整体强调在显著更低成本下获得更好或相当的分数。需注意这些为 OpenAI 自报基准,竞品数据多来自公开报告,而非 OpenAI 自测。

缓存与对齐做了哪些改进?

缓存方面的改进旨在默认获得更高的缓存命中率(缓存的输入 token 最高 90% 折扣),并提供新的工具,如缓存仪表板与可调的推理努力/工具设置,同时保持缓存有效。对齐方面,两款模型据称较 GPT‑5.6 前代在诚实性指标上有所改善(例如更少对编码工作的误导性陈述)。

何时何地可访问这些模型?

它们已在 ChatGPT Work 与 Codex 面向 Plus、Pro、Business、Enterprise 与 Edu 用户开放,其中 Luna 也在桌面应用中向 Free/Go 用户提供。通过 API 可用的名称为 gpt-6-solgpt-6-luna。目前尚未在标准的 ChatGPT 消费者层开放,且将于当天分批上线。

我该用 GPT‑6 Sol 还是 GPT‑6 Luna?

Sol 适合用于代理工作流、真实代码库中的编码,以及高事实要求的专业工作;OpenAI 在 AutomationBench、DeepSWE 与事实性评测上的结果主要围绕该档位展开。Luna 适用于高规模、对成本敏感的任务,如分类、抽取与路由,其每百万 token 输入 $0.10、输出 $0.50 的价格比峰值能力更重要。Luna 也是 ChatGPT 桌面应用中向 Free 与 Go 用户提供的唯一 GPT‑6 模型。

主题
OpenAI
人工智能
生成式 AI

与 DataCamp 一起学习

Courses

理解 Prompt Engineering

1小时
232.4K
学习如何用 ChatGPT 编写高效提示词,立即应用到你的工作流程中。
查看详情Right Arrow
开始课程
查看更多Right Arrow