跳至内容

GPT-6 Sol vs Claude Opus 5.5:基准、定价与选型指南

同日发布的两款效率型模型,定价 2:1。我们比较 GPT-6 Sol 与 Claude Opus 5.5 的基准、真实工作负载成本、可用性,以及一次上手俄罗斯方块构建。
更新 2026年9月23日  · 15分钟

用 AI 探索

ChatGPTClaudePerplexity

在更高效、更实惠的前沿模型竞赛中,外界对 Anthropic 新模型的关注只持续了大约一个小时。

他们的 Claude Opus 5.5 是 Claude 5.5 系列中的首款模型,主打以低于 Opus 5 的运行成本,达到 Fable 5.1 级别的性能。

OpenAI 很快回应,发布了 GPT-6 家族的中端型号 GPT-6 Sol,采用与旗舰 GPT-6 Astra 相同的训练方法,API 价格是其前代 GPT-5.6 Sol 的一半。

本文将从多个性能维度、护栏与定价对比 GPT-6 Sol 和 Claude Opus 5.5,并附上一项我在二者上各跑了一遍的上手构建测试。

要点速览

  • Claude Opus 5.5 公布的代理式编码基准更强,并在两者实际共有的两个基准上均领先。
  • GPT-6 Sol 标价只有对方的一半,但在大量依赖缓存的代理循环和超长请求中差距会缩小。
  • 在我们的构建测试中,两者都拿下了困难的逻辑题,且 Sol 打包出的游戏更为精致。
  • 若面向长时间运行的代理式编码,或需要在三大云平台全覆盖部署,选 Opus 5.5。
  • 若关注成本、量大,或团队使用 Codex 与 ChatGPT Work,或希望在预算内自动化业务应用,选 Sol。

什么是 GPT-6 Sol?

GPT-6 Sol 是 OpenAI 的中端 GPT-6 模型,于 2026 年 9 月 22 日与 GPT-6 Luna 一同发布,定位于旗舰 GPT-6 Astra 之下。

它的卖点是以 Astra 的训练配方,提供比 GPT-5.6 Sol 低一半的 API 价格,并支持在对推理力度或工具做出会话中途调整时仍保持提示缓存有效。

我们的《GPT-6 Sol 与 Luna 指南》涵盖了发布细节,另有《GPT-6 Astra API 教程》讲解该家族的异步工具与引导方式。

什么是 Claude Opus 5.5?

Claude Opus 5.5 是 Anthropic 的首款 Claude 5.5 模型,于 2026 年 9 月 22 日发布,被定位为该公司在长时间运行的代理式编码与知识工作方面的新旗舰。

它的卖点是在 Opus 价位上提供 Fable 级结果:Anthropic 称其在多数任务上可与 Claude Fable 5.1 持平,并配有 Fable 级的网络安全与生物安全防护。

我们的《Opus 5.5 指南》涵盖了发布内容,另有《Claude Opus 5 API 教程》介绍上一代 API。

GPT-6 Sol vs Claude Opus 5.5:正面对比

Opus 5.5 在已公布基准中领先,Sol 在价格与我们的构建测试中占优

由于发布时间非常接近,双方都没把对手的新模型放进各自的发布表里,因此两者仅在两个基准上有重叠,且 Opus 5.5 均领先。Sol 的优势在于价格,以及在我们自测中的表现。

特性 GPT-6 Sol Claude Opus 5.5
代理式编码基准 DeepSWE v1.1 68.8%(最大力度);在 FrontierCode 上“匹配 Claude Fable 5.1”,未公布具体数值 Terminal-Bench 4.0 66.4%、FrontierCode v1.1 54.4%、CursorBench 4.0 57.8%
AutomationBench(共有) xhigh 努力度 33.2%,单任务 $0.27 40.0%(Zapier 跑的,无后备模型)
OSWorld 2.0,部分得分(共有) xhigh 努力度的离线集 60.5% 81.8%
知识工作 在 OpenAI 内部评测中,事实性错误约为 GPT-5.6 Sol 的一半 GDPval-AA v2.1 1846 Elo,领先 GPT-6 Astra 与 GPT-5.6 Sol
上下文窗口 / 最大输出 1.05M tokens / 128K 1M tokens / 128K
标价(每 100 万 tokens) $2 输入 / $10 输出 $4 输入 / $20 输出
护栏 努力度从 nonemax;对其编码工作的误导性表述少于 GPT-5.6 Sol 无法关闭思考;大多数网络安全任务会改道至 Opus 4.8
我们的上手俄罗斯方块构建(3 个维度的平均) 5.0 4.3

编码与代理式工作流

Opus 5.5 公布的代理式编码数据更强,而 Sol 的博文并未正面质疑这些结果。Anthropic 报告了 Opus 5.5 在 Terminal-Bench 4.0、FrontierCode 与 CursorBench 上的成绩;OpenAI 报告了 Sol 在 DeepSWE 上的成绩,并仅称其在 xhigh 努力度的 FrontierCode 上与 Claude Fable 5.1 持平。Anthropic 将 Fable 5.1 的 FrontierCode 记为 50.3%,而 Opus 5.5 为 54.4%,若两者说法都成立,则在两方都提到的这项编码基准上,Sol 大约落后 Opus 5.5 四个百分点。

基准 GPT-6 Sol Claude Opus 5.5 备注
Terminal-Bench 4.0 未公布 66.4%(xhigh) Anthropic 跑的;OpenAI 报告 GPT-6 Astra 57.9%、GPT-5.6 Sol 37.3%
FrontierCode v1.1 Main 未公布;“匹配 Claude Fable 5.1 xhigh” 54.4% Anthropic 记 Fable 5.1 为 50.3%;按可合并性而非仅正确性评分
CursorBench 4.0 未公布 57.8% Anthropic 跑的;GPT-5.6 Sol 41.7%
DeepSWE v1.1 68.8%(max) 未公布 OpenAI 跑的;Claude Fable 5 的最佳为 xhigh 69.9%

两家更多依赖长周期案例而非共享分数。Anthropic 的内部案例是将 HAProxy 从 C 改写为 Rust,Opus 5.5 用时 9.5 小时,Fable 5.1 为 12 小时,成本低 51%。OpenAI 的论据是单任务成本:Sol 以远低于对方的大约 80% 成本,在 DeepSWE 上的分数与 Fable 5 相差约 1 个百分点。

看这些表需要两点保留:

  • Anthropic 在生产护栏开启状态下跑了 Opus 5.5,并称改道的网络安全与生物学任务可能拉低了分数。
  • OpenAI 的单任务成本对比,将 Sol 的 xhigh 或 max 与不同努力度的 Claude 模型配对比较。

纸面上,Opus 5.5 是更强的编码模型;不过在我们下面的单次构建测试中,这个差距并未显现。

业务工作流与电脑使用

在两者共享的两个基准上,Opus 5.5 都领先,其中 AutomationBench 的差距最干净:Opus 5.5 在 Zapier 针对 47 个业务工具的代理测试中为 40.0%,Sol 为 33.2%。

Sol 的反击是账单:OpenAI 将 Sol 描述为以 Opus 5 的 9% 单任务成本击败 Claude Opus 5,但该对比对象是上一代 Opus,而非本代。

基准 GPT-6 Sol Claude Opus 5.5 备注
AutomationBench 33.2%(xhigh),$0.27/任务 40.0% Opus 5.5 数字来自 Zapier 的早期接入跑分(无后备模型);Sol 数字来自 OpenAI
OSWorld 2.0(部分) 60.5%(离线集,xhigh) 81.8% 子集与努力度不同;OpenAI 表示 Astra 仍是其最佳电脑使用模型
Agents' Last Exam 56.4%(max) 未公布 OpenAI 称此成绩超过 Claude Opus 5 的最佳分,且单任务成本低 60%

按分数,Opus 5.5 是更强的代理;按账单,Sol 则是可以承受每一张工单都跑的那一个。

知识工作与事实可靠性

这里唯一跨厂商的数字来自 Opus 5.5:GDPval-AA v2.1 的 Elo 为 1846,领先 Anthropic 表中的 GPT-6 Astra 与 GPT-5.6 Sol;Sol 本身未列入。Anthropic 的报告写作测试中,只要编造数据即判失败,Opus 5.5 的 18 份报告中有 16 份通过,而 Fable 5.1 与 Opus 5 无一通过。

Sol 的证据来自与自身前代的对比:在 OpenAI 的内部事实性集合上,Sol 的错误约为 GPT-5.6 Sol 的一半。Artificial Analysis 的 AA-Omniscience 测试也同意,但有前提:Sol 的幻觉率从 92% 降至 60%,同时其答复率为 83%,低于前代的 99%。

两者都比各自前代更谨慎;只有 Opus 5.5 对外展示了对手比拼中的优势。

护栏与 API 约束

Sol 的 API 约束更少,Opus 5.5 的监管更强。

Opus 5.5 无法在关闭思考的状态下运行,会拒绝被强制使用工具,并将思考块绑定到生成它的模型与会话上,因此在 2026 年 8 月 31 日后创建的账户上,编辑过的上下文会触发 400 错误。大多数网络安全任务会在其 Cyber Verification Program 外改道至 Opus 4.8,生物学工作需要 Life Sciences Verification Program。

Sol 的努力度从 nonemax,会话中途可调整努力度且不破坏缓存,OpenAI 还报告其对编码工作的误导性表述少于 GPT-5.6 Sol。

这是有意为之的权衡:相比 Opus 5,Opus 5.5 试图跨越隔离边界的频率减少约 85%,这对无人值守代理很重要。

定价:您实际会付多少

Sol 的 50% 价格优势在超过 272K tokens 的请求上缩小至 8%

标价上,Opus 5.5 恰好是 Sol 的两倍,但代理实际付费的两类机制打破了这一模式:缓存读取价格一致,而 Sol 在超过 272K tokens 的请求上加收附加费,Anthropic 则没有。

Token 费率并排对照

费率 GPT-6 Sol Claude Opus 5.5
输入,每 100 万 tokens $2.00 $4.00
输出,每 100 万 tokens $10.00 $20.00
缓存读取,每 100 万 tokens $0.20 $0.20
缓存写入,每 100 万 tokens $2.50 $5.00(5 分钟)或 $8.00(1 小时)
批处理折扣 50%(Batch 与 Flex) 50%
长上下文定价 超过 272K 输入 tokens:输入与缓存费率翻倍,输出 1.5 倍,且对整条请求生效 完整的 100 万窗口按标准费率计费
极速模式 适用费率的 2 倍 $8.00 输入 / $40.00 输出,最高 2.5 倍速度
消费级方案 ChatGPT Work 与 Codex(Plus、Pro、Business、Enterprise、Edu) Claude 应用;发布时 Pro、Max、Team、Enterprise 提升限额

溢价在输入、输出与缓存写入上是平的,因此在引入缓存或长上下文之前,每种工作负载形态受影响基本一致。缓存读取是例外,Anthropic 称其构成了代理与编码工作的主要成本来源。两家都未公布“推理 tokens”的独立费率,因此按输出费率来预算。

真实工作负载要花多少钱

工作负载 GPT-6 Sol Claude Opus 5.5 差额
均衡助理:100 万入 / 25 万出 $4.50 $9.00 $4.50(50%)
检索,低于阈值:1000 万入 / 100 万出,单次请求低于 272K $30 $60 $30(50%)
检索,高于阈值:1000 万入 / 100 万出,单次请求高于 272K $55 $60 $5(8%)
重度缓存循环:写入一次 10 万前缀、读取缓存 1000 次,每次新增 5K 入 / 1K 出 $40.25 $60.50 $20.25(33%)

“高于阈值”这一行最关键:一旦每次请求都越过阈值,Sol 的附加费会把总账单抬到距离 Opus 5.5 仅 8% 的差距,因此在长上下文检索流水线中,选择 Sol 几乎得不到折扣。重度缓存循环之所以把差距缩小到 33%,是因为 1000 次缓存读取在两者上价格相同,只有新增 tokens 才按 2 倍溢价计费。

两者使用不同的分词器,且都未公布某个共享工作负载的 token 计数,因此将这些总额视为费率比较而非真实账单。Anthropic 确实表示 Opus 5.5 的单任务用 token 少于 Opus 5,但未说明与 Sol 的对比。

GPT-6 Sol 与 Claude Opus 5.5 的表现

来自两家厂商、互不测试对方模型的基准终究有限,因此我用完全相同的提示与工具,分别对两者跑了一个构建任务。

测试内容

我让两者在 12×24 的棋盘上构建一个单文件俄罗斯方块克隆,带一个变体:每 20 秒引力翻转。提示中的两个要求让它变难:翻转后,方块必须朝上方“天花板”坠落,并在上方堆叠处锁定,上下两侧各自满行都要消行,且已锁定的格子在引力翻转时绝不能移动。

两个模型都在 OpenCode 内运行,使用完全相同且已固定的工具面:只能读文件、搜索与编辑,不能用 shell,不能联网。两者都以 high 推理力度运行,各一次尝试、不重试,提示逐字节送入一个全新会话。

需要注意一个不对称点:在两家的努力度阶梯中,high 都距离顶端两级,但 Sol 的阶梯底部多一个 none,因此 high 是 Sol 的第 4/6 档,而 Opus 5.5 的第 3/5 档。

提示如下:

Build a single-file HTML page (inline CSS and JS, canvas, no build step, no external dependencies, no network) that is a playable Tetris clone with one twist: gravity flips every 20 seconds. It needs:
- a 12×24 board, the seven tetrominoes, rotation, left/right movement, soft drop, hard drop, line clears, a score, and a game-over state, controlled with the arrow keys and the space bar;
- the twist: every 20 seconds the direction of gravity flips between down and up. Pieces then fall toward the ceiling, land on the stack that has formed there, and full rows clear on either stack. Pieces already locked in place never move when gravity flips;
- a visible gravity indicator (an arrow showing the current direction) and a countdown to the next flip, both always on screen;
- a fixed starting position: the board loads with the same flat four-row stack already locked on the floor (a few gaps, no complete rows), so the flip has a stack to leave behind;
- a fixed seed for the piece sequence, so two loads produce the same game;
- autoplay on load: with no key pressed, a simple built-in player plays at the normal starting speed of about one row per second, sliding each piece without rotating into the column where the stack it is falling toward is currently lowest (the leftmost such column on a tie) and letting it fall — never a hard drop — so pieces are seen falling the moment the page opens. Any key press hands control to the keyboard for the rest of the game;
- the whole board, indicator and countdown fit in one viewport of about 1440×900 without scrolling.

Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome). Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.

我记录了成本,并从以下三个维度按 1 到 5 分打分:

  • 翻转机制:当引力翻转时,方块是否真的向上坠落、在天花板处着陆并在那里消行,同时原来的地面堆叠保持不动?
  • 游戏完整性:撇开变体,这是否是一个完整、可玩的俄罗斯方块?
  • 视觉与手感:是否流畅易读?引力翻转看起来是否是有意为之而非故障?

GPT-6 Sol 的产物

Sol 运行了 6 个回合、发起 9 次工具调用:在写入一个 22 KB 的 index.html 前,先列出、搜索并读取了空工作区,随后又补丁了一次。成品带有自有品牌风格“Fall / Rise, a game of shifting ground”,带有在翻转时由琥珀色变青色的引力面板、下一次翻转的倒计时,以及边栏的规则卡片。

它该做的都做了,且运行平滑稳定:翻转时地面堆叠保持不动,方块上升并在天花板处锁定,上下两侧都会消行,软降落手感灵敏,因此玩起来比另一个更有趣。

下一个方块的预览显示的是四方块的字母 — O、I、T、S、Z — 而非绘制出形状。熟悉记法后当然能看懂,但每次扫一眼都要停顿一拍,在速度上这会有影响。提示中并未要求任何预览,这是 Sol 主动添加却略显不足的一个点。也是唯一一个更精致的构建在可读性上反而略逊的地方。

Claude Opus 5.5 的产物

Opus 5.5 用了 3 个回合与 2 次工具调用(一次通配读取、一次写入),交付了一个 19 KB 的 index.html,名为“Flip Tetris”。其头部注释在两者中更为严谨:固定种子的 7-袋随机、带墙踢的旋转、按堆叠侧各自消行,并注明当引力翻转时,下落中的方块仅反转方向。

游戏如描述般运作,且与 Sol 一样稳定,带有幽灵影子与在翻转前变红的倒计时条。它的下一个方块预览绘制实际形状,这是更好的选择,也是相较 Sol 在“扫一眼即可获取信息”层面做得更好的唯一一点。

它还加了一个没人要求的关卡计数,我认为这不算加分:关卡上升很慢,实际影响要到远超这两个构建的常见游玩深度才显现。Opus 失分更多在手感而非逻辑:布局较为素朴,软降落不够顺滑,因此在视觉与手感上丢 1 分,在完整性上也丢 1 分。

结果

指标 GPT-6 Sol Claude Opus 5.5
回合数 6 3
工具调用 9 2
成本 $0.26 $0.87
总 tokens 120,226 107,958
推理 tokens 8,123 22,551
可运行性 通过 通过
翻转机制 5 5
游戏完整性 5 4
视觉与手感 5 4
评分(3 轴均值) 5 4.3

GPT-6 Sol 在这次测试中取胜,但优势不在难点上。两者都正确实现了引力翻转,因此差距落在打磨程度上,而 Sol 的响应性与视觉精致度让它略胜一筹。

两者差异更明显的是成本。Opus 5.5 花了 $0.87,而 Sol 仅 $0.26,超过三倍差距,且前者用的总 tokens 还更少:108k vs 120k。区别在于推理:Opus 每回合的思考强度大约是对方的三倍,用一半回合达到正确构建后即收手;Sol 则在文件内迭代,成本低,且在手感上略微更优。

这只是一次任务、一个努力度的单轮结果,且测试的是单文件的游戏循环逻辑,并非两家所强调的长周期仓库级工作。成本数字各只有一个样本点,并非均值。

何时选择 GPT-6 Sol 或 Claude Opus 5.5

按工作负载形态选择:272K 以下选 Sol,长时代理运行选 Opus 5.5

分叉点在于请求大小与工作负载形态,而非裸性能:单次请求低于 272K tokens 时,Sol 的折扣是真实的;高于该值,或在重度缓存循环中,两者账单逐渐靠拢,此时您为 Opus 5.5 所付出的,是其在代理式工作上已公布的领先成绩。

在以下情形选择 GPT-6 Sol…

  • 您运行高并发代理,且每次请求都低于长上下文阈值。标价砍半在数百万次请求中会被无限放大,且缓存读取价格本就一致。
  • 您的团队已在使用 Codex 或 ChatGPT Work。Sol 在所有付费方案中均可用,且 Codex 正是 OpenAI 为其调校的载体。
  • 您要在预算内自动化业务工作流。Sol 的 AutomationBench 单任务成本为 $0.27,OpenAI 的单任务成本论据最具说服力。
  • 您需要从最低到最高的努力度阶梯。Sol 的 none 设置与不破坏缓存的努力度切换,让代理能以低成本跑后续步骤,只在难点上再抬杠杆。

在以下情形选择 Claude Opus 5.5…

  • 您的核心工作是长时间运行的代理式编码:迁移、审计与多仓库任务。Opus 5.5 在其报告的每项代理式编码基准上都更强,且测试者案例多为以小时计的长作业。
  • 您的请求经常超过 Sol 的长上下文阈值。Anthropic 对完整的 100 万窗口按标准费率计费,而 Sol 的附加费会在该规模上抹平大部分价格差。
  • 您需要立刻在 Cursor 或三大超大规模云上可用。Opus 5.5 已出现在 Cursor,以及 Bedrock、Vertex AI 与 Microsoft Foundry;Sol 尚未在 Cursor 与 Vertex AI 上架。
  • 您运行无人值守代理并偏好更保守的模型。Anthropic 的隔离评测与 Fable 级护栏正是为此而设,前提是您的工作不涉及网络安全。

如何开始使用 GPT-6 Sol 与 Claude Opus 5.5

接入面 GPT-6 Sol Claude Opus 5.5
消费级应用 ChatGPT Work 与 Codex(Plus、Pro、Business、Enterprise、Edu);尚未进入 ChatGPT 的聊天 Claude 应用;发布时 Pro、Max、Team、Enterprise 提升限额
一方 API 是,OpenAI API(推荐 Responses API) 是,Claude API
云平台 Azure AI Foundry、AWS Bedrock AWS Bedrock、Google Cloud Vertex AI、Microsoft Foundry
编码代理 Codex、GitHub Copilot Claude Code、Cursor、GitHub Copilot
第三方路由 OpenRouter、Vercel AI Gateway OpenRouter、Vercel AI Gateway
API 模型 ID gpt-6-sol claude-opus-5-5

Opus 5.5 在首日即登陆三大云与 Cursor,而 Sol 目前上了两家云,且未出现在 Cursor 的模型列表中。API 上,两者的字符串分别是 gpt-6-solclaude-opus-5-5

在编码代理中使用 GPT-6 Sol 与 Claude Opus 5.5

各自的模型都封装在自家代理中:Sol 对应 Codex,Opus 5.5 对应 Claude Code,且两者都可在 GitHub Copilot 中选择。若您想用同一套框架跑两者,OpenCode 这类由路由器支撑的代理可通过 OpenRouter 访问,模型名为 openai/gpt-6-solanthropic/claude-opus-5.5,我们的测试正是以此在相同工具面下运行的。

直接调用 API 则需不同 SDK,因此切换的是客户端与模型字符串,而非一行替换:

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-6-sol",
    reasoning={"effort": "high"},
    input="Refactor this module and explain what you changed.",
)
print(response.output_text)
from anthropic import Anthropic

client = Anthropic()
response = client.messages.create(
    model="claude-opus-5-5",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Refactor this module and explain what you changed."}],
)
print(response.content[0].text)

关于完整的代理搭建,我们的《Codex CLI 教程》《Claude Code 教程》介绍了安装与工作流,另有《Codex vs Claude Code 对比》权衡两种载体本身。

结语

若您的工作负载是长时间的代理式编码,或请求会越过长上下文阈值,使用 Claude Opus 5.5:它公布的代理式数据更强,且其定价不会惩罚大型请求。若您的量大且低于该阈值、日常在 Codex 或 ChatGPT Work、或要在预算内自动化业务应用,使用 GPT-6 Sol 并把省下的预算留作它用。

更有意思的是,双方都没能把对方的新模型纳入自家表格,而在我们唯一能亲自对照的自包含构建里,更便宜的那款在打磨度上反而胜出。

若您想用任一模型上手构建,推荐我们的《Working with the OpenAI API》《Introduction to Claude Models》课程。

常见问题

什么时候该用 GPT-6 Sol 而不是 Claude Opus 5.5?

当您的请求低于 272K 输入 tokens 且量级重要时,使用 GPT-6 Sol:其标价为每 100 万输入 tokens $2、输出 $10,正好是 Claude Opus 5.5($4 与 $20)的一半。若您的团队在 Codex 或 ChatGPT Work 中工作,Sol 也更自然。若是长时间运行的代理式编码、请求超过 272K tokens,或需要模型立刻用于 Cursor 或三大云平台,则选择 Opus 5.5。

GPT-6 Sol 比 Claude Opus 5.5 便宜多少?

按标价,Claude Opus 5.5 在输入($4 vs $2/100 万 tokens)、输出($20 vs $10)与缓存写入($5 vs $2.50)上均为 GPT-6 Sol 的两倍。缓存读取两者同为每 100 万 tokens $0.20。Sol 对超过 272K 输入 tokens 的请求收取 2 倍输入与 1.5 倍输出的溢价,而 Anthropic 对完整 100 万上下文按标准费率计费,因此在长上下文检索上差距收窄至约 8%,在重度缓存的代理循环上约为 33%。

GPT-6 Sol 与 Claude Opus 5.5 的 API 模型 ID 是什么?

在 OpenAI API 上,GPT-6 Sol 的型号为 gpt-6-sol。在 Claude API 上,Claude Opus 5.5 的型号为 claude-opus-5-5,在 Amazon Bedrock 上为 anthropic.claude-opus-5-5。通过 OpenRouter,二者分别为 openai/gpt-6-solanthropic/claude-opus-5.5

我可以在哪里使用 GPT-6 Sol 与 Claude Opus 5.5?

GPT-6 Sol 可在 ChatGPT Work 与 Codex(Plus、Pro、Business、Enterprise、Edu 用户)中使用,也可通过 OpenAI API、在 Azure AI Foundry 与 AWS Bedrock、在 GitHub Copilot,以及通过 OpenRouter 访问;尚未在 ChatGPT 的消费者聊天中提供。Claude Opus 5.5 可在 Claude 应用、Claude API、AWS Bedrock、Google Cloud Vertex AI、Microsoft Foundry、以及 Claude Code、Cursor 与 GitHub Copilot 中使用。

哪一个更适合编码,GPT-6 Sol 还是 Claude Opus 5.5?

在已公布的基准上,Claude Opus 5.5 领先:Anthropic 报告其在 Terminal-Bench 4.0 为 66.4%、在 FrontierCode 为 54.4%;OpenAI 则称 GPT-6 Sol 在 FrontierCode 上与 Claude Fable 5.1 持平,而 Anthropic 给 Fable 5.1 的分数为 50.3%。在我们的上手测试中,一个带引力翻转的单文件俄罗斯方块克隆,两者逻辑都正确,GPT-6 Sol 在精致度与手感上以 5.0 对 4.3 领先。

主题
人工智能
大语言模型

与 DataCamp 一起学习 AI!

Courses

使用 OpenAI API

3小时
173.9K
用 OpenAI API 开始开发 AI 驱动的应用。 了解支撑 ChatGPT 等热门 AI 应用的功能。
查看详情Right Arrow
开始课程
查看更多Right Arrow