Curso
Em um intervalo de dois dias, a Anthropic e a OpenAI lançaram seus novos modelos carro-chefe. Ambos têm exatamente o mesmo preço: $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída, o que, curiosamente, deixa a pergunta habitual "qual é mais barato" mais difícil, e não mais fácil, já que tarifas idênticas não geram contas idênticas.
Neste artigo, eu comparo GPT-6 Astra e Claude Fable 5.1 em código e trabalho agentivo, raciocínio, uso de computador, segurança e quanto cada um realmente custa para rodar. Para ver detalhes aprofundados de cada modelo, confira nosso guia do GPT-6 Astra e nosso guia do Claude Fable 5.1.
Resumo
- A tabela de benchmarks da própria OpenAI coloca o Astra à frente do Fable 5.1 quase em tudo, enquanto a Artificial Analysis, avaliadora independente, coloca o Fable 5.1 na frente nos seus dois índices principais.
- Os preços de tabela são idênticos, e as únicas diferenças na lista de tarifas estão nas leituras de cache, em que o Fable 5.1 é 4 vezes mais barato, e no adicional de contexto longo do Astra.
- No custo medido por tarefa, isso se inverte. A Artificial Analysis calcula o Fable 5.1 a $3,76 por tarefa do Intelligence Index contra $1,67 do Astra, porque o Astra gasta bem menos tokens para alcançar sua pontuação.
- Escolha o GPT-6 Astra para uso de computador, artefatos profissionais, raciocínio em matemática e ciências, defesa em cibersegurança e menor custo por tarefa.
- Escolha o Claude Fable 5.1 por profundidade de raciocínio, para requisições acima de 272K tokens (onde o Astra cobra adicional e a Anthropic não), e para loops de agentes cujo custo é dominado por leituras de cache e não pela saída.
Você quer começar a usar a IA generativa?
Saiba como trabalhar com LLMs em Python diretamente em seu navegador

O que é o GPT-6 Astra?
O GPT-6 Astra é o carro-chefe de fronteira da OpenAI, sucessor do GPT-5.6 Sol, construído com foco em execução agentiva e não em chat. A OpenAI o posiciona para uso de computador, trabalho profissional e engenharia de software, e ele é o primeiro modelo da OpenAI a cruzar o nível "Crítico" de cibersegurança no Preparedness Framework da empresa. Ele oferece janela de contexto de 1.050.000 tokens, saída máxima de 128K e cutoff de conhecimento em 30 de abril de 2026.
Duas coisas chamam atenção no anúncio. No Codex, o Astra mantém anotações entre janelas de contexto em vez de compactá-las em um resumo, então janelas anteriores continuam pesquisáveis, e ele decide quando fazer uma pergunta de esclarecimento, em vez de sempre chutar ou sempre perguntar.
Para a lista completa de recursos, tabelas de benchmark e detalhes de acesso, veja nosso guia do GPT-6 Astra. Vale ler também junto com nossa cobertura do antecessor em GPT-5.6 Sol, Terra e Luna.
O que é o Claude Fable 5.1?
O Claude Fable 5.1 é o modelo de fronteira da Anthropic, disponível de forma geral, para raciocínio exigente e trabalho agentivo de longo horizonte. Ele roda com janela de contexto de 1M de tokens, saída máxima de 128K, thinking adaptativo sempre ativo e cutoff de conhecimento em junho de 2026. A documentação da Anthropic classifica sua latência como mais lenta que a do Claude Opus 5 e do Claude Sonnet 5, ambos com preço inferior.
O Claude Mythos 5.1 é o mesmo modelo com proteções diferentes, disponível por convite via Project Glasswing. A mudança de destaque para todos os demais é o preço de leitura de cache, reduzido em 75% para $0,25 por milhão de tokens, enquanto as tarifas de tabela permaneceram.
Nosso guia do Claude Fable 5.1 traz o detalhamento completo dos benchmarks, e nosso tutorial da API do Claude Fable 5.1 constrói um agente de desenvolvedor com consciência de repositório, incluindo um detalhamento real de custos por nível de esforço.
GPT-6 Astra vs Claude Fable 5.1: comparação lado a lado

A versão curta: a tabela comparativa da OpenAI mostra o Astra à frente do Fable 5.1 em quase todas as linhas publicadas, e a Artificial Analysis mostra o inverso em ambos os seus índices. Em quem você acredita depende do peso que dá a um fornecedor avaliando o próprio concorrente.
| Recurso | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Data de lançamento | 3 de setembro de 2026 | 1º de setembro de 2026 |
| ID do modelo na API | gpt-6-astra |
claude-fable-5-1 |
| Janela de contexto | 1,05M tokens | 1M tokens |
| Saída máxima | 128K tokens | 128K tokens |
| Cutoff de conhecimento | 30 de abril de 2026 | junho de 2026 |
| Preço de tabela por 1M de tokens | $10 entrada / $50 saída | $10 entrada / $50 saída |
| Leitura de input em cache por 1M | $1,00 ($2,00 acima de 272K) | $0,25 |
| Tarifas acima de 272K tokens de entrada | 2x em entrada e cache, 1,5x em saída | Sem adicional |
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% |
| Humanity's Last Exam, com ferramentas | 57,2% | 65,0% |
| ScreenSpot-Pro (sem ferramentas) | 92,7% | 87,3% (Fable 5, a partir do Mythos) |
| AutomationBench | 41,4% | 31,4% |
| ExploitBench | 100% | 70% |
| AA Intelligence Index (esforço máx.) | 61 | 66 |
| Custo AA por tarefa do Intelligence Index (máx.) | $1,67 | $3,76 |
| Área de maior força | Uso de computador, matemática, cibersegurança, custo por tarefa | Profundidade de raciocínio, loops agentivos dominados por cache |
Code e fluxos de trabalho agentivos
O Astra lidera nos benchmarks de código que a OpenAI escolheu publicar, mas as margens são pequenas e o índice independente discorda. No Terminal-Bench 4.0, que testa engenharia de software, configuração de sistemas e análise de dados em terminal, a OpenAI reporta 57,7% para o Astra contra 55,8% para o Fable 5.1. A Anthropic publica o mesmo 55,8%, então pelo menos essa linha não é contestada.
A diferença aumenta no DeepSWE v1.1, onde o Astra chega a 74,1% contra 67,4%, e quase zera no FrontierCode 1.1 Main, onde 53,3% contra 50,9% fica dentro da faixa que Claude Fable 5 (53,5%) e Claude Opus 5 (53,4%) já ocupavam.
| Benchmark | GPT-6 Astra | Claude Fable 5.1 | Observações |
|---|---|---|---|
| Terminal-Bench 4.0 | 57,7% | 55,8% | A tabela da OpenAI diz 57,7% enquanto a legenda do gráfico diz 57,9% |
| DeepSWE v1.1 | 74,1% | 67,4% | Reportado pela OpenAI |
| FrontierCode 1.1 Main | 53,3% | 50,9% | Praticamente empatado com Fable 5 (53,5%) e Opus 5 (53,4%) |
| Migration de banco interno | 63,9% | 57,8% | Avaliação interna da OpenAI, sem replicação externa |
| CursorBench 3.2.0 | Não publicado | 73,4% | Reportado pela Anthropic; SpaceXAI confirmou 73,4% no esforço máx. |
| AA Coding Agent Index | 67 no Codex | 70 no Claude Code | Independente, mas com harnesses diferentes |
Essa última linha é a que mais me chama de volta. A Artificial Analysis coloca o Fable 5.1 no Claude Code com 70, a maior pontuação no seu Coding Agent Index, e o Astra no Codex com 67, nível semelhante ao Claude Opus 5 e Claude Fable 5. Duas ressalvas que pedem cautela:
- Os dois modelos rodaram em harnesses diferentes, Codex versus Claude Code, então parte dessa diferença de 3 pontos vem do arcabouço, não do modelo. Nossa comparação Codex vs Claude Code mostra como eles se comportam de forma distinta.
- O Astra chega lá bem mais barato. A Artificial Analysis mediu que ele usa um terço dos tokens do GPT-5.6 Sol no esforço máximo no Codex e um quinto dos tokens do Claude Opus 5 no xhigh.
O Astra vence as linhas publicadas de código por pouco e ganha o argumento de eficiência com folga, enquanto o Fable 5.1 mantém a única pontuação independente de agente de código que supera ambos.
Raciocínio e trabalho científico
Este é o recorte mais limpo da comparação, e vai nos dois sentidos. O Astra leva as linhas de matemática e ciências: 97,6% contra 87,8% no FrontierMath Tier 4 v2, 96,0% contra 93,7% no GPQA Diamond e 64,6% contra 52,6% no Terminal-Bench Science 0.1, o benchmark agentivo de pesquisa em torno do qual a própria Anthropic fez seu lançamento.
O Fable 5.1 leva o Humanity's Last Exam com ferramentas, 65,0% contra 57,2%, e não é apertado. A Artificial Analysis corrobora a direção desse resultado de forma independente, pontuando o Fable 5.1 em 66 no seu Intelligence Index contra 61 do Astra, a maior pontuação já medida.
Uma ressalva nesse 66. A Artificial Analysis rodou o Fable 5.1 com o fallback padrão do lado do servidor da Anthropic, que roteia requisições sinalizadas por segurança para o Claude Opus 4.8 ou Claude Opus 5, e o fallback respondeu por cerca de 4% dos tokens de saída no índice. A pontuação é do Fable 5.1 como a maioria vai de fato usá-lo, e não do modelo cru isolado.
Se o seu trabalho é matemática ou ciências físicas em nível de pós, Astra. Se é o tipo de raciocínio amplo e difícil que o Humanity's Last Exam explora, Fable 5.1.
Uso de computador e artefatos profissionais
O Astra domina essa dimensão, principalmente porque a Anthropic não publicou números comparáveis. A OpenAI reporta 72,6% para o Astra no conjunto offline do OSWorld 2.0 contra 70,2% do Claude Opus 5, e 92,7% no ScreenSpot-Pro contra 87,3% do Claude Fable 5. Os números do Fable 5.1 da própria Anthropic, 77,9% parcial e 41,7% estrito, vêm de outra versão de tarefa e critérios de avaliação.
Os números de artefatos são menos ambíguos: 95,9% no BenchCAD contra 84,3%, e 41,4% contra 31,4% no AutomationBench.
Para agentes que clicam em softwares reais e produzem slides ou saída CAD, o Astra é a escolha mais forte.
Segurança, cibersegurança e alinhamento
Os números de alinhamento do Astra são a parte mais pouco comentada do seu lançamento. No benchmark interno da OpenAI de segurança em uso de computador, em que menor é melhor, ele marca 2,4% contra 9,5% do Fable 5.1.
Em cibersegurança, ele joga em outra divisão: 100% no ExploitBench, e 86 de 226 desafios do FrontierCyber resolvidos contra 34 do GPT-5.6 Sol nos testes independentes da Irregular. A Anthropic afrouxou o Fable 5.1 o suficiente para encontrar vulnerabilidades, mas não para explorá-las.
Duas ressalvas, ambas importantes:
- A OpenAI reporta que o raciocínio escrito do Astra é mais difícil de monitorar do que o do Sol, porque ele resolve problemas em menos etapas escritas.
- O UK AISI encontrou o Astra executando ataques simulados na cadeia de suprimentos em 2 de 500 amostras, mesmo quando o escopo proibia acesso à internet, queda ante 60 de 499 quando o escopo ficou ambíguo.
O Astra é ao mesmo tempo o agente mais seguro e o atacante mais capaz, daí a limitação de acesso.
Preços: o que você realmente paga
As tarifas de lista são idênticas, então, na tabela de preços, a única diferença entre esses dois modelos vem de cache e contexto longo. Esse enquadramento só vale se ambos gastarem o mesmo número de tokens na mesma tarefa — e não gastam, por isso os números medidos por tarefa mais abaixo importam mais do que a tabela de tarifas.

Tarifas de token lado a lado
| Tarifa | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Entrada, por 1M de tokens | $10,00 | $10,00 |
| Saída, por 1M de tokens | $50,00 | $50,00 |
| Leitura de input em cache, por 1M | $1,00 | $0,25 |
| Gravação em cache (5 min), por 1M | $12,50 | $12,50 |
| Desconto para batch | 50% | 50% |
| Tarifas acima de 272K tokens de entrada | $20,00 entrada / $2,00 cache / $75,00 saída | Sem adicional |
Entrada, saída, gravação em cache e desconto para batch batem centavo a centavo. A linha de leitura de cache é a exceção, e é um gap de 4x: a Anthropic corta as leituras de cache do Fable 5.1 para $0,25, enquanto a OpenAI precifica as do Astra em $1,00 — um desconto de 90% em relação à tarifa de entrada.
Acima de 272K tokens de entrada, o gap sobe para 8x, porque o adicional da OpenAI dobra as leituras de cache para $2,00 junto com a entrada, enquanto a documentação de preços da Anthropic mantém a janela completa de 1M de tokens na tarifa padrão. Repare como esse limite é baixo em relação ao que o Astra anuncia: 272K é cerca de um quarto da sua janela de 1,05M, então qualquer requisição que use mais de um quarto do contexto é cobrada na faixa superior.
Leituras de cache são a tarifa que se acumula em um loop longo, porque um agente reenvia o mesmo prompt de sistema, definições de ferramentas e contexto de repositório a cada turno. Nosso guia de prompt caching explica a mecânica da distinção entre gravação e leitura de cache, se isso for novo para você.
Quanto custa uma carga real na tabela de tarifas
Tudo nesta tabela é aritmética de preço de lista em um formato fixo de tokens, não um resultado medido. Responde à pergunta "se ambos gastassem tokens idênticos, quanto a tabela cobraria?" A próxima seção responde ao que eles de fato gastam.
| Carga | GPT-6 Astra | Claude Fable 5.1 | Diferença |
|---|---|---|---|
| Assistente equilibrado: 1M entrada / 250K saída | $22,50 | $22,50 | $0, 0% |
| Recuperação, abaixo do limite: 10M entrada / 1M saída | $150 | $150 | $0, 0% |
| Recuperação, acima do limite: 10M entrada / 1M saída | $275 | $150 | $125, 83% a mais no Astra |
| Loop pesado em cache: prefixo 100K, 1.000 leituras | $201 | $126 | $75, 59% a mais no Astra |
A fórmula é a mesma em todas as linhas: (volume ÷ 1M) × tarifa, somando entrada nova, leituras em cache, gravações em cache e saída. O loop pesado em cache assume um prefixo de 100K gravado uma vez e lido 1.000 vezes, mais 5K de entrada nova e 1K de saída por requisição.
A linha de recuperação acima do limite é a principal. Mantenha cada requisição abaixo de 272K tokens de entrada e os dois modelos custam exatamente os mesmos $150. Empurre os mesmos 10M tokens em requisições que excedem 272K cada, e o Astra salta para $275 enquanto o Fable 5.1 fica em $150, porque a Anthropic cobra a janela completa de 1M de tokens na tarifa padrão.
O loop pesado em cache é o que a maioria vai encontrar. Em 1.000 leituras em cache de um prefixo de 100K, a diferença de $0,75 por milhão de tokens em cache vira $75 em uma carga de trabalho idêntica. Note o formato dessa carga: propositalmente com pouca saída, 1K tokens de saída por requisição contra 100K de leituras de cache. É nesse formato que a vantagem de cache do Fable 5.1 decide a conta.
Quanto cada tarefa realmente custa
Quando você mede o consumo real de tokens, em vez de supor, o quadro se inverte. A Artificial Analysis precifica cada modelo por tarefa do Intelligence Index, e seu método já inclui tokens de entrada, hits de cache, gravações de cache, thinking e resposta, então o cache mais barato do Fable 5.1 já está embutido no número.
| Nível de esforço | GPT-6 Astra: pontuação/custo por tarefa | Claude Fable 5.1: pontuação/custo por tarefa |
|---|---|---|
| máx | 61 / $1,67 | 66 / $3,76 |
| xhigh | 61 / $1,20 | 65 / $2,72 |
No esforço máximo, o Fable 5.1 custa 2,25 vezes o que o Astra custa para o mesmo conjunto de tarefas com o mesmo preço de lista. A Artificial Analysis chega à mesma conclusão no índice de código, onde o Astra iguala o Fable 5 "a menos da metade do custo, impulsionado por ganhos significativos de eficiência de tokens". A faixa do Astra desce até $0,46 por tarefa no esforço baixo.
O Fable 5.1 não está sendo penalizado pela tabela de tarifas aqui, e sim pelo volume de saída. A Artificial Analysis mediu que ele usa cerca de 1,7x os tokens de saída do Fable 5 no esforço máximo, por isso custa 20% mais por tarefa do que seu antecessor apesar do corte no cache. Sem o corte, o número ficaria por volta de $5,16, então o desconto faz diferença real — só não o bastante.
Você está pagando esse prêmio por algo. O Fable 5.1 marca 5 pontos a mais no mesmo índice, e 4 pontos a mais no xhigh. Se 5 pontos valem 2,25x é uma decisão sua, não minha, mas a versão desta comparação em que preços de lista idênticos significam contas idênticas não resiste aos números medidos.
As legendas da própria OpenAI apontam na mesma direção, pelo que vale um auto-relato do fornecedor. Elas colocam o custo estimado de API por tarefa do Astra em cerca de 31% abaixo do Fable 5.1 no Terminal-Bench Science 0.1, cerca de 63% abaixo no Terminal-Bench 4.0 e cerca de 86% abaixo no BenchCAD, medidos nos níveis de esforço que a OpenAI escolheu para cada modelo.
Como o GPT-6 Astra e o Claude Fable 5.1 se saíram
O Astra venceu levemente nosso teste geral, embora ambos tenham entregue uma simulação funcional na primeira tentativa.
O teste
Rodei uma tarefa difícil contra ambos os modelos sob condições idênticas, em vez de várias superficiais. O teste escolhido para esta comparação é uma simulação de física do zero construída como um único arquivo HTML, escolhida porque investiga exatamente o que ambos os fornecedores dizem ter melhorado: correção sustentada em uma construção longa, sem biblioteca para apoiar.
Esta instância é uma versão atualizada desse teste. A variante publicada usava um contêiner quadrado giratório; então, nesta execução, troquei por um hexágono giratório com um obstáculo central girando em sentido contrário e massa proporcional ao tamanho, aumentando a dificuldade enquanto mantinha o confinamento como um critério claro de aprovação ou falha. Aqui está o prompt, colado literalmente em um chat novo para cada modelo:
Build a single-file HTML page (inline CSS and JS, canvas, no build step, no external libraries, no network) that simulates a few dozen balls of varying sizes bouncing under gravity inside a **slowly rotating hexagonal container**, with a **smaller counter-rotating obstacle at the centre** that the balls also collide with.
Ball mass should scale with size, so larger balls shove smaller ones around.
The balls should collide with each other, with the hexagon's walls, and with the central obstacle, and lose a little energy on each collision so the system settles rather than gaining energy over time.
Both the hexagon and the inner obstacle keep rotating throughout, so the balls should slosh and re-pile as they turn.
Ship it as one working file named `index.html` that starts animating on load.
Do not install packages.
Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome).
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
Ambos os modelos rodaram em esforço alto de raciocínio, uma tentativa cada, sem retries, dentro do mesmo agente de código, com as mesmas ferramentas. A avaliação começa com um check de executabilidade pass/fail e, depois, um rubric de 1 a 5 para correção física, estabilidade por 30 segundos e qualidade visual.
O que o GPT-6 Astra produziu
O Astra passou no check de executabilidade e marcou 5/5 nos três eixos do rubric. Chegou lá em 6 turnos e 9 chamadas de ferramentas, e a mistura de ferramentas é o ponto interessante: escreveu o arquivo, leu de volta 5 vezes, fez grep duas vezes e aplicou dois patches antes de declarar pronto.
A simulação está correta. 44 bolas, massa escalando com a área, confinamento mantendo por 30 segundos inteiros enquanto o hexágono gira. O Astra dimensionou o obstáculo interno grande em relação à câmara, então as bolas continuam colidindo com ele em vez de se acomodarem onde ele não alcança.
Ele também construiu uma página editorial inteira em volta da simulação, com manchete em serif, rótulos monoespaçados com espaçamento de letras e um painel de telemetria mostrando taxas de rotação em tempo real. Ninguém pediu isso, mas, na minha opinião, ficou bem bonito. Também enviou controles de pausa e reinício, que o prompt não solicitou, mas que facilitaram a inspeção do artefato.
O Astra gira a câmara a 0,09 rad/s e o obstáculo a -0,16 rad/s, cerca de 3 vezes mais devagar que o Fable na parede externa e 5 vezes mais devagar no obstáculo. Mais fácil de ver e um teste mais suave da fronteira móvel do que uma rotação mais rápida. Como o prompt pede contêiner girando lentamente, está dentro.
O que o Claude Fable 5.1 produziu
O Fable também passou em executabilidade, marcando 4 em correção física, 5 em estabilidade e 4 em qualidade visual. Precisou de apenas 2 turnos e uma única chamada de ferramenta: uma escrita, sem releituras, sem patches.
A física é sólida, sem ser impecável. As bolas grudam levemente nas paredes, o que custa um ponto em correção, e, nos primeiros segundos, elas se acomodam nos cantos inferiores, onde o obstáculo contra-rotativo deixa de alcançá-las. Esse obstáculo fica ocioso na maior parte da execução.
O Fable investiu em instrumentação, não em apresentação. Um HUD ao vivo mostra contagem de bolas, taxa de quadros, energia cinética e ambas as taxas de rotação, e clicar em qualquer ponto dentro do hexágono solta uma nova bola ali. Gostei mais desse último toque do que esperava, pois é a forma mais rápida de testar o código de colisão manualmente.
Resultados
| Métrica | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Turnos | 6 | 2 |
| Chamadas de ferramenta | 9 | 1 |
| Executabilidade | Passou | Passou |
| Correção física | 5 | 4 |
| Estabilidade no tempo | 5 | 5 |
| Qualidade visual | 5 | 4 |
| Nota no rubric | 5,0 | 4,3 |
O Astra leva esta pela qualidade, e a margem é maior em apresentação do que em física. Onde eles se separam é no que cada modelo decidiu que era o trabalho. O Astra leu o prompt como um briefing a interpretar, adicionando controles, layout editorial completo e uma rotação mais lenta que favorece a observação. O Fable leu como uma especificação a cumprir, cumpriu em uma única escrita e dedicou o restante do esforço a um HUD de diagnóstico.
É uma única execução por modelo, então trate como um ponto de dados e não um benchmark. Ele informa turnos, não tokens ou custo, e só investiga código de simulação do zero, não os eixos de uso de computador ou raciocínio abordados acima.
Quando escolher GPT-6 Astra vs Claude Fable 5.1
Como as tarifas de lista são iguais, a decisão depende do formato da carga, do consumo medido de tokens e do agente de código que você já usa. Os três números que devem te mover são o gap de 4x em leituras de cache, o limite de adicional em 272K e o custo medido por tarefa 2,25x.

Escolha o GPT-6 Astra se...
- Seus agentes operam softwares reais. Com 72,6% no conjunto offline do OSWorld 2.0 e 92,7% no ScreenSpot-Pro, o Astra é o único dos dois com histórico publicado de grounding e cliques em apps de desktop.
- Você precisa de artefatos profissionais caprichados. Slides, planilhas e saída CAD são alvos declarados de treino, e os 95,9% no BenchCAD contra 84,3% são o maior gap em artefatos que qualquer fornecedor publicou.
- O trabalho é matemática ou ciências físicas. FrontierMath Tier 4 v2 com 97,6% contra 87,8%, e GPQA Diamond com 96,0% contra 93,7%.
- Você faz segurança defensiva. 100% no ExploitBench e 86 de 226 desafios do FrontierCyber resolvidos o colocam bem à frente, desde que você aceite capacidades com acesso controlado via programa Daybreak da OpenAI.
- Você já usa o Codex. As anotações de contexto entre janelas são um recurso do Codex, e trocar de harness por uma diferença de 3 pontos raramente compensa.
- Custo por tarefa pesa mais que a maior pontuação. $1,67 contra $3,76 no Intelligence Index da Artificial Analysis no esforço máximo, e $0,46 no esforço baixo se você aceitar 57 em vez de 61.
Escolha o Claude Fable 5.1 se...
- Você roda loops de agentes longos cujo custo é leitura de cache, não saída. A $0,25 por milhão de leituras em cache contra $1,00, a carga pesada em cache acima custa $126 em vez de $201. Essa vantagem diminui assim que tokens de saída começam a dominar — exatamente o que as medições por tarefa mostram.
- Suas requisições são grandes. A Anthropic não cobra adicional de contexto longo, então a carga de recuperação de 10M tokens fica em $150, onde o Astra sobe para $275, e as leituras de cache do Astra dobram acima do limite também.
- Você quer a melhor pontuação independente de raciocínio e topa pagar por isso. A Artificial Analysis o avalia em 66 no Intelligence Index contra 61, e ele leva o Humanity's Last Exam com ferramentas por 65,0% a 57,2%.
- Você trabalha no Claude Code. O Fable 5.1 no Claude Code é a maior pontuação que a Artificial Analysis registrou no seu Coding Agent Index, com 70, e ele vem por padrão com esforço alto nessa superfície.
Como começar com GPT-6 Astra e Claude Fable 5.1
| Superfície | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| App para consumidor | ChatGPT Plus, Pro, Business, Enterprise | Claude web, mobile, desktop (Pro, Max, Team, Enterprise) |
| API de primeiro nível | OpenAI API | Claude API |
| Nuvens | Amazon Bedrock, Microsoft Azure/Foundry | Amazon Bedrock, Google Cloud, Microsoft Azure/Foundry |
| Agentes de código | Codex | Claude Code, Cursor |
| Roteadores de terceiros | OpenRouter, Vercel AI Gateway | OpenRouter, Vercel AI Gateway |
| ID do modelo na API | gpt-6-astra |
claude-fable-5-1 |
Duas questões de acesso podem te travar antes da primeira chamada. O Astra vem desativado por padrão para workspaces enterprise até um administrador ativá-lo, e o Fable 5.1 exige retenção de dados por 30 dias e não é suportado no Priority Tier. A presença em nuvem é quase equivalente, com o Google Cloud sendo hoje a única plataforma que o Fable 5.1 tem e o GPT-6 Astra não.
Usando GPT-6 Astra e Claude Fable 5.1 em um agente de código
Cada modelo é nativo do seu próprio harness, Astra no Codex e Fable 5.1 no Claude Code, onde você alterna com /model claude-fable-5-1 ou a flag --model. Pela API, a troca é uma string, embora os SDKs sejam diferentes.
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-fable-5-1", # OpenAI SDK equivalent: model="gpt-6-astra"
max_tokens=16000, # thinking plus response share this budget
output_config={"effort": "high"},
messages=[{"role": "user", "content": "Refactor this module..."}],
)
print(response.content[0].text)
Três mudanças no Fable 5.1 quebram código escrito para o Fable 5: seleção forçada de ferramenta agora retorna 400, modelos anteriores não leem seus blocos de thinking, e os blocos de thinking ficam vinculados ao histórico exato que os precede. Nosso tutorial da API do Claude Fable 5.1 passa pelas três, e nosso guia para iniciantes na OpenAI API cobre a configuração equivalente do outro lado.
Considerações finais
Decida pelo formato da carga e pelo custo medido, não pelas tabelas de benchmark. O GPT-6 Astra é mais forte para agentes que clicam em softwares, fazem matemática ou produzem artefatos prontos para cliente, e tende a sair mais barato por tarefa apesar da tabela de tarifas idêntica. O Claude Fable 5.1 entrega a maior pontuação independente de raciocínio disponível e custa menos em requisições muito grandes e em loops dominados por cache.
A tabela de tarifas é a armadilha aqui. Dois modelos a $10 e $50 parecem intercambiáveis em preço, e o único gap visível, leituras de cache, favorece a Anthropic por 4x. Aí você mede o que cada um realmente gasta para concluir uma tarefa, e o Astra sai por 44% do custo do Fable 5.1. Eu não teria previsto isso pelas páginas de preço, e é a única coisa que eu validaria no seu próprio tráfego antes de decidir.
Se você quer trabalhar com qualquer um dos modelos, recomendo nosso curso Introduction to Claude Models no lado da Anthropic e Working with the OpenAI API no lado da OpenAI.
FAQs
O GPT-6 Astra é melhor que o Claude Fable 5.1?
Depende de quais benchmarks você lê. Na tabela comparativa da própria OpenAI, o GPT-6 Astra lidera o Claude Fable 5.1 em quase todas as linhas publicadas, incluindo 97,6% contra 87,8% no FrontierMath Tier 4 v2 e 64,6% contra 52,6% no Terminal-Bench Science 0.1. A Artificial Analysis, avaliadora independente, inverte isso, pontuando o Fable 5.1 em 66 no seu Intelligence Index contra 61 do Astra. Escolha o Astra para uso de computador, matemática e cibersegurança, e o Fable 5.1 para profundidade de raciocínio e loops agentivos longos com cache.
Quanto custam o GPT-6 Astra e o Claude Fable 5.1?
Ambos listam $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída, com o mesmo desconto de 50% para batch e $12,50 para gravação em cache. Na tabela, o único gap são as leituras de cache: o Claude Fable 5.1 cobra $0,25 por milhão contra $1,00 do GPT-6 Astra, subindo para $2,00 acima de 272K tokens de entrada, onde o Astra também cobra $20 de entrada e $75 de saída. A Anthropic não cobra adicional em nenhum comprimento. Medido por tarefa, porém, isso se inverte: a Artificial Analysis coloca o Fable 5.1 em $3,76 por tarefa contra $1,67 do Astra.
Qual é melhor para programar, GPT-6 Astra ou Claude Fable 5.1?
O GPT-6 Astra lidera os benchmarks de código que cada fornecedor publicou, marcando 57,7% contra 55,8% no Terminal-Bench 4.0 e 74,1% contra 67,4% no DeepSWE v1.1. A Artificial Analysis discorda ao nível do harness, colocando o Claude Fable 5.1 no Claude Code com 70 no seu Coding Agent Index contra 67 do GPT-6 Astra no Codex. Como essas execuções usaram harnesses diferentes, parte dessa diferença vem do arcabouço, não do modelo.
Onde posso acessar GPT-6 Astra e Claude Fable 5.1?
O GPT-6 Astra está disponível no ChatGPT nos planos Plus, Pro, Business e Enterprise, via OpenAI API e no Codex. Em Enterprise, os administradores precisam ativá-lo, pois o acesso vem desativado no lançamento. O Claude Fable 5.1 roda nos apps web, mobile e desktop do Claude, na Claude API e no Claude Code, e exige retenção de dados por 30 dias. Ambos estão no Amazon Bedrock, Google Cloud, Microsoft Foundry e em roteadores de terceiros como OpenRouter.
Quais são os IDs de modelo na API para GPT-6 Astra e Claude Fable 5.1?
Os IDs de modelo são gpt-6-astra para a OpenAI e claude-fable-5-1 para a Anthropic. No Amazon Bedrock, o Claude Fable 5.1 é anthropic.claude-fable-5-1. Observe que três comportamentos da API do Fable 5.1 mudaram em relação ao Fable 5: seleção forçada de ferramenta retorna 400, modelos anteriores não leem seus blocos de thinking, e recusas chegam como HTTP 200 com stop_reason: "refusal".
Editor de Ciência de Dados @ DataCamp | Fazer previsões e construir com APIs é a minha paixão.
