course
OpenAI har precis utökat GPT‑6-familjen med två nya modeller: GPT‑6 Sol och GPT‑6 Luna, båda placerade under flaggskeppet GPT‑6 Astra, som vi skrev om tidigare i månaden. Både Sol och Luna kommer med kraftiga prissänkningar (50% lägre än deras GPT‑5.6-priser), och de har dessutom förbättringar inom kodning och arbetsflödesautomatisering.
Av en slump eller inte släppte Anthropic Claude Opus 5.5 samma dag (i dag), med ett liknande budskap: samma underliggande träningsupplägg som flaggskeppet, optimerat för kostnad och hastighet.
För att lära dig mer om flaggskeppet de sorterar under, kolla in vår GPT‑6 Astra API-guide och vår jämförelse mellan GPT‑6 Astra och Claude Fable 5.1.
Sammanfattning
- GPT‑6 Sol och Luna är de två nivåerna under Astra, tränade med samma recept och prissatta till hälften av sina GPT‑5.6-föregångare.
- Den stora vinsten är kostnad per uppgift för agent- och kodningsarbete, inte rå kapacitet. Nästan alla resultat som OpenAI rapporterar är kostnadsjusterade.
- GPT-6 Sol gör ungefär hälften så många faktamissar som GPT‑5.6 Sol; Luna förbättras också, men ligger fortfarande efter Sol i tillförlitlighet.
- Välj Sol för agentarbetsflöden och kodning, och Luna för högvolym i rutinjobb. Välj Astra bara när uppgiften motiverar priset.
- Om du redan använder GPT‑5.6 Sol eller Luna, byt för prisets skull; i vårt praktiska test var kapacitetssprånget litet och märktes mest som ärlighet kring en trasig indata.
Vad är GPT‑6 Sol och Luna?
Astra är fortfarande OpenAIs mest kapabla och mest alignade modell, reserverad för de mest krävande uppgifterna. Men Sol och Luna är byggda för att ta mycket av samma träningsupplägg, och en stor del av den resulterande prestandan i kodning, datoranvändning osv., ner till billigare och snabbare nivåer.
Tänk på det som samma relation som Opus 5.5 har till Fable 5.1: inte en ny frontlinje, men frontlinjenära prestanda till en bråkdel av kostnaden.
Nyckelfunktioner i GPT‑6 Sol och Luna
Några saker värda att notera:
Betydligt billigare, rakt igenom
Sols API-pris är hälften av vad det var tidigare. Lunas pris är till och med lite mindre än hälften. Du kan se fler detaljer i prisavsnittet.
Starka resultat på affärsarbetsflöden
På AutomationBench, som testar agenter inom sälj, marknadsföring, drift, support, ekonomi och liknande, överträffar Sol på sin högsta ansträngningsnivå Claude Opus 5, och gör det till en bråkdel av Opus 5:s kostnad per uppgift. Luna förbättrades också avsevärt jämfört med sin GPT‑5.6-föregångare samtidigt som den blev märkbart billigare per uppgift. OpenAI inkluderade en snygg visualisering, som jag återskapat här:

Jag lade märke till att diagrammet inte inkluderade Opus 5.5-siffrorna som Anthropic rapporterade i meddelandet om Opus 5.5, så jag lade till ett nytt set linjer. Vi kan se att de senaste versionerna av Sol och Luna fortfarande är mest effektiva. Troligen var den enda anledningen till att OpenAI inte tog med denna information i sin lanseringstext tajmningen. Opus 5.5 släpptes bara en timme tidigare.
Kodningsvinster som följer kostnaden, inte bara noggrannhet
På FrontierCode beskrivs Sol som ungefär likvärdig med Claude Fable 5.1:s toppresultat, men till ett mycket lägre pris. På ett separat kodningsbenchmark (DeepSWE) närmar sig Sol Fable 5:s bästa resultat med stor kostnadsrabatt, och Luna positioneras som jämförbar med Opus 5 och Fable 5 vid mellannivå av ansträngning.
Färre faktamissar
OpenAI säger att Sol ungefär halverar felandelen jämfört med sin föregångare på en intern faktakontroll byggd från verkliga konversationer där användare flaggade fel. Luna förbättrades också, och OpenAI hävdar att den kan matcha GPT‑5.6 Sols faktakorrekthet till en liten bråkdel av kostnaden när den körs på högre ansträngning. Detta var dock svårare att verifiera.
En mindre pladdrig skrivstil
Astras mer koncisa, mindre jargongtunga stil har förts över till Sol och Luna. OpenAI har fortsatt att optimera modellerna för samtalsstil ända sedan 4o fick mycket kritik för att vara inställsam.
Billigare, smartare caching för agenter
Utöver per-token-prissättning lyfter OpenAI fram förbättringar av prompt-caching avsedda att hjälpa agenter och långa konversationer att återanvända kontext mer effektivt, med rabatter på cirka 90% på cachade indataläsningar. Nya instrumentpaneler och diagnostik ska hjälpa utvecklare att se var caching fungerar och inte fungerar.
Färre vilseledande påståenden om sitt eget arbete
Båda modellerna är mindre benägna än sina GPT‑5.6-motsvarigheter att felaktigt återge vad de gjorde i en kodningsuppgift.
OpenAIs alignmentutvärderingar, körda på maximal ansträngning, sätter medvetet upp situationer som inbjuder till oärlighet, och Sol och Luna uppvisar lägre frekvens av vilseledning än GPT‑5.6 Sol och Luna på testerna för kodningsbedrägeri, trasig sökning, granskarrundning, varningskringgående och obehörig interaktion.
OpenAI betonar att detta är adversariala upplägg, inte felgrader vid normal användning, och publicerar fullständiga resultat i GPT‑6 systemkort.
Hur presterar GPT‑6 Sol och Luna på benchmarktester?
OpenAIs eget släpp lutar sig tungt mot kostnadsjusterade jämförelser. Tidigare nämnde jag Sols AutomationBench-prestation. OpenAI säger inte bara att den är "bättre än Opus 5" utan också att den är bättre och ungefär elva gånger billigare per uppgift.
Det är också värt att påpeka att OpenAIs egna siffror visar att Astra fortfarande ligger före Sol och Luna i datoranvändningsuppgifter, och att vissa jämförelser mot Claude-modeller använder olika ansträngningsnivåer på respektive sida (t.ex. Sol på "xhigh" mot Opus 5 på "medium"), vilket gör effektivitetsanspråken genuint starka men råa kapacitetsjämförelser lite svårare att fästa.
Med det förbehållet på plats följer här vad OpenAI rapporterade, grupperat efter vilken sorts arbete varje benchmark representerar.
Affärsarbetsflöden och agenter
Sols starkaste resultat är på AutomationBench, Zapiers test av agenter som jobbar end-to-end över 47 verktyg inom sälj, marknad, drift, support, ekonomi och HR. GPT‑6 Sol på xhigh ansträngning får 33,2% till $0,27 per uppgift, före Claude Opus 5 på maxansträngning och till och med före lågansträngningsläget på GPT‑6 Astra, och till en liten bråkdel av Opus 5:s kostnad per uppgift.

Raden för Fable 5.1 är den att läsa noga. OpenAI listar Claude Fable 5.1 med Opus 5 som fallback strax under Sol, men fallbacken aktiverades i ungefär 40% av uppgifterna, och dess kostnad ingår inte i den rapporterade siffran.
| Modell (och ansträngning) | AutomationBench-poäng | Kostnad per uppgift |
|---|---|---|
| GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
| GPT‑6 Astra (low) | 30.3% | 3.9x GPT‑6 Sol |
| Claude Fable 5.1 med Opus 5 fallback (max) | 31.4% | Mer än 8.9x GPT‑6 Sol (fallbackkostnad ej rapporterad) |
| Claude Opus 5 (max) | 26.9% | 11.1x GPT‑6 Sol |
Lunas historia på samma benchmark är generationspräglad. På hög ansträngning förbättras GPT‑6 Luna över GPT‑5.6 Luna med 5,4 procentenheter till 58% lägre kostnad per uppgift.
På Agents' Last Exam, som utvärderar agenter i långsiktiga professionella arbetsflöden över 55 delbranscher, får GPT‑6 Sol på maxansträngning 56,4%. OpenAI säger att detta ligger över Claude Opus 5:s bästa resultat i utvärderingen, till 60% lägre kostnad per uppgift.
Kodning i verkliga kodbaser
På DeepSWE v1.1, som testar agenter på långsiktiga mjukvaruingenjörsuppgifter i riktiga repos, får GPT‑6 Sol på maxansträngning 68,8%. Claude Fable 5:s bästa resultat i utvärderingen är 69,9% på xhigh ansträngning, så Sol landar 1,1 poäng bakom till ungefär 80% lägre kostnad per uppgift.
GPT‑6 Luna på maxansträngning får 66,6% på samma benchmark, vilket OpenAI kallar jämförbart med Claude Opus 5 och Fable 5 på medium ansträngning. Luna kostar 93% mindre per uppgift än Opus 5 och 96% mindre än Fable 5 i dessa jämförelser.
Oberoende siffror är blygsamma hittills. Artificial Analysis sätter GPT‑6 Sol på 57 på sitt Coding Agent Index mot 55 för GPT‑5.6 Sol, och på 48 mot 47 på sitt Intelligence Index, med uppskattad kostnad per uppgift fallande från $1,99 till $1,06.
Faktuell tillförlitlighet
OpenAIs interna faktakontroll är byggd från avidentifierade ChatGPT-konversationer där användare flaggade ett faktafel från en tidigare modell. På den uppsättningen gör GPT‑6 Sol ungefär hälften så många misstag som GPT‑5.6 Sol, och GPT‑6 Luna på högre ansträngning matchar GPT‑5.6 Sol till ungefär en hundradel av kostnaden.
Artificial Analysis AA-Omniscience pekar åt samma håll, med ett förbehåll: Sols hallucinationsgrad föll från 92% för GPT‑5.6 Sol till 60%, men den besvarade bara 83% av frågorna mot 99% för sin föregångare, så en del av vinsten kommer av att avstå från att svara. Lunas hallucinationsgrad på samma test var 77%.
Datoranvändning
Astra är fortfarande OpenAIs bästa modell för datoranvändning, och inlägget säger det också. På OSWorld 2.0 offline får GPT‑6 Sol på xhigh ansträngning 60,5% mot 60,3% för Claude Opus 5 på medium, till ungefär 80% lägre kostnad per uppgift. GPT‑6 Luna på max överträffar GPT‑5.6 Sol på medium till en tiondel av dess kostnad.
Vilken nivå ska du använda?
Sol är standardvalet för de flesta utvecklar- och agentjobb, Luna är för volym, och Astra är för projekt där ett felaktigt svar kostar mer än tokenkostnaden. GPT‑6-familjen har nu tre nivåer som delar träningsrecept men skiljer sig i djup, hastighet och pris.

Alla tre exponerar samma resonemangssteg i API:t: none, low, medium, high, xhigh och max för Sol och Luna, med Astra som börjar på low. Högre steg spenderar fler tokens på resonemang, och de flesta av OpenAIs rubrikresultat kördes på xhigh eller max.
GPT‑6 låter dig också ändra ansträngning mitt i en konversation utan att ogiltigförklara prompt-cachen, så en agent kan köra billiga uppföljningar på låg ansträngning och bara eskalera de svåra stegen.
| Användningsfall | Nivå | Varför |
|---|---|---|
| Flerstegagenter över affärsappar | Sol | Leder AutomationBench och Agents' Last Exam till en bråkdel av rivalernas kostnad per uppgift |
| Kodningsagenter som producerar merg:bara ändringar | Sol | Avsevärd FrontierCode-vinst över GPT‑5.6 Sol; nära Fable 5 på DeepSWE till mycket lägre kostnad |
| Faktatungt skrivande och forskningssammanfattningar | Sol | Ungefär hälften så många faktamissar som sin föregångare |
| Klassificering, extraktion och routning i volym | Luna | $0.10 indata och $0.50 utdata per 1M tokens, och den matchar nu GPT‑5.6 Sol i faktakorrekthet på högre ansträngning |
| Datoranvändning på Free- eller Go-plan | Luna | Den enda GPT‑6-modell de planerna får |
| Långsiktig datoranvändning och det svåraste end-to-end-arbetet | Astra | Fortfarande OpenAIs bästa rakt igenom, till $10 indata och $50 utdata per 1M tokens |
En brasklapp om Luna: Artificial Analysis mätte att den producerade 51 000 utdatatokens per uppgift mot 41 000 för GPT‑5.6 Luna, så i arbetslaster där du inte begränsar utdata blir prissänkningen mindre än etiketten antyder.
Test av GPT‑6 Sol och Luna: praktiska exempel
Benchmarksen ovan är OpenAIs egna, så jag körde en bygguppgift mot alla fyra modeller med identisk prompt och identiska verktyg.
Uppgiften: en enkel HTML‑visualiserare för Dijkstras algoritm i en fil, som animerar en kantgranskning var 400 ms tills målet stabiliseras, med tydliga nodtillstånd, paus/stegring/omstart-kontroller och en slutlig distanstabell. Ingen byggstegring, inga beroenden, inget nätverk.
Det verkliga testet låg i datafilen. Den innehåller tre grafer:
- En normal (bara positiva vikter, målet nåbart)
- En där målet inte går att nå
- En som innehåller en negativ vikt, vilket gör Dijkstra oanvändbar (skulle fastna i en oändlig loop)
Prompten nämner aldrig fällorna. Att upptäcka dem är poängen, och det prövar två lanseringspåståenden samtidigt: FrontierCode‑förbättringen över GPT‑5.6 och den lägre takten av vilseledande påståenden om kodningsarbete.
Alla fyra kördes i OpenCode med låst verktygsuppsättning (endast filläsning och redigering), samma resonemangsansträngning, ett försök, ny session, prompt levererad byte för byte.
Här är ett exempel på vad GPT‑6 Sol producerade för den normala grafen:
Huvudfynden:
- På den rena grafen skilde sig ingen åt. Alla fyra levererade en fungerande fil, hittade rätt väg med distans 24, stabiliserade noder i ordning och byggde läsbara kontroller som fick plats på en skärm. Full pott rakt igenom på trohet och layout.
- Det onåbara målet fällde inte någon heller. Alla fyra terminerade på egen hand och lät de två ö-noderna stå på oändlighet.
- Scenario 3 är hela resultatet. Varje modell upptäckte den negativa kanten. Endast GPT‑6 Sol behandlade den som ett skäl att stoppa: den angav på skärmen att en odirigerad negativ kant gör kortaste promenader odefinierade och vägrade att köra.
Låt oss titta närmare. GPT‑6 Sol vägrade köra algoritmen på grund av den negativa vikten och levererade ett mycket synligt rött felmeddelande.

GPT‑5.6 Sol flaggade den negativa vikten i en varning i stället, och körde sedan algoritmen ändå, markerade en väg och fyllde i distanstabellen som om svaret vore giltigt. En varning bredvid ett felaktigt svar är fortfarande ett felaktigt svar. GPT‑5.6 Luna gjorde samma sak.

GPT‑6 Luna hamnade mittemellan: en banner som namnger kanten och säger att Dijkstra inte är tillämplig, sedan en distanstabell med negativa oändligheter. Försvarbart för en odirigerad negativ kant, men svårläst.

Så är GPT‑6 ett verkligt steg upp? Knappast, och bara på en sak, även om den är viktig. På själva bygguppgiften blir det oavgjort. Skillnaden ligger helt i hur varje modell hanterade en indata den visste var trasig, vilket mappar mot OpenAIs ärlighetspåstående snarare än kodningspåståendet. De två Luna skilde sig inte alls.
Den andra lärdomen handlar om testet: när fyra modeller klarar alla sonder utom en, behöver ribban höjas.
Priser och tillgänglighet för GPT‑6 Sol och Luna
Här är en titt på den nya kostnadsstrukturen. Båda sänkningarna motsvarar 50% prisreduktion jämfört med respektive modells GPT‑5.6-prissättning.
| Per 1M tokens | GPT‑6 Sol | GPT‑5.6 Sol | GPT‑6 Luna | GPT‑5.6 Luna |
|---|---|---|---|---|
| Indata | $2 | $4 | $0.10 | $0.20 |
| Utdata | $10 | $20 | $0.50 | $1.20 |
Cachade indatatoken-läsningar rabatteras 90% på GPT‑6, så på långa agentkörningar spelar cacheträffsfrekvensen lika stor roll som listpriset. OpenAIs lanseringsinlägg publicerar inte batchpriser för någon av modellerna, och de ligger båda under GPT‑6 Astras $10 indata och $50 utdata.
De enda åtkomstvillkoren i OpenAIs lanseringsinlägg är plan och produktyta, vilket är där bilden blir specifik.
Hur får du tillgång till GPT‑6 Sol och Luna?
GPT‑6 Sol och Luna finns redan tillgängliga på många plattformar:
-
ChatGPT Work och Codex för Plus-, Pro-, Business-, Enterprise- och Edu-användare, där Luna också når Free- och Go-användare i skrivbordsappen.
-
I API:t är de tillgängliga som
gpt-6-solochgpt-6-luna. OpenAI noterar att utrullningen i ChatGPT sker stegvis under dagen, så det kan ta ett tag innan de syns för alla. -
Dessutom finns båda modellerna via OpenRouter (som
openai/gpt-6-solochopenai/gpt-6-luna), i GitHub Copilot, på Azure AI Foundry och på AWS Bedrock.
I API:t är de tillgängliga som gpt-6-sol och gpt-6-luna. OpenAI noterar att utrullningen i ChatGPT sker stegvis under dagen, så det kan ta ett tag innan de syns för alla. En minimal anrop ser ut så här:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-sol",
reasoning={"effort": "high"},
input="List the open pull requests that touch billing code and summarize the risk of each.",
)
print(response.output_text)
Om du migrerar från GPT‑5.6 säger OpenAIs GPT‑6-modellvägledning, skriven mot Astra, att du ska ta bort temperature och top_p, börja på low om du använde none eller minimal och i övrigt behålla din nuvarande ansträngningsnivå, samt byta prompt_cache_retention till prompt_cache_options.ttl satt till 30 minuter.
Avslutande tankar
Sol och Luna tar träningsreceptet bakom flaggskeppet Astra och använder det för att göra nivån under dramatiskt billigare och snabbare. OpenAIs släpp är anmärkningsvärt villigt att namnge Anthropics modeller direkt och hävda segrar på kostnadsjusterade benchmarks. Det är en intressant jämförelse eftersom Opus 5.5 också är en effektivitetsvinst.
Min tolkning: om du kör agent- eller kodningsarbetslaster på GPT‑5.6 Sol eller Luna, byt nu. Samma ansträngningsstege, halva priset, och i vårt test var den ena sak GPT‑6 Sol gjorde som dess föregångare inte gjorde att vägra ge ett självsäkert svar på en fråga som algoritmen inte kunde besvara. Om du använder Claude är de kostnadsjusterade siffrorna argumentet för att köra din egen jämförelse snarare än att ta OpenAIs ord för det.
Om du är sugen på att bygga på dessa modeller rekommenderar jag OpenAI Fundamentals-skilltracken, som täcker API:t från början till slut på 15 timmar.
GPT-6 Sol och Luna – vanliga frågor
Vad är GPT‑6 Sol och Luna, och hur förhåller de sig till GPT‑6 Astra?
Det är två nya tillskott i GPT‑6-familjen, placerade under Astra (OpenAIs toppmodell) i pris-/kapacitetsnivån. De använder liknande träningsmetoder som Astra men är optimerade för lägre kostnad och snabbare svar, avsedda för vardagliga uppgifter snarare än de mest krävande projekt som Astra är reserverad för.
Hur mycket billigare är de än föregående generation?
Båda modellerna kostar 50% mindre än deras GPT‑5.6‑kampanjpriser. Konkret: Sol gick från $4/$20 till $2/$10 per miljon in-/utdatatokens, och Luna gick från $0.20/$1.20 till $0.10/$0.50 per miljon tokens.
Hur presterar de mot konkurrenter som Claude?
OpenAI hävdar stark kostnadseffektivitet — till exempel på AutomationBench ska GPT‑6 Sol på hög ansträngning överträffa Claude Opus 5 till en bråkdel av kostnaden per uppgift. Liknande jämförelser görs på kodning (FrontierCode, DeepSWE) och datoranvändning (OSWorld), där man i allmänhet betonar bättre eller jämförbara poäng till avsevärt lägre kostnad. Observera att detta är OpenAIs egna rapporterade benchmarks, och konkurrentsiffror hämtas från offentliga rapporter snarare än OpenAIs egna tester.
Vilka förbättringar gjordes för caching och alignment?
Cachingförbättringar siktar på högre cacheträffsfrekvenser som standard (med upp till 90% rabatt på cachade indatatokens), plus nya verktyg som en caching‑instrumentpanel och justerbar resonemangsansträngning/verktygsinställningar som bevarar cache. När det gäller alignment visar båda modellerna enligt uppgift förbättrade ärlighetsmått (t.ex. lägre frekvens av vilseledande påståenden om kodningsarbete) jämfört med sina GPT‑5.6‑föregångare.
När och var kan jag få tillgång till dessa modeller?
De finns tillgängliga omedelbart i ChatGPT Work och Codex för Plus-, Pro-, Business-, Enterprise- och Edu‑användare, där Luna också finns för Free/Go‑användare i skrivbordsappen. Via API:t nås de som gpt-6-sol och gpt-6-luna. De finns ännu inte i den vanliga konsumentnivån av ChatGPT, och utrullningen sker gradvis under dagen.
Ska jag använda GPT‑6 Sol eller GPT‑6 Luna?
Välj Sol för agentarbetsflöden, kodning i verkliga kodbaser och faktatungt professionellt arbete; det är nivån som OpenAIs AutomationBench-, DeepSWE- och faktakontrollresultat kretsar kring. Välj Luna för högvolym och kostnadskänsliga jobb som klassificering, extraktion och routning, där dess $0.10 indata och $0.50 utdata per miljon tokens väger tyngre än toppkapacitet. Luna är också den enda GPT‑6‑modellen som finns för Free- och Go‑användare i ChatGPT:s skrivbordsapp.
