course
OpenAI właśnie rozszerzył rodzinę GPT‑6 o dwa nowe modele: GPT‑6 Sol i GPT‑6 Luna, oba pozycjonowane poniżej flagowego GPT‑6 Astra, o którym pisaliśmy na początku miesiąca. Zarówno Sol, jak i Luna oferują duże obniżki cen (50% względem cen GPT‑5.6), a do tego zyski w obszarach kodowania i automatyzacji przepływów pracy.
Przypadek czy nie, Anthropic tego samego dnia (dziś) wypuścił Claude Opus 5.5 z podobnym przekazem: ta sama bazowa metoda treningu co model flagowy, zoptymalizowana pod kątem kosztów i szybkości.
Aby dowiedzieć się więcej o flagowcu, pod którym się plasują, sprawdź nasz samouczek API GPT‑6 Astra oraz porównanie GPT‑6 Astra i Claude Fable 5.1.
TL;DR
- GPT‑6 Sol i Luna to dwa poziomy poniżej Astra, trenowane według tej samej receptury i wycenione na połowę cen ich odpowiedników GPT‑5.6.
- Największy zysk to koszt na zadanie przy pracy agentów i w kodowaniu, a nie czysta „moc”. Niemal każdy wynik raportowany przez OpenAI jest skorygowany o koszt.
- GPT‑6 Sol popełnia około połowę błędów faktograficznych GPT‑5.6 Sol; Luna też się poprawia, ale wciąż ustępuje Sol pod względem niezawodności.
- Sięgaj po Sol do przepływów agentów i kodowania, a po Lunę do rutynowych zadań o dużej skali. Wybierz Astrę tylko wtedy, gdy zadanie uzasadnia jej cenę.
- Jeśli już używasz GPT‑5.6 Sol lub Luna, zmień dla ceny; w naszym teście „hands-on” skok możliwości był niewielki i objawił się szczerością wobec wadliwego wejścia.
Czym są GPT‑6 Sol i Luna?
Astra pozostaje najbardziej zaawansowanym i najlepiej „wyjustowanym” modelem OpenAI, zarezerwowanym do najbardziej wymagających zadań. Natomiast Sol i Luna mają przenieść większość tej samej metody treningu i znaczną część wynikającej z niej wydajności w kodowaniu, obsłudze komputera itd. do tańszych, szybszych poziomów.
Pomyśl o nich jak o relacji między Opus 5.5 a Fable 5.1: to nie nowa granica, lecz wydajność blisko granicy, za ułamek kosztu.
Kluczowe cechy GPT‑6 Sol i Luna
Warto zwrócić uwagę na kilka rzeczy:
Wyraźnie tańsze, na całej linii
Cena API dla Sol spadła o połowę. Dla Luny nawet nieco bardziej niż o połowę. Więcej szczegółów znajdziesz w sekcji o cenach.
Mocny wynik w przepływach biznesowych
W AutomationBench, który testuje agentów w obszarach sprzedaży, marketingu, operacji, wsparcia, finansów i podobnych, Sol przy najwyższym ustawieniu wysiłku wyprzedza Claude Opus 5, i to przy ułamku jego kosztu na zadanie. Luna także znacząco poprawiła wynik względem GPT‑5.6, jednocześnie wyraźnie taniejąc per zadanie. OpenAI dołączył ładną wizualizację, którą tu odtworzyłem:

Zauważyłem, że wykres nie obejmuje wartości Opus 5.5 raportowanych przez Anthropic w zapowiedzi Opus 5.5, więc dodałem nowy zestaw linii. Widać, że najnowsze wersje Sol i Luna nadal są najwydajniejsze kosztowo. Prawdopodobnie jedynym powodem, dla którego OpenAI nie uwzględnił tych danych w swoim ogłoszeniu, był timing. Opus 5.5 pojawił się zaledwie godzinę wcześniej.
Zyski w kodowaniu, które nadążają za kosztem, nie tylko za dokładnością
W FrontierCode Sol jest opisywany jako mniej więcej dorównujący najwyższemu wynikowi Claude Fable 5.1, ale przy znacznie niższej cenie. W osobnym benchmarku kodowania (DeepSWE) Sol zbliża się do najlepszego wyniku Fable 5 przy dużej zniżce kosztowej, a Luna jest pozycjonowana jako porównywalna z Opus 5 i Fable 5 przy średnich ustawieniach wysiłku.
Mniej błędów faktograficznych
OpenAI podaje, że Sol mniej więcej o połowę ogranicza liczbę błędów względem poprzednika w wewnętrznym teście faktografii zbudowanym z prawdziwych rozmów, w których użytkownicy oznaczyli pomyłki. Luna też się poprawiła; OpenAI twierdzi, że przy wyższym wysiłku może dorównać faktografii GPT‑5.6 Sol, i to za ułamek kosztu. Tego było trudniej zweryfikować.
Mniej rozwlekły styl pisania
Bardziej zwięzły, mniej żargonowy styl komunikacji Astry trafił do Sol i Luny. OpenAI od czasu 4o, który zebrał sporo krytyki za „przymilność”, konsekwentnie optymalizuje styl konwersacji swoich modeli.
Tańsze, sprytniejsze cache'owanie dla agentów
Poza ceną za token OpenAI podkreśla usprawnienia w cache'owaniu promptów, które mają pomóc agentom i długim rozmowom efektywniej ponownie wykorzystywać kontekst, z rabatem ok. 90% na odczyty z cache. Nowe pulpity i diagnostyka mają pomóc deweloperom widzieć, gdzie cache działa, a gdzie nie.
Mniej wprowadzających w błąd twierdzeń o własnej pracy
Oba modele rzadziej niż ich odpowiedniki GPT‑5.6 przekłamują to, co zrobiły w zadaniu programistycznym.
Ewaluacje alignmentu OpenAI, uruchamiane przy maksymalnym wysiłku, celowo tworzą sytuacje sprzyjające nieszczerości, a Sol i Luna notują niższe wskaźniki „oszustwa” niż GPT‑5.6 Sol i Luna w testach: deception w kodowaniu, uszkodzone wyszukiwanie, omijanie recenzenta, obchodzenie ostrzeżeń i nieautoryzowane interakcje.
OpenAI podkreśla, że to ustawienia „adwersarialne”, a nie wskaźniki porażek w typowym użyciu, i publikuje pełne wyniki w karcie systemowej GPT‑6.
Jak wypadają GPT‑6 Sol i Luna w benchmarkach?
Sam materiał OpenAI mocno opiera się na porównaniach skorygowanych o koszt. Wspomniałem wcześniej o wyniku Sol w AutomationBench. OpenAI nie mówi tylko, że jest „lepszy niż Opus 5”, ale że jest lepszy i mniej więcej 11 razy tańszy per zadanie.
Warto też zaznaczyć, że liczby OpenAI pokazują, iż Astra wciąż wyprzedza Sol i Lunę w zadaniach „computer-use”, oraz że niektóre porównania z modelami Claude używają różnych ustawień wysiłku po obu stronach (np. Sol na „xhigh” vs Opus 5 na „medium”), co sprawia, że twierdzenia o efektywności są naprawdę mocne, ale porównania czystych możliwości trochę trudniejsze do przypięcia.
Mając to zastrzeżenie, oto co raportuje OpenAI, pogrupowane wg rodzaju pracy, którą reprezentuje dany benchmark.
Przepływy biznesowe i agenci
Najmocniejszy wynik Sol pada w AutomationBench, teście Zapiera dla agentów działających end-to-end w 47 narzędziach w sprzedaży, marketingu, operacjach, wsparciu, finansach i HR. GPT‑6 Sol przy wysiłku xhigh osiąga 33,2% przy koszcie $0,27 na zadanie, wyprzedzając Claude Opus 5 przy maksymalnym wysiłku, a nawet GPT‑6 Astra przy niskim wysiłku, i to za ułamek kosztu Opus 5 na zadanie.

Wiersz Fable 5.1 to ten, który trzeba czytać uważnie. OpenAI podaje Claude Fable 5.1 z fallbackiem do Opus 5 tuż poniżej Sol, ale fallback uruchomił się w ok. 40% zadań, a jego koszt nie jest uwzględniony w raporcie.
| Model (i wysiłek) | Wynik w AutomationBench | Koszt na zadanie |
|---|---|---|
| GPT‑6 Sol (xhigh) | 33.2% | $0.27 |
| GPT‑6 Astra (low) | 30.3% | 3.9x GPT‑6 Sol |
| Claude Fable 5.1 z fallbackiem do Opus 5 (max) | 31.4% | Więcej niż 8.9x GPT‑6 Sol (koszt fallbacku niepodany) |
| Claude Opus 5 (max) | 26.9% | 11.1x GPT‑6 Sol |
Historia Luny w tym samym benchmarku jest międzypokoleniowa. Przy wysokim wysiłku GPT‑6 Luna poprawia wynik GPT‑5.6 Luna o 5,4 pp przy 58% niższym koszcie na zadanie.
W Agents' Last Exam, który ocenia agentów w długoterminowych profesjonalnych przepływach pracy w 55 subbranżach, GPT‑6 Sol przy maksymalnym wysiłku osiąga 56,4%. OpenAI podaje, że to powyżej najlepszego wyniku Claude Opus 5 w tym teście, przy 60% niższym koszcie na zadanie.
Kodowanie w prawdziwych bazach kodu
W DeepSWE v1.1, który sprawdza agentów w długoterminowych zadaniach inżynierii oprogramowania w realnych repozytoriach, GPT‑6 Sol przy maksymalnym wysiłku osiąga 68,8%. Najlepszy wynik Claude Fable 5 w teście to 69,9% przy xhigh, więc Sol ląduje 1,1 pkt za nim, przy ok. 80% niższym koszcie na zadanie.
GPT‑6 Luna przy maksymalnym wysiłku zdobywa 66,6% w tym samym benchmarku; OpenAI określa to jako porównywalne z Claude Opus 5 i Fable 5 przy średnim wysiłku. Luna kosztuje o 93% mniej na zadanie niż Opus 5 i o 96% mniej niż Fable 5 w tych porównaniach.
Niezależne liczby są na razie umiarkowane. Artificial Analysis lokuje GPT‑6 Sol na poziomie 57 w swoim Coding Agent Index wobec 55 dla GPT‑5.6 Sol, oraz 48 wobec 47 w Intelligence Index, przy szacowanym koszcie na zadanie spadającym z $1,99 do $1,06.
Rzetelność faktograficzna
Wewnętrzna ewaluacja faktografii OpenAI bazuje na zanonimizowanych rozmowach ChatGPT, w których użytkownicy oznaczyli błąd faktograficzny wcześniejszego modelu. Na tym zbiorze GPT‑6 Sol popełnia około połowę błędów GPT‑5.6 Sol, a GPT‑6 Luna przy wyższym wysiłku dorównuje GPT‑5.6 Sol przy koszcie około setnej części.
Test AA-Omniscience Artificial Analysis wskazuje w tym samym kierunku, z zastrzeżeniem: wskaźnik halucynacji Sol spadł z 92% dla GPT‑5.6 Sol do 60%, ale model odpowiedział tylko na 83% pytań wobec 99% u poprzednika, więc część zysku wynika z odmowy odpowiedzi. Wskaźnik halucynacji Luny w tym teście wyniósł 77%.
Obsługa komputera
Astra wciąż jest najlepszym modelem OpenAI do zadań „computer-use” i wpis tak mówi. W OSWorld 2.0 offline GPT‑6 Sol przy xhigh uzyskuje 60,5% wobec 60,3% Claude Opus 5 przy medium, przy ok. 80% niższym koszcie na zadanie. GPT‑6 Luna przy max przewyższa GPT‑5.6 Sol przy medium, za jedną dziesiątą jego kosztu.
Który poziom wybrać?
Sol to domyślny wybór dla większości zadań deweloperskich i agentowych, Luna jest na wolumen, a Astra na projekty, w których błędna odpowiedź kosztuje więcej niż tokeny. Rodzina GPT‑6 ma teraz trzy poziomy, które dzielą recepturę treningu, a różnią się głębokością, szybkością i ceną.

Wszystkie trzy w API udostępniają tę samą „drabinę rozumowania”: none, low, medium, high, xhigh i max dla Sol i Luny, a Astra startuje od low. Wyższe szczeble zużywają więcej tokenów na rozumowanie i większość wyników na nagłówki OpenAI uruchamiano na xhigh lub max.
GPT‑6 pozwala też zmieniać wysiłek w trakcie rozmowy bez unieważniania cache'u promptu, więc agent może wykonywać tanie follow‑upy przy niskim wysiłku i eskalować tylko trudne kroki.
| Przypadek użycia | Poziom | Dlaczego |
|---|---|---|
| Wielostopniowi agenci w aplikacjach biznesowych | Sol | Lider AutomationBench i Agents' Last Exam za ułamek kosztu konkurencji na zadanie |
| Agenci kodujący wprowadzający zmiany możliwe do zmergowania | Sol | Znaczący zysk w FrontierCode względem GPT‑5.6 Sol; blisko Fable 5 w DeepSWE przy dużo niższym koszcie |
| Tworzenie tekstów i podsumowań badań opartych na faktach | Sol | Około połowa błędów faktograficznych poprzednika |
| Klasyfikacja, ekstrakcja i routing na dużą skalę | Luna | $0.10 za wejście i $0.50 za wyjście na 1M tokenów; przy wyższym wysiłku dorównuje teraz faktografii GPT‑5.6 Sol |
| Obsługa pulpitu w planie Free lub Go | Luna | Jedyny model GPT‑6 dostępny w tych planach |
| Długoterminowa obsługa komputera i najtrudniejsze zadania end‑to‑end | Astra | Nadal najlepszy model OpenAI w przekroju, przy $10 za wejście i $50 za wyjście na 1M tokenów |
Jedna uwaga o Lunie: Artificial Analysis zmierzył, że generuje 51 000 tokenów wyjściowych na zadanie wobec 41 000 dla GPT‑5.6 Luna, więc w obciążeniach, gdzie nie limitujesz wyjścia, obniżka ceny jest mniejsza niż sugeruje etykieta.
Testy GPT‑6 Sol i Luna: przykłady „hands‑on”
Powyższe benchmarki pochodzą od OpenAI, więc uruchomiłem jedno zadanie budowy we wszystkich czterech modelach z identycznym promptem i identycznymi narzędziami.
Zadanie: jednoplilkowy wizualizator algorytmu Dijkstry, animujący jedno sprawdzenie krawędzi co 400 ms aż do ustalenia celu, z wyróżnionymi stanami węzłów, kontrolkami pauzy/kroku/restartu i końcową tabelą odległości. Bez kroku build, bez zależności, bez sieci.
Prawdziwy test był w pliku danych. Zawiera trzy grafy:
- Normalny (tylko dodatnie wagi, cel osiągalny)
- Taki, w którym celu nie da się osiągnąć
- Taki z ujemną wagą, co czyni Dijkstrę nieaplikowalnym (utknęłaby w nieskończonej pętli)
Prompt nie wspomina pułapek. Zauważenie ich to sedno i pozwala sprawdzić dwa twierdzenia na raz: zysk w FrontierCode względem GPT‑5.6 oraz spadek odsetka wprowadzających w błąd twierdzeń o pracy kodowej.
Wszystkie cztery uruchomiono w OpenCode z przypiętym zakresem narzędzi (tylko odczyt i edycja pliku), tym samym wysiłkiem rozumowania, jedną próbą, świeżą sesją, prompt dostarczony bajt‑w‑bajt.
Oto przykład, co GPT‑6 Sol wygenerował dla normalnego grafu:
Najważniejsze wnioski:
- Na czystym grafie nikt się nie rozdzielił. Wszystkie cztery dostarczyły działający plik, znalazły poprawną ścieżkę o długości 24, ustaliły węzły w odpowiedniej kolejności i zbudowały czytelne kontrolki mieszczące się na jednym ekranie. Pełne punkty za wierność i układ.
- Nieosiągalny cel też nikogo nie zaskoczył. Wszystkie cztery same zakończyły działanie i pozostawiły dwa wyspowe węzły w nieskończoności.
- Scenariusz 3 to cały wynik. Każdy model zauważył ujemną krawędź. Tylko GPT‑6 Sol potraktował to jako powód do zatrzymania: wyświetlił na ekranie, że niediagonalna ujemna krawędź czyni najkrótsze przejścia nieokreślonymi, i odmówił uruchomienia.
Przyjrzyjmy się bliżej. GPT‑6 Sol odmówił uruchomienia algorytmu z powodu ujemnej wagi i wyświetlił bardzo widoczny czerwony komunikat o błędzie.

GPT‑5.6 Sol zaznaczył ujemną wagę w ostrzeżeniu, a następnie i tak uruchomił algorytm, podświetlając ścieżkę i wypełniając tabelę odległości tak, jakby odpowiedź była poprawna. Ostrzeżenie obok złej odpowiedzi to wciąż zła odpowiedź. GPT‑5.6 Luna zrobiła to samo.

GPT‑6 Luna wylądowała pośrodku: baner z nazwaniem krawędzi i stwierdzeniem, że Dijkstra jest nieaplikowalna, a potem tabela odległości o wartościach minus nieskończoność. Do obrony w przypadku niediagonalnej ujemnej krawędzi, ale mylące w odbiorze.

Czy więc GPT‑6 to realny krok naprzód? Ledwie, i tylko w jednej kwestii, choć ważnej. W samym zadaniu budowy generacje są na remis. Różnica jest wyłącznie w tym, jak każdy model poradził sobie z wejściem, o którym wiedział, że jest wadliwe, co pokrywa się z tezą OpenAI o szczerości, a nie o umiejętnościach kodowych. Dwie Luny w ogóle się nie rozróżniły.
Druga lekcja dotyczy testu: kiedy cztery modele zdają wszystkie próby poza jedną, poprzeczkę trzeba podnieść.
Ceny i dostępność GPT‑6 Sol i Luna
Oto rzut oka na nową strukturę kosztów. Obie obniżki oznaczają 50% mniej względem cen promocyjnych GPT‑5.6 dla każdego modelu.
| Za 1M tokenów | GPT‑6 Sol | GPT‑5.6 Sol | GPT‑6 Luna | GPT‑5.6 Luna |
|---|---|---|---|---|
| Wejście | $2 | $4 | $0.10 | $0.20 |
| Wyjście | $10 | $20 | $0.50 | $1.20 |
Odczyty zcache'owanych tokenów wejściowych są na GPT‑6 rabatowane o 90%, więc przy długich przebiegach agentów wskaźnik trafień cache'u jest równie ważny jak cena „na metce”. W poście startowym OpenAI nie podaje stawek batch dla żadnego z modeli, a oba znajdują się poniżej $10 za wejście i $50 za wyjście GPT‑6 Astra.
Jedyne warunki dostępu wymienione przez OpenAI dotyczą planu i powierzchni produktu, i tu obraz się konkretyzuje.
Jak uzyskać dostęp do GPT‑6 Sol i Luna?
GPT‑6 Sol i Luna są już dostępne na wielu platformach:
-
ChatGPT Work i Codex dla użytkowników Plus, Pro, Business, Enterprise i Edu, przy czym Luna trafia też do użytkowników Free i Go w aplikacji desktopowej.
-
W API są dostępne jako
gpt-6-soligpt-6-luna. OpenAI zaznacza, że rollout w ChatGPT jest stopniowy w ciągu dnia, więc może chwilę potrwać, zanim pojawi się u wszystkich. -
Dodatkowo oba modele są dostępne przez OpenRouter (jako
openai/gpt-6-soliopenai/gpt-6-luna), w GitHub Copilot, na Azure AI Foundry oraz na AWS Bedrock.
W API są dostępne jako gpt-6-sol i gpt-6-luna. OpenAI zaznacza, że rollout w ChatGPT jest stopniowy w ciągu dnia, więc może chwilę potrwać, zanim pojawi się u wszystkich. Minimalne wywołanie wygląda tak:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-sol",
reasoning={"effort": "high"},
input="List the open pull requests that touch billing code and summarize the risk of each.",
)
print(response.output_text)
Jeśli migrujesz z GPT‑5.6, wytyczne modelowe GPT‑6, pisane pod Astrę, mówią, by porzucić temperature i top_p, zacząć od low, jeśli używałeś none lub minimal, w przeciwnym razie zachować obecny poziom wysiłku, oraz przełączyć prompt_cache_retention na prompt_cache_options.ttl ustawione na 30 minut.
Na zakończenie
Sol i Luna biorą recepturę treningową stojącą za flagową Astrą i wykorzystują ją, by uczynić niższy poziom dramatycznie tańszym i szybszym. W materiałach OpenAI wyraźnie pojawiają się bezpośrednie odniesienia do modeli Anthropica i roszczenia zwycięstw w benchmarkach skorygowanych o koszt. To ciekawe zestawienie, bo Opus 5.5 także wygrywa na efektywności.
Moja ocena: jeśli uruchamiasz agentów lub obciążenia kodowe na GPT‑5.6 Sol albo Luna, przełącz się teraz. Ta sama drabina wysiłku, połowa ceny, a w naszym teście jedyna rzecz, którą GPT‑6 Sol zrobił, a poprzednik nie, to odmowa podania pewnej odpowiedzi na pytanie, którego algorytm nie mógł rozwiązać. Jeśli jesteś na Claude, liczby skorygowane o koszt to argument, by zrobić własne porównanie zamiast brać słowo OpenAI za pewnik.
Jeśli chcesz budować na tych modelach, polecam ścieżkę OpenAI Fundamentals, która w 15 godzin obejmuje API od A do Z.
FAQ dotyczące GPT-6 Sol i Luna
Czym są GPT‑6 Sol i Luna i jak mają się do GPT‑6 Astra?
To dwa nowe dodatki do rodziny GPT‑6, plasujące się poniżej Astry (najwyższego modelu OpenAI) w tierze ceny/możliwości. Korzystają z podobnych metod treningu co Astra, ale są zoptymalizowane pod niższy koszt i szybszą odpowiedź, celując w codzienne zadania, a nie w najbardziej wymagające projekty zarezerwowane dla Astry.
O ile są tańsze względem poprzedniej generacji?
Oba modele kosztują o 50% mniej niż ich promocyjne ceny GPT‑5.6. Konkretnie: Sol spadł z $4/$20 do $2/$10 za milion tokenów wejścia/wyjścia, a Luna z $0,20/$1,20 do $0,10/$0,50 za milion tokenów.
Jak wypadają na tle konkurentów, jak Claude?
OpenAI deklaruje mocne wyniki efektywności kosztowej — na przykład w AutomationBench GPT‑6 Sol przy wysokim wysiłku ma wyprzedzać Claude Opus 5 za ułamek kosztu na zadanie. Podobne porównania pojawiają się w benchmarkach kodowania (FrontierCode, DeepSWE) i obsługi komputera (OSWorld), zazwyczaj podkreślając lepsze lub porównywalne wyniki przy znacząco niższym koszcie. Pamiętaj, że to dane raportowane przez OpenAI, a liczby konkurencji pochodzą z publicznych raportów, a nie z testów OpenAI.
Jakie usprawnienia wprowadzono w cache'owaniu i alignment?
Usprawnienia cache'owania celują w wyższe domyślne wskaźniki trafień (z rabatem do 90% na zcache'owane tokeny wejściowe), a także nowe narzędzia jak pulpit cache'owania i regulowany wysiłek rozumowania/ustawienia narzędzi, które zachowują cache. Jeśli chodzi o alignment, oba modele mają według raportów lepsze metryki szczerości (np. niższe wskaźniki wprowadzających w błąd twierdzeń o pracy kodowej) względem swoich poprzedników GPT‑5.6.
Kiedy i gdzie mogę uzyskać dostęp do tych modeli?
Są dostępne od razu w ChatGPT Work i Codex dla użytkowników Plus, Pro, Business, Enterprise i Edu, przy czym Luna jest też dostępna dla użytkowników Free/Go w aplikacji desktopowej. Przez API są dostępne jako gpt-6-sol i gpt-6-luna. Nie są jeszcze dostępne w standardowym konsumenckim tierze ChatGPT, a rollout odbywa się stopniowo w ciągu dnia.
Powinienem używać GPT‑6 Sol czy GPT‑6 Luna?
Używaj Sol do przepływów agentów, kodowania w realnych bazach kodu oraz pracy zawodowej opartej na faktach; to tier, wokół którego zbudowano wyniki OpenAI w AutomationBench, DeepSWE i faktografii. Używaj Luny do zadań o dużej skali i wrażliwych na koszt, takich jak klasyfikacja, ekstrakcja i routing, gdzie znaczenie ma $0,10 za wejście i $0,50 za wyjście na milion tokenów bardziej niż szczytowe możliwości. Luna jest też jedynym modelem GPT‑6 dostępnym dla użytkowników Free i Go w desktopowej aplikacji ChatGPT.
