Track
Większość czytelników wciąż kojarzy laboratorium stojące za Grokiem jako xAI. SpaceXAI wypuściło Grok 4.6 12 sierpnia 2026 r., nieco ponad miesiąc po Groku 4.5, z naciskiem na kodowanie, wizualną pracę w sieci i zadania agentów uruchamiane na dłużej.
Dane z premiery nie wspierają jednego prostego rankingu. Grok prowadzi w części testów dobranych przez SpaceXAI, podczas gdy GPT-5.6 Sol i Claude Fable 5 wygrywają w innych. Artificial Analysis plasuje Groka obok Sola przy niższej mieszanej cenie, ale aktualizacja też później zaczyna odpowiadać i kosztuje więcej za zmierzone zadanie niż Grok 4.5.
Ten artykuł śledzi ten kompromis przez specyfikację modelu, ceny, dostęp i bezpośrednie porównania z Solem i Claude’em. Nasza relacja o Grok 4.5 skupiała się na niskim zużyciu tokenów. Tutaj pytamy, czy wyższy wynik zmienia realny rachunek po doliczeniu cache’owanego wejścia, tokenów rozumowania i dodatkowego wyjścia.
TL;DR: Grok 4.6
W skrócie: pięciopunktowy wzrost sam w sobie ma mniejsze znaczenie, niż sugeruje strona premiery. O wyborze modelu decydują zachowanie cenowe i typ zadania.
-
Przy wysiłku
highGrok 4.6 zdobywa 61 punktów w Artificial Analysis Intelligence Index, co liczbowo zrówna go z Solem przymaxi plasuje dwa punkty za Opusem 5 przymax. -
Stawki bazowe za wejście i wyjście pozostają na poziomie 2 i 6 USD za milion tokenów, ale cache’owane wejście, opóźnienie pierwszego tokena i koszt zmierzonego zadania rosną w porównaniu z Grokiem 4.5.
-
W AA-Briefcase Grok użył mniej tur i tokenów wejściowych niż Opus 5; Sol prowadzi w testach terminalowych, a Sonnet 5 oferuje dwukrotnie większy kontekst bez dopłaty za długie prompty.
Porównania poniżej oddzielają deklaracje dostawców od wyników Artificial Analysis. To ważne, bo model może zmienić pozycję wraz z poziomem wysiłku lub konfiguracją testu.
Czym jest Grok 4.6?
Grok 4.6 to zastrzeżony model rozumowania SpaceXAI. API i Cursor nie ujawniają tego samego limitu kontekstu, a wyższa stawka dla długiego kontekstu zaczyna obowiązywać długo przed limitem API. Tabela zestawia te ograniczenia z typami wejścia, narzędziami i datą odcięcia wiedzy.
|
Spec |
Grok 4.6 |
|
500 000 tokenów (API); 256 000 tokenów w Cursorze |
|
|
Wejście / wyjście |
Tekst i obrazy na wejściu; tekst na wyjściu |
|
Wysiłek rozumowania |
Low, medium, high (domyślne), xhigh |
|
Data odcięcia wiedzy |
1 lutego 2026 |
|
Narzędzia |
Wywoływanie funkcji, wyszukiwanie w sieci, wyszukiwanie w X, wykonywanie kodu, wyszukiwanie w kolekcjach (RAG), zdalny MCP |
|
Cennik standardowy |
2 USD / milion tokenów wejściowych, 0,50 USD cache, 6 USD / milion tokenów wyjściowych |
|
Cennik dla długiego kontekstu |
4 / 1 / 12 USD po osiągnięciu przez prompt 200 000 tokenów, stosowane do całego żądania |
SpaceXAI nadal nie publikuje liczby parametrów dla żadnego z modeli. Liczba 1,5 biliona z niektórych raportów nie pochodzi od SpaceXAI, więc nie jest potwierdzoną specyfikacją.
Co nowego w Grok 4.6?
SpaceXAI twierdzi, że to nie jest nowy model trenowany od zera. Zamiast tego Grok 4.5 dostał więcej treningu, ze szczególną uwagą na zadania agentów AI. Zgłaszane zmiany dotyczą dłuższych przebiegów agentów, projektów wizualnych i post-treningu.
Dłuższe zadania agentów
SpaceXAI podaje, że Grok 4.6 lepiej trzyma kurs przy długich zadaniach z kilkoma krokami, jak badania, praca w poprzek bazy kodu czy budowa aplikacji. Model ma rzekomo częściej sprawdzać własną pracę zamiast robić wszystko w jednym przebiegu.
To wpisuje się w szerszą zmianę w testowaniu modeli. Dobry pierwszy wynik ma mniejsze znaczenie, jeśli model zapomina wcześniejsze decyzje po kilku wywołaniach narzędzi. Wewnętrzne testy GitHuba też wykazały, że Grok 4.6 utrzymywał rozumowanie i korzystanie z narzędzi przy dłuższych zadaniach.
API ma funkcje powiązane z tym twierdzeniem. Grok 4.6 potrafi strumieniować podsumowania rozumowania, czego Grok 4.5 nie ujawnia, a xAI zaleca kompaktowanie kontekstu z przyklejonym prompt_cache_key dla długich pętli agenta. Kompaktowanie skraca wcześniejszą historię do jednego elementu, ale nadal zużywa tokeny i żądanie musi zmieścić się w oknie kontekstu, zanim kompaktowanie zadziała.
Wizualny i interaktywny web development
SpaceXAI i Cursor raportują lepsze pierwsze podejścia przy projektach wizualnych. W jednym z zewnętrznych testów Grok 4.6 odtworzył starą stronę produktu iPod Mini jako serwis 3D z działającym kołem kolorów i animacją przewijania. Demo działało, ale jeden test nie dowodzi ogólniejszej tezy.
Jak trenowano Grok 4.6 po wstępnym etapie
Jeśli interesują cię tylko benchmarki i ceny, pomiń tę podsekcję. Wyjaśnia ona relację SpaceXAI o źródłach zysku.
SpaceXAI przeprowadziło więcej treningu niż dla Groka 4.5. Użyto przykładów rozumowania i przykładów inżynierskich generowanych przez AI, usunięto słabe przykłady z pomocą kontroli modelowych, a następnie zastosowano uczenie ze wzmocnieniem do kodowania, pracy biurowej, web developmentu, strojenia kernela i projektowania komputerów. SpaceXAI mówi też, że Grok 4.5 tworzył nowe przykłady treningowe w różnych ustawieniach rozumowania i tematach. Firma przypisuje wzrost większej liczbie treningu i ostrzejszej selekcji danych, a nie nowej architekturze.
Zespoły zewnętrzne nie mogą tego zweryfikować, a SpaceXAI nie udostępniło dość informacji, by powtórzyć trening. To relacja firmy o zmianach, a nie wynik potwierdzony przez kogoś innego.
Benchmarki Grok 4.6: oficjalne i niezależne wyniki
Tabela premierowa SpaceXAI pokazuje, gdzie wzrosły wyniki, ale wyniki konkurentów to „najlepsze z własnych deklaracji lub publicznie dostępnych rezultatów”. Jeden zespół nie uruchomił wszystkich modeli w tej samej konfiguracji. Poniżej uwzględniamy poziom wysiłku, bo wpływa na wynik.
|
Benchmark |
Grok 4.6 (high) |
Grok 4.5 (high) |
GPT-5.6 Sol (max) |
Claude Fable 5 (max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1 753 |
1 526 |
1 728 |
1 741 |
|
DeepSWE 1.1 |
65,9% |
54,0% |
73,0% |
70,0% |
|
Terminal-Bench 3.0 |
26,0% |
15,7% |
34,6% |
34,1% |
|
APEX-Agents |
57,5% |
47,1% |
56,7% |
59,2% |
|
CursorBench v3.2 |
69,9% |
66,7% |
67,2% |
70,5% |
Grok 4.6 poprawia wyniki względem Groka 4.5 w całej tabeli. Największe różnice Sola widać na DeepSWE i Terminal-Bench, podczas gdy Fable prowadzi w 3 wierszach. Nawet tabela SpaceXAI nie wskazuje jednego zwycięzcy.
Niezależne wyniki benchmarków
Artificial Analysis przeprowadziło własny Intelligence Index dla sześciu modeli w tym zestawieniu. Jego wyniki są zbliżone do liczb SpaceXAI, ale nie identyczne.

Grok 4.6 na tle pięciu czołowych rywali. Obraz: autor.
Wykres plasuje Groka na poziomie Sola pod względem inteligencji, ale znacznie niżej pod względem mieszanej ceny. Artificial Analysis liczy tę cenę w miksie 7:2:1 dla cache’owanego wejścia, niecache’owanego wejścia i wyjścia. Koszt na zakończone zadanie indeksu pokazuje tę samą różnicę: 0,84 USD dla Groka, 1,23 USD dla Sola i 2,34 USD dla Opusa 5.
Czas do pierwszego tokena odpowiedzi wzrósł z 14,62 s w Groku 4.5 do 40,44 s, a koszt na zadanie z 0,36 USD do 0,84 USD. Grok 4.6 zużył ok. 20% więcej tokenów wyjściowych w tych samych testach, więc niezmieniona cena katalogowa nie oznacza niezmienionego kosztu zadania. Koszt na zakończone zadanie daje lepszy obraz niż same karty cenowe API, bo uwzględnia część dodatkowego rozumowania potrzebnego do dokończenia pracy.
W porównaniu z GPT-5.6 Sol i Claude Sonnet 5, Grok 4.6 wysyła pierwszy token odpowiedzi wcześniej. Sol przy wysiłku max potrzebuje 213,52 s, a Sonnet 5 — 184,48 s, wobec 40,44 s Groka. Grok wygląda na wolny jedynie na tle modeli o niższych opóźnieniach, takich jak Gemini 3.7 Flash.
Na ile wiarygodne są te porównania benchmarków?
Pomagają znaleźć względne mocne strony, ale nie są wiarygodnym rankingiem między modelami. Poziom wysiłku zmienia wynik i czas odpowiedzi: GPT-5.6 Sol zdobył 57 przy high i 61 przy max. Nazwy benchmarków też potrafią oznaczać różne wersje, więc Terminal-Bench 3.0 od xAI i Terminal-Bench 2.1 od Artificial Analysis nie są porównywalne.
Co się zmieniło względem Grok 4.5?
Dla użytkowników Grok 4.5 decyzja nie brzmi, czy 4.6 jest „lepszy” w abstrakcji. Chodzi o to, czy wyższy wynik równoważy inną latencję i profil użycia tokenów. Tabela zestawia te zmiany na wspólnej podstawie.
|
Miara |
Grok 4.5 (high) |
Grok 4.6 (high) |
|
AA Intelligence Index |
56 |
61 |
|
Koszt na zadanie indeksu |
0,36 USD |
0,84 USD |
|
Czas do pierwszego tokena odpowiedzi |
14,62 s |
40,44 s |
|
Cena cache’owanego wejścia |
0,30 USD / M |
0,50 USD / M |
|
Tokeny wyjściowe użyte do uruchomienia indeksu |
60 M |
72 M |
|
Cena bazowa wejścia / wyjścia |
2 USD / 6 USD |
2 USD / 6 USD (bez zmian) |
Jednak „ta sama cena” opisuje tylko bazową stawkę katalogową. Jeszcze jedna zmiana ma znaczenie dla obecnych użytkowników Groka 4.5: cache’owane wejście wzrosło o 67%, z 0,30 do 0,50 USD za milion tokenów. Ta wyższa stawka cache powiększa różnicę między kartą cenową a kosztem ukończonego zadania.
Grok 4.6 kontra konkurencja
Skoro rozstrzygnęliśmy porównanie z poprzednikiem, zobaczmy, jak Grok 4.6 wypada na tle innych najnowocześniejszych modeli od OpenAI i Anthropic.
Grok 4.6 vs GPT-5.6 Sol
Remis w indeksie maskuje wyraźny podział. Sol wyprzedza Groka o 7,1 pkt na DeepSWE i 8,6 pkt na Terminal-Bench, co czyni kodowanie mocno terminalowe jego najmocniejszym przypadkiem. Grok ma wyższe wyniki w pozostałych trzech wierszach zadań.
Własne testy OpenAI rozszerzają ten wynik terminalowy na przeglądanie internetu i obsługę komputera. To wciąż dowody wybrane przez dostawcę, a nie kontrolowane porównanie, ale wskazują ten sam kierunek: najmocniejszy przypadek Sola to praca zależna od terminala, przeglądarki lub powtarzanych wywołań narzędzi.
OpenAI także zapowiedziało tryb Ultrafast dla Sola, który ma działać do 14 razy szybciej. Nie ma jeszcze opublikowanej ceny, więc nie uwzględniamy go w porównaniu kosztów.
Grok 4.6 startuje od 2 USD za wejście i 6 USD za wyjście za milion tokenów. Standardowa stawka Sola to 5 USD za wejście i 30 USD za wyjście, czyli pięć razy wyższa cena za wyjście niż w Groku. Powyżej 272 000 tokenów Sol podwaja cenę wejścia i podnosi wyjście do 45 USD.
To nie znaczy, że każde zadanie w Groku jest pięć razy tańsze. Zużycie tokenów rozumowania, trafienia do cache i liczba tur nadal zmieniają końcowy rachunek. Przewaga cenowa Groka jest najczytelniejsza, gdy zużycie tokenów jest przewidywalne. Przy pracy mocno terminalowej wyższe wyniki Sola mogą mieć większe znaczenie niż różnica w cenie katalogowej.
Grok 4.6 vs Claude Sonnet 5
Sonnet 5 i Grok 4.6 zaczynają od 2 USD za milion tokenów wejściowych, co ułatwia porównanie cen. Sonnet 5 ma domyślnie okno kontekstu 1 miliona tokenów, dwa razy większe niż 500 000 w Groku, bez wyższej stawki za długie prompty. Wyjście kosztuje 10 USD za milion wobec 6 USD w Groku.
Dwa dni przed premierą Groka 4.6 Anthropic uczynił ceny 2/10 USD stałymi i wycofał planowaną podwyżkę do 3/15 USD. Ma to znaczenie przy porównaniu z starszymi cennikami, w tym naszym.
W indeksie Artificial Analysis Sonnet 5 zdobywa 55 przy wysiłku max, czyli o sześć punktów mniej niż Grok 4.6. Zużył 300 milionów tokenów wyjściowych w testach, wobec 72 milionów Groka, co dało koszt na zadanie 1,72 USD. Jego tokenizer generuje ok. 30% więcej tokenów niż Sonnet 4.6 dla tego samego tekstu. To utrudnia porównanie cen między tymi dwiema wersjami Sonnet. Sonnet 5 nie jest też topowym modelem Anthropic.
Grok 4.6 vs Claude Opus 5 i Fable 5
Opus 5 przy 5 USD za wejście i 25 USD za wyjście przewodzi w indeksie z wynikiem 63. Fable 5, przy 10 USD za wejście i 50 USD za wyjście, zdobywa 62. Wynik Fable w indeksie też wymaga uwagi. Artificial Analysis odnotowało fallbacki bezpieczeństwa przy trudniejszych promptach, więc wynik odzwierciedla model, z jakiego ludzie mogą korzystać, a nie nieograniczoną wersję, której Anthropic nie oferuje.
W benchmarku AA-Briefcase Artificial Analysis dla długich zadań agentów Grok 4.6 zakończył w ok. 53 turach i użył 0,5 mld tokenów wejściowych. Opus 5 potrzebował ok. 103 tur i 2 mld tokenów. To nie dowodzi, że Grok jest ogólnie silniejszym modelem. Pokazuje, że Grok użył mniej kroków i mniej tokenów wejściowych w tym zestawie testów, podczas gdy Claude prowadził w innych testach omawianych wyżej.
Cennik Grok 4.6
Próg promptu 200 000 tokenów to element, który bym obserwował: przenosi każdy token w żądaniu do wyższego progu. Tabela uwzględnia też priorytet i opłaty za narzędzia.
|
Pozycja |
Stawka |
|
Tokeny wejściowe, prompt < 200 tys. |
2,00 USD / milion |
|
Cache’owane wejście, prompt < 200 tys. |
0,50 USD / milion |
|
Tokeny wyjściowe, prompt < 200 tys. |
6,00 USD / milion |
|
Wejście / cache / wyjście (prompt > 200 tys.) |
4,00 / 1,00 / 12,00 USD |
|
Szybkie lub priorytetowe przetwarzanie |
2× stawka standardowa |
|
Wyszukiwanie w sieci, wyszukiwanie w X, wykonywanie kodu |
5 USD za 1 000 wywołań |
Opłaty za narzędzia są odrębne od opłat za tokeny. Żądanie, które przeszukuje sieć, a potem uruchamia kod, może naliczyć obie opłaty narzędziowe, zanim zostanie rozliczony końcowy tekst. Nie ma osobnej nazwy modelu grok-4.6-fast. Bezpośrednie API ma opcję priorytetu, rozliczaną w stawce 2×, gdy odpowiedź potwierdzi użycie priorytetu. Cursor pokazuje osobny wybór „Grok 4.6 (Fast)” przy tej samej stawce 2×.

Grok 4.6 Fast wybrany w Cursorze. Obraz: autor.
Jak mogę uzyskać dostęp do Grok 4.6?
Grok 4.6 jest dostępny bezpośrednio poprzez:
- API SpaceXAI
- Cursor
- Grok Build
- Bramki zewnętrzne (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- Inne narzędzia do kodowania (GitHub Copilot, VS Code, JetBrains, Xcode i Eclipse)
Wdrożenie obejmuje plany Pro, Pro+, Max, Business i Enterprise. Administratorzy Business i Enterprise muszą włączyć model, bo jest domyślnie wyłączony. Grok 4.6 nie jest obsługiwany w Batch API SpaceXAI, więc nie ma zniżkowej opcji wsadowej.
Jeden detal dla firm leży poza dostępnością modelu. Odpowiedzi są domyślnie stanowe, a SpaceXAI podaje, że historia jest przechowywana przez 30 dni. W ramach Zero Data Retention zespoły nie mogą korzystać z przechowywanych łańcuchów odpowiedzi ani odroczonych ukończeń; xAI wskazuje zamiast tego na szyfrowane odtwarzanie rozumowania i WebSocket Responses. Każda odpowiedź zawiera nagłówek pokazujący, czy ZDR było aktywne.
Tydzień premiery Grok 4.6: modele, Copilot i Cursor
Uderzyło mnie, jak szybko premiery modeli i umowy dystrybucyjne skupiły się wokół Groka 4.6.

Tydzień premiery Grok 4.6, poza benchmarkami. Obraz: autor.
Grok Bot nadał ton przed premierą modelu. Wczesnobeta agent chmurowy był dodawany do SuperGrok Heavy za 300 USD miesięcznie lub Cursor Ultra za 200 USD miesięcznie, zamiast być sprzedawanym osobno, wiążąc dostęp z planami premium. Grok 4.6 przeniósł to samo skupienie na agentach do API, Cursora i Grok Build.
Premiera Gemini 3.7 Flash Google i zapowiedź GPT-5.6 Sol Ultrafast od OpenAI dodatkowo zagęściły tydzień. Jednocześnie wdrożenie Copilota i dołączenie Cursora do SpaceX poszzerzyły dystrybucję Groka. Cursor powiązał proces z partnerstwem SpaceXAI z początku roku i opisał ruch jako dostęp do GPU SpaceX, a nie wyniki modelu. Wpis podaje, że ten dostęp pomoże mu budować modele niższym kosztem.
Moja interpretacja jest taka, że SpaceXAI chce Groka w narzędziach, z których ludzie już korzystają. Grok 4.5 był wspólnie trenowany z Cursorem, a Grok 4.6 niemal natychmiast trafił do Copilota. To czyni dystrybucję partnerską częścią premiery, a nie dodatkiem.
Kiedy warto użyć Grok 4.6?
Grok 4.6 pasuje do pracy, w której cena API i długie zadania agentów mają większe znaczenie niż latencja pierwszego tokena. Słabiej wypada, gdy z zadaniem lepiej zgrywają się wyższe wyniki terminalowe Sola lub większe okno kontekstu Sonnet 5.
Grok 4.6 pasuje, gdy:
- Cena API to główne ograniczenie. Przebija Sola, Opusa 5 i Fable 5 w cenie katalogowej i koszcie zadania
- Praca przebiega jako długie, wieloetapowe zadania agentów, gdzie jego efektywność tur (mniej tur i tokenów wejściowych niż Opus 5 w AA-Briefcase) się zwraca
- Zadanie to praca wiedzoza czy rozumowanie prawne, gdzie prowadzi w tabeli benchmarków
- Latencja pierwszego tokena nie ma znaczenia. Powolny start ginie w długim przebiegu, ale wpływa na całe wrażenie w interaktywnej rozmowie
Lepsze alternatywy mogą być dostępne, gdy:
- Praca to kodowanie mocno terminalowe → GPT-5.6 Sol (wyższe wyniki DeepSWE i Terminal-Bench)
- Zadanie wymaga dużego okna kontekstu → Claude Sonnet 5 (1M kontekstu, brak dopłaty za długi prompt)
- Chcesz najniższej latencji do użytku interaktywnego → Gemini 3.7 Flash
- Kupujesz wyłącznie pod kątem topowej inteligencji → Opus 5 (63) lub Fable 5 (62) prowadzą w indeksie
Ostateczne wnioski o Grok 4.6
Grok 4.6 ląduje w niezręcznym środku. Zyskuje pięć punktów w indeksie i utrzymuje niższe ceny katalogowe niż Sol i Opus 5, ale startuje wolniej i kosztuje więcej za zmierzone zadanie niż Grok 4.5. „Ta sama cena, lepszy model” pomija połowę premiery.
Część, którą wciąż chciałbym zobaczyć, to wielogodzinny przebieg, gdzie baza kodu, narzędzia i instrukcje ciągle się zmieniają. Cursor i GitHub Copilot teraz dają takie środowisko. Jeśli wskaźniki korekt i porażek pozostaną tam niskie, teza o treningu agentów zyska dowody poza stałym testem; jeśli nie, pięciopunktowy wzrost pozostanie po prostu nim.
Dla czytelników budujących na API xAI nasz samouczek API Grok 4 obejmuje klienta Pythona i przepływ żądania.
Grok 4.6 — FAQ
Czy Grok 4.6 zastępuje Grok 4.5?
Nie oficjalnie. SpaceXAI nie ogłosiło daty wycofania Groka 4.5 i wciąż widnieje on zarówno w API, jak i w Cursorze. Na razie nie ma wymuszonej migracji do 4.6.
Czy mogę hostować Grok 4.6 samodzielnie?
Nie. Jak wyżej, nie ma otwartych wag ani opublikowanej liczby parametrów, więc nie ma czego pobrać i uruchomić na własnym sprzęcie. Każda ścieżka dostępu, w tym bezpośrednie API, przechodzi przez infrastrukturę SpaceXAI lub partnera-odsprzedawcę.
Jak GitHub Copilot rozlicza Grok 4.6?
Copilot przelicza użycie Grok 4.6 na GitHub AI Credits według ceny katalogowej dostawcy, gdzie jeden cent to jeden kredyt. Zwykłe podpowiedzi kodu i propozycje kolejnej edycji nie są rozliczane w AI Credits. Użycie modelu w czacie lub zadaniach agenta podlega zasadom użycia Copilota.
Czy Grok 4.6 jest dostępny w UE?
Tak, ale przetwarzane w USA. Użytkownicy z UE mają dostęp do Grok 4.6 (wspólna baza Grok 4.5 przeszła ustawę o AI UE i otworzyła dostęp w lipcu, a 4.6 jest dostępny w Cursorze w całej UE), ale nie ma rezydencji danych w UE. Strona modelu xAI wymienia tylko us-east-1 i us-west-2, więc żądania są wykonywane w USA. Potwierdź dla danego interfejsu (konsola API, Cursor, bramki) przed poleganiem na tym.
Czy Grok 4.6 działa z rezydencją danych USA w Cursorze?
Grok 4.6 jest już dostępny w Cursorze (ma własną stronę modelu), ale rezydencja danych wyłącznie w USA jest funkcją Enterprise, która obejmuje tylko wspierane modele z pewnymi wykluczeniami. Dlatego potwierdź, że 4.6 figuruje na aktualnej liście wspieranych modeli Cursor, zanim na tym oprzesz działanie.