Google ogłosiło Gemini 4 Argon pod sam koniec września. Argon to pierwszy model z rodziny Gemini 4 i nowa granica możliwości. Pojawia się cztery tygodnie po GPT-6 Astra od OpenAI, nowym flagowcu tej firmy od początku września.
W tabeli premierowej Google Argon wyprzedza Astrę w większości wierszy, kosztując ułamek ceny Astry. Jest jednak haczyk, który znaczy więcej niż jakikolwiek benchmark: Argon nie jest jeszcze powszechnie dostępny. Google udostępnia go najpierw zweryfikowanym zespołom ds. cyberbezpieczeństwa, bez daty dla deweloperów czy użytkowników indywidualnych.
TL;DR
- W tabeli benchmarków Google Gemini 4 Argon wygrywa z GPT-6 Astra w większości pozycji, zwłaszcza w zadaniach prawnych, finansowych i związanych z workflow w biznesie.
- GPT-6 Astra zachowuje przewagę w najtrudniejszej inżynierii oprogramowania, pracy naukowej w terminalu i w obsłudze komputera.
- Cena startowa Argona to jedna piąta ceny Astry, a cena standardowa wciąż mniej niż połowa.
- Ale Argonu jeszcze nie użyjesz: dostęp mają tylko zaufani obrońcy cyber z programu Google, a następni w kolejce są płacący klienci API i subskrybenci AI Ultra.
- Więc jeśli potrzebujesz modelu frontier w produkcji dziś, wybierz GPT-6 Astra.
Czym jest Gemini 4 Argon?
Gemini 4 Argon to nowy model frontier Google DeepMind, ogłoszony pod koniec września. To pierwszy model generacji Gemini 4.
Google zbudowało Argon z myślą o głębokim rozumowaniu przy długiej, wieloetapowej pracy. Wspiera to podniesiony limit wyjścia do 1 mln tokenów, żeby model mógł przeanalizować trudny problem w jednym przebiegu.
Czym jest GPT-6 Astra?
GPT-6 Astra to flagowy model OpenAI, wydany na początku września. Stoi na szczycie rodziny GPT-6, powyżej GPT-6.1 Sol oraz GPT-6 Luna.
OpenAI pozycjonuje go jako najbardziej zaawansowany model do najbardziej wymagających zadań — od złożonego rozumowania i kodowania po obsługę komputera i research.
Gemini 4 Argon vs GPT-6 Astra: porównanie bezpośrednie
Spośród 19 benchmarków w tabeli premierowej Google, Argon ma wyższy wynik niż Astra w 14, Astra wygrywa 4, a jeden to remis. Wszystkie pochodzą z tabeli Google, więc traktuj je jako argumentację Google za Argonem, a nie niezależny ranking. Skróciłem tę tabelę, żeby pokazać najbardziej znane, interesujące i istotne testy dla tej premiery.
| Funkcja | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68,9% | 63,1% |
| AutomationBench | 51,3% | 41,4% |
| Vals Finance Agent v2 | 65,4% | 53,5% |
| Harvey's Legal Agent Benchmark | 19,6% | 5,4% |
| DeepSWE v1.1 | 77,9% | 74,1% |
| FrontierSWE v2 | 55,0% | 65,5% |
| Terminal-bench 4.0 | 57,4% | 58,2% |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% |
| OSWorld-2.0 (podzbiór offline) | 69,2% | 72,6% |
| Maksymalna liczba tokenów w wyjściu | 1M | 128K |
| Dostępność | Tylko zaufani obrońcy cyber | Dostępny ogólnie |
Każdy z poniższych wymiarów rozwija resztę tabeli.
Praca z wiedzą: prawo, finanse i workflow biznesowy
Tu przewaga Argona jest najszersza i na to Google celowało premierą.
W Harvey's Legal Agent Benchmark, który testuje research prawniczy i redagowanie, Argon ma 19,6% wobec 5,4% Astry. To niskie wyniki dla obu, ale ponad trzykrotnie więcej zadań ukończonych to największa względna różnica w całej tabeli.
Ten wzorzec utrzymuje się w finansach i automatyzacji biznesu, gdzie Argon prowadzi o ok. 10–12 punktów. Jeśli te deklaracje się potwierdzą, gdy będzie można go używać, Argon będzie silniejszym modelem do zadań prawniczych i finansowych, opartych na dokumentach.
Kodowanie i inżynieria oprogramowania
W kodowaniu mamy remis zależny od rodzaju inżynierii.
Argon prowadzi w DeepSWE v1.1, który sprawdza zadania długoterminowe w prawdziwych bazach kodu, i minimalnie wygrywa z Astrą w Vibe Code Bench, gdzie liczy się zbudowanie działających aplikacji.

Astra wygrywa wyraźnie w FrontierSWE v2, a w Terminal-bench 4.0 dzieli je mniej niż punkt.
Przykłady Google skłaniają się ku dużym migracjom, w tym z C i C++ do Rust w kodach Google.
W najtrudniejszym benchmarku inżynierskim w tabeli Astra jest jednak wciąż z przodu.
Długi kontekst i rozumienie wizualne
Argon odjeżdża, gdy wejścia się wydłużają.
W GraphWalks, który testuje rozumowanie nad strukturami grafów rozłożonymi w długim kontekście, oba modele są blisko do 128K tokenów, ale od 256K do 1M tokenów Argon ma wyższe wyniki.
Argon prowadzi też w LVBench dla długiego rozumienia wideo, podczas gdy czytanie wykresów w Chartography to niemal remis.
Dla każdego, kto wrzuca do modelu całe umowy, bazy kodu czy nagrania, to najważniejsza praktyczna różnica po dostępności.
Nauka, matematyka i obsługa komputera
Astra utrzymuje pozycję w naukowej pracy terminalowej, prowadząc w Terminal-Bench Science 0.1 o ponad 10 punktów. Argon wygrywa w LABBench 2, benchmarku badań biologicznych, oraz w RiemannBench w matematyce. W obsłudze komputera Astra prowadzi w OSWorld-2.0, a Argon w Agent's Last Exam, więc żadna nie dominuje tej kategorii.
Dostępność i bezpieczeństwo
Astra to ta, którą możesz wdrożyć dziś. Argon jest obecnie ograniczony do programu Fairwind Google dla zaufanych obrońców cyber oraz zespołów wewnętrznych Google, a firma zapowiada, że następni będą płacący klienci API i subskrybenci Google AI Ultra — bez podania daty.
Historia cyber Argona ma też dwie strony. Google udostępnia go zweryfikowanym obrońcom bez ograniczeń cyber, a w CWE-bench v1, który testuje naprawę realnych podatności, remisuje z Astrą na pierwszym miejscu.
Dla wszystkich pozostałych Google mówi, że Argon będzie odmawiać szkodliwych żądań cyber i CBRN oraz uruchamia monitory, które mogą zatrzymać wykonanie, gdy model wykracza poza intencję użytkownika.
Ceny: ile faktycznie zapłacisz
Argon kosztuje jedną piątą ceny Astry w cenie startowej i mniej niż połowę w cenie standardowej, ale Google nie podało, jak długo potrwa okres wprowadzający.
Stawki za tokeny obok siebie
| Stawka | Gemini 4 Argon (startowa) | Gemini 4 Argon (standardowa) | GPT-6 Astra |
|---|---|---|---|
| Wejście, za 1 mln tokenów | $2.00 | $4.00 | $10.00 |
| Wyjście, za 1 mln tokenów | $10.00 | $20.00 | $50.00 |
| Odczyt z cache wejścia, za 1 mln tokenów | $0.10 (95% zniżki od wejścia) | Nieopublikowane | $1.00 |
| Dopłata za długi kontekst | Nieopublikowane | Nieopublikowane | Powyżej 272K tokenów wejściowych: 2x wejście i cache, 1,5x wyjście dla całego żądania |
Mnożnik jest równy dla wejścia i wyjścia: 0,2x Astry w stawkach startowych i 0,4x w standardowych. Obaj dostawcy rozliczają rozumowanie jako wyjście, co ma większe znaczenie dla Argona, bo Google podniosło limit wyjścia do 1 mln tokenów właśnie po to, by mógł myśleć dłużej.
Nawet przy stawkach standardowych Argon kosztuje znacznie mniej niż połowę ceny Astry. Otwarte pozostaje pytanie o długie prompty, gdzie tylko Astra opublikowała cennik.
Ile kosztuje realne obciążenie
| Obciążenie | Gemini 4 Argon (start) | Gemini 4 Argon (standard) | GPT-6 Astra |
|---|---|---|---|
| Zrównoważony asystent: 1 mln we / 250K wy | $4.50 | $9.00 | $22.50 |
| Retrieval, każde żądanie poniżej 272K: 10 mln we / 1 mln wy | $30 | $60 | $150 |
| Retrieval, każde żądanie powyżej 272K: 10 mln we / 1 mln wy | Nieopublikowane | Nieopublikowane | $275 |
Każda suma to (wolumen ÷ 1 mln) × stawka, zsumowane dla wejścia i wyjścia, przy stawkach standardowych.
- Zrównoważony asystent: Argon oszczędza $18 miesięcznie (80%) przy stawkach startowych i $13,50 (60%) przy standardowych.
- Retrieval poniżej 272K: te same 80% i 60% oszczędności, w skali, gdzie zaczynają mieć znaczenie: $120 lub $90 miesięcznie.
- Retrieval powyżej 272K: dopłata Astry podbija koszt do $275. Google nie podało, czy Argon ma poziom cenowy dla długiego kontekstu, więc to wiersz do sprawdzenia, gdy pojawi się strona z cennikiem Argona.
Obaj dostawcy używają różnych tokenizerów i żaden nie opublikował liczby tokenów dla wspólnego obciążenia, więc traktuj te sumy jako porównanie stawek, a nie faktyczny rachunek.
Kiedy wybrać Gemini 4 Argon, a kiedy GPT-6 Astra
Na razie rozstrzyga dostępność, nie benchmarki: Astra jest ogólnie dostępna, a Argon ograniczony do zweryfikowanych obrońców cyber. Gdy Argon się otworzy, jego mnożnik ceny 0,2x–0,4x sprawi, że stanie się domyślnym wyborem do testów w pracy z wiedzą.
Wybierz Gemini 4 Argon, jeśli...
- Twoja praca to research prawny, analiza finansowa lub automatyzacja biznesu. To jego najszersze przewagi w tabeli Google, a przewaga w prawie jest największa ze wszystkich.
- Karmisz go bardzo długimi wejściami. Radzi sobie znacznie lepiej niż Astra przy rozumowaniu w zakresie 256K–1M tokenów i prowadzi w długim wideo.
- Cena ma znaczenie przy jakości frontier. Nawet w stawkach standardowych kosztuje znacznie poniżej połowy ceny Astry za token.
Wybierz GPT-6 Astra, jeśli...
- Potrzebujesz go dziś. Astra jest w ChatGPT, OpenAI API, Azure, Bedrock, GitHub Copilot i OpenRouter, podczas gdy Argon nie ma jeszcze publicznego API.
- Twoja najtrudniejsza praca to inżynieria oprogramowania lub obliczenia naukowe. Prowadzi nad Argonem w FrontierSWE v2 i Terminal-Bench Science o ponad 10 punktów każdy.
- Uruchamiasz agentów do obsługi aplikacji desktopowych. Prowadzi w OSWorld-2.0, choć Argon wygrywa w Agent's Last Exam — przetestuj więc na własnych zadaniach.
Na koniec
Jeśli potrzebujesz w tym tygodniu modelu frontier, opcją jest GPT-6 Astra. Jeśli twoja praca to prawo, finanse lub analiza długich dokumentów i możesz poczekać, zaplanuj test Gemini 4 Argon w dniu, w którym się otworzy. Damy ci znać, kiedy to dokładnie nastąpi, jeśli zapiszesz się na The Median, nasz cotygodniowy newsletter:
To porównanie, Argon kontra Astra, jest ciekawe. Google wypuściło Argon wraz z tabelą benchmarków pokazującą, że pokonuje OpenAI w większości pozycji, i w cenie niższej niż Astra. Ale jednocześnie większość ludzi nie ma jak go użyć.
Google stawia na to, że przewaga się utrzyma do czasu, aż pojawi się dostęp.
FAQ
Czy Gemini 4 Argon jest lepszy niż GPT-6 Astra?
W tabeli benchmarków Google Gemini 4 Argon ma wyższy wynik niż GPT-6 Astra w 14 z 19 testów, z największą przewagą w prawie, finansach, automatyzacji biznesu i pracy z długim kontekstem. GPT-6 Astra prowadzi w FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0 i Terminal-bench 4.0. Wszystkie wyniki pochodzą od Google, więc potrzebne są jeszcze niezależne testy.
Czy mogę już używać Gemini 4 Argon?
Nie, chyba że jesteś w programie Fairwind Google dla zaufanych obrońców cyber. Google mówi, że płacący klienci API i subskrybenci Google AI Ultra dostaną dostęp jako następni, ale nie podało daty ani nie opublikowało identyfikatora modelu w API.
Ile kosztuje Gemini 4 Argon w porównaniu z GPT-6 Astra?
Gemini 4 Argon startuje ze stawką $2 za milion tokenów wejściowych i $10 za milion tokenów wyjściowych, później rośnie do $4 i $20. GPT-6 Astra kosztuje $10 i $50, więc Argon to jedna piąta ceny Astry przy stawkach startowych i 40% przy standardowych. Google nie podało, jak długo potrwa okres wprowadzający.
Który model lepiej nadaje się do kodowania: Gemini 4 Argon czy GPT-6 Astra?
To zależy. W tabeli Google Gemini 4 Argon prowadzi w DeepSWE v1.1 i Vibe Code Bench, podczas gdy GPT-6 Astra prowadzi w FrontierSWE v2 o około 10 punktów i minimalnie wygrywa w Terminal-bench 4.0. W najtrudniejszych zadaniach inżynierskich Astra ma obecnie silniejszy opublikowany wynik.
Jaki jest limit wyjścia w Gemini 4 Argon?
Google podniosło limit wyjścia Gemini 4 Argon do 1 mln tokenów, z 64K w wcześniejszych modelach Gemini, aby mógł rozwiązywać długie problemy w jednym przebiegu. Maksymalne wyjście GPT-6 Astra to 128K tokenów.