Track
Jeśli wybierasz model do pracy agentowej w drugiej połowie 2026 roku, lista jest krótka, a dwa najważniejsze premiery dzieliły dwa tygodnie. Anthropic wypuścił Claude Opus 5 24 lipca, a OpenAI udostępnił ogólnie GPT-5.6 Sol 9 lipca. Oba to flagowe poziomy, skierowane do długotrwałych zadań profesjonalnych, a ich ceny wydają się niemal identyczne.
W tym artykule porównam Claude Opus 5 i GPT-5.6 Sol w obszarach: kodowanie, rozumowanie, obsługa komputera, wykorzystanie narzędzi, ceny i dostęp — tak, byś mógł wybrać model pasujący do twojego stylu pracy. Po głębsze omówienie każdego modelu osobno zajrzyj do naszego przewodnika po Claude Opus 5 oraz przewodnika po rodzinie GPT-5.6.
TL;DR
- Opus 5 to specjalista od nowatorskiego rozumowania i agentów; GPT-5.6 Sol to mocniejszy generalista w terminalu i przeglądaniu.
- Tokeny wejściowe kosztują $5 za milion w obu modelach. W wyjściu Opus 5 jest tańszy o 17%.
- Wybierz Opus 5 do naprawdę nowych problemów, kodowania i obsługi komputera. Wybierz Sol do przepływów terminalowych, agentów do przeglądania i pracy w obronie cyberbezpieczeństwa.
Czym jest Claude Opus 5?
Claude Opus 5 to model Anthropic z poziomu Opus, wydany 24 lipca 2026 r., oferujący wyniki zbliżone do wyżej pozycjonowanego Fable 5 przy połowie ceny. To nowy domyślny model w Claude Max i najsilniejszy dostępny w Claude Pro.
Charakterystyczną cechą modelu jest wytrwałość. Według Anthropic Opus 5 weryfikuje własną pracę i iteruje do skutku zamiast zatrzymywać się na czymś wiarygodnie brzmiącym; raportuje też wynik audytu niewłaściwych zachowań 2,3 — najniższy spośród ostatnich modeli Anthropic. Kontekst sięga 1 mln tokenów z limitem wyjścia 128 tys., a „myślenie” jest domyślnie włączone.
Jeśli chcesz budować zamiast czytać, nasz samouczek API Claude Opus 5 prowadzi krok po kroku przez konstrukcję agenta naprawiającego błędy i benchmarkowanie go na pięciu poziomach wysiłku.
Czym jest GPT-5.6 Sol?
GPT-5.6 Sol to flagowy model rodziny GPT-5.6 od OpenAI, która po ograniczonym podglądzie osiągnęła ogólną dostępność 9 lipca 2026 r. Rodzina ma trzy poziomy:
- Sol: model flagowy o najwyższej wydajności
- Terra: zrównoważony model na co dzień
- Luna: opcja oszczędna kosztowo
OpenAI opisuje Sol jako dostarczający najnowocześniejsze wyniki w kodowaniu, pracy wiedzo-wej, cyberbezpieczeństwie i nauce, zużywając przy tym mniej tokenów niż modele, które przewyższa.
Najważniejszą funkcją Sol jest ultra — ustawienie rozumowania, które domyślnie koordynuje czterech agentów w równoległych strumieniach pracy. OpenAI dodało także Programmatic Tool Calling w Responses API, co pozwala modelowi pisać i uruchamiać małe programy orkiestrujące narzędzia i filtrujące dane pośrednie zamiast kierować każdą odpowiedź narzędzia z powrotem przez model.
Więcej o strukturze rodziny i ograniczeniach z okresu podglądu znajdziesz w naszym omówieniu GPT-5.6. Opisaliśmy też deklarowany kontrprzykład hipotezy Dinitza–Garga–Goemansa przez GPT-5.6 Pro — jak dotąd najciekawsze zastosowanie tej rodziny.
Claude Opus 5 vs GPT-5.6 Sol: porównanie bezpośrednie
Oto podsumowanie, zanim przejdę do poszczególnych wymiarów.
| Funkcja | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Wydanie | 24 lipca 2026 | 9 lipca 2026 |
| Wejście, za 1 mln tokenów | $5.00 | $5.00 |
| Wyjście, za 1 mln tokenów | $25.00 | $30.00 |
| Okno kontekstu | 1 mln tokenów | 1 mln tokenów |
| Maks. wyjście | 128 tys. tokenów | 128 tys. tokenów |
| Nowatorskie rozumowanie (ARC-AGI-3) | 30,2% | 7,78% |
| Kodowanie repozytoriów (SWE-Bench Pro) | 79,2% | 64,6% |
| Kodowanie w terminalu (Terminal-Bench 2.1) | 89,1% | 88,8% (91,9% z ultra) |
| Długohoryzontowe kodowanie (DeepSWE V1.1) | 68,8% | 72,7% |
| Obsługa komputera (OSWorld 2.0) | 70,6% | 62,6% |
| Agenci przeglądania (BrowseComp) | 90,8% | 90,4% (92,2% z ultra) |
| Cecha wyróżniająca | Autoweryfikacja i iteracja | Tryb równoległych agentów ultra |
| ID modelu | claude-opus-5 |
gpt-5.6-sol |
Nowatorskie rozumowanie i problemy abstrakcyjne
Tu rozjazd między modelami jest największy, więc od tego zacznę. ARC-AGI-3 prosi model o rozwiązanie problemów, z którymi nie zetknął się w treningu, co czyni go najbliższym testem rozumowania, a nie odtwarzania z pamięci.
Opus 5 zdobywa 30,2%. GPT-5.6 Sol uzyskuje 7,78%, choć jest drugim najlepszym modelem w tabeli wyników. Dla porównania, Gemini 3.1 Pro Preview osiąga 0,42%. Dla kontekstu: Opus 4.8 miał 1,5% dwa miesiące wcześniej — to dwudziestokrotny skok w jednej generacji Anthropic.
Chcę ostrożnie interpretować 4-krotną przewagę w jednym benchmarku. ARC-AGI-3 celowo utrudnia „nauczenie się na pamięć”, a 30,2% to nadal większość porażek. Jeśli jednak twoja praca dotyczy problemów niepodobnych do czegokolwiek w korpusie treningowym, to jest najistotniejsza liczba w całym porównaniu — i nie jest blisko.
Kodowanie i inżynieria agentowa
W kodowaniu wyniki są podzielone — żaden model nie zamiata całej kategorii. Każdy dostawca prowadzi w benchmarkach, które akcentuje, co jest dokładnie tym, czego można się spodziewać — i dokładnie dlatego warto wyjść poza nagłówki.
| Benchmark | Claude Opus 5 | GPT-5.6 Sol | Uwagi |
|---|---|---|---|
| SWE-Bench Verified | 96,0% | 96,2% | Praktycznie remis; Fable 5 ma 95,0% |
| SWE-Bench Pro | 79,2% | 64,6% | Claude Mythos 5 prowadzi z 80,3% |
| DeepSWE v1.1 | 68,8% | 72,7% | Sol prowadzi o 3,9 pkt |
| Terminal-Bench 2.1 | 89,1% | 88,8% (91,9% z ultra) |
Remis, z tym że ultra robi różnicę |
| Frontier-Bench v0.1 | 43,3% | 37,5% | Opus 4.8 miał 18,7% dwa miesiące wcześniej |
| AA Coding Agent Index v1.1 | Brak publikacji | 80 | Fable 5 ma 77,2, Opus 4.8 ma 72,5 |
Wzorzec jest czytelny, gdy oddzielisz pracę w repozytorium od pracy w terminalu. Opus 5 wygrywa SWE-Bench Pro prawie 15 punktami i ponad dwukrotnie przebija wynik Opus 4.8 na Frontier-Bench, który mierzy agentową inżynierię oprogramowania w zadaniach typu odtworzenie części maszyny w FreeCAD na podstawie rysunku technicznego. Przykład od Anthropic warto zacytować: bez możliwości obejrzenia rysunku Opus 5 napisał własny pipeline wizji komputerowej, by wydobyć geometrię z surowych pikseli, i żaden konkurencyjny model nie rozwiązał zadania w pięciu próbach.
Sol rządzi w terminalu, ale przewaga jest mniejsza niż wcześniej. Remisuje z Opus 5 w Terminal-Bench 2.1, lecz dochodzi do 91,9% po włączeniu ultra. Sol wygrywa też DeepSWE v1.1 — test długohoryzontowej inżynierii na prawdziwych kodach — o 3,9 pkt, zużywając przy tym mniej niż połowę tokenów wyjściowych Fable 5 i o około jedną trzecią mniej kosztu.
Jedna rzecz z naszej praktyki: kiedy zbudowaliśmy agenta do naprawy błędów w Opus 5 i uruchomiliśmy go na pięciu poziomach wysiłku, low naprawił błąd we wszystkich trzech przebiegach, podczas gdy max zawiódł w jednym z trzech. Nieudany przebieg zwrócił raport poprawny schematycznie, ale całkowicie pusty — zero wywołań narzędzi i pole przyczyny ustawione na „b0”. Wniosek: ustrukturyzowane wyjście gwarantuje strukturę, nie treść, a większy wysiłek nie jest automatycznie lepszy. Szczegóły w naszym samouczku API Opus 5.
Moja ocena: jeśli twoi agenci żyją w powłoce i stać cię na ultra, Sol ma lekką przewagę. Jeśli żyją w repozytorium i muszą rozumieć architekturę w wielu plikach, przewagę ma Opus 5. Żaden model nie wygrywa „kodowania” jako całości, a każdy inny wniosek to dobór wygodnych benchmarków.
Obsługa komputera i przeglądanie
Obsługa komputera ma znaczenie, jeśli budujesz cokolwiek sterującego GUI — i tu podział wygląda jak w kodowaniu.
Opus 5 wygrywa OSWorld 2.0 z 70,6% wobec 62,6% Sol — różnica 8 pkt. Anthropic twierdzi też, że Opus 5 przebija najlepszy wynik Fable 5 w OSWorld przy nieco ponad jednej trzeciej kosztu, co ciekawsze, bo Fable 5 kosztuje $10 za milion tokenów wejściowych, a Opus 5 — $5.
Przeglądanie to praktycznie remis. Opus 5 raportuje 90,8% w BrowseComp; Sol ma 90,4%, rosnące do 92,2% z ultra przy szesnastu równoległych agentach. Znów, ultra robi tu różnicę.
Wynik Sol w OSWorld ma warte odnotowania twierdzenie o efektywności tokenowej: OpenAI mówi, że przewyższa Opus 4.8, używając o 85% mniej tokenów wyjściowych. To porównanie do poprzedniej generacji Anthropic, nie do Opus 5, więc nie ma zastosowania w tym pojedynku, ale sygnalizuje, że ścieżka Sol dla obsługi komputera jest niezwykle tania per zadanie.
Wykorzystanie narzędzi i automatyzacja
To wymiar, w którym luka w zdolnościach abstrakcyjnych przekłada się na domknięte zadania biznesowe — i tu wyraźnie prowadzi Opus 5.
W AutomationBench od Zapier, które mierzy, czy model potrafi przeprowadzić zadanie biznesowe od początku do końca, Opus 5 zdobywa 26,0% wobec 18,1% Sol. Anthropic raportuje, że jego odsetek sukcesów to ok. 1,5× kolejnego najlepszego modelu przy tym samym koszcie zadania i że nawet na najniższym poziomie wysiłku Opus 5 zalicza więcej zadań niż jakikolwiek inny model.
CEO Zapier, Wade Foster, opisuje konkretny przebieg: Opus 5 wziął surowy arkusz kondycji kont i wykonał sekwencję zapobiegania odpływowi klientów end-to-end — oznaczając konta ryzyka, alarmując właściwego opiekuna i podsumowując dla operacji retencyjnych. Poprzednie modele nie zdały; Opus 5 osiągnął 100%.
Kontrą Sol jest architektura, nie wyniki. Programmatic Tool Calling w Responses API pozwala Sol pisać małe programy koordynujące narzędzia, filtrować wyniki pośrednie i wybierać kolejny krok w trakcie pracy, co ogranicza liczbę rund z modelem w zadaniach narzędziowych. To realny mechanizm efektywności, ale inny niż „domykanie większej liczby zadań poprawnie”, a to właśnie mierzy AutomationBench.
Cyberbezpieczeństwo i nauka
Tu dostawcy podjęli celowo przeciwstawne decyzje — i to może samo rozstrzygać wybór dla części czytelników.
Anthropic nie trenował Opus 5 na zadaniach cyber. Mówi wprost, że Opus 5 nie przesuwa granicy w zdolnościach dual-use i pozostaje za Mythos 5 w biologii oraz ofensywnym cyber. W OSS-Fuzz Opus 5 identyfikuje podatności w tempie zbliżonym do Mythos 5, ale mocno odstaje w tworzeniu exploitów. Klasyfikatory cyber Opus 5 blokują skanowanie binarne pod kątem podatności, testy penetracyjne i generowanie exploitów — przy czym Anthropic oczekuje, że będą interweniować ok. 85% rzadziej niż w Fable 5.
OpenAI poszło w drugą stronę. Sol to najsilniejszy model cyberbezpieczeństwa OpenAI — a liczby są duże:
- ExploitBench: 73,5% wobec 47,9% GPT-5.5 przy porównywalnym budżecie tokenów wyjściowych
- ExploitGym: 24,9% w limicie dwóch godzin, rosnące do 33,7% przy sześciu godzinach, wobec 15,1% szczytu GPT-5.5
- SEC-Bench Pro: 71,2% wobec 45,8% GPT-5.5, przy lepszej latencji
- Capture-the-Flag: 96,7%
Obie firmy to ograniczają. OpenAI kieruje zaawansowane możliwości defensywne przez Trusted Access for Cyber od Daybreak, wymaga sprzętowych passkeyów do 1 września dla dalszego dostępu do najbardziej „cyber” modeli i mówi, że zabezpieczenia Sol blokują ok. 10× więcej potencjalnie szkodliwych działań niż wcześniej. Anthropic prowadzi Cyber Verification Program, który daje zapisanym firmom i badaczom mniej ograniczoną wersję Opus 5.
W nauce Opus 5 przebija Opus 4.8 we wszystkich ewaluacjach nauk o życiu u Anthropic, z największymi wzrostami w chemii organicznej (o 10,2 p.p. w wnioskowaniu struktur cząsteczek ze spektroskopii) i przewidywaniu funkcji sekwencji białek (o 7,7 p.p.). Sol raportuje 28,7% w GeneBench Pro wobec 12% GPT-5.5 i 59,9% w LifeSciBench. Brak wspólnego benchmarku — to nie jest porównanie, tylko dwaj dostawcy sprawdzający własną pracę na innych egzaminach.
Ceny
Stawki wejścia i odczytu z cache są identyczne przy standardowym kontekście, co usuwa jedną zmienną z decyzji. Zostaje 20% premii na wyjściu w Sol oraz dopłata za długi kontekst, którą pobiera tylko Sol.
Stawki tokenów obok siebie
| Stawka | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Wejście, za 1 mln tokenów | $5.00 | $5.00 |
| Wyjście, za 1 mln tokenów | $25.00 | $30.00 |
| Odczyt z cache wejścia, za 1 mln tokenów | $0.50 | $0.50 |
| Zapis do cache, za 1 mln tokenów | $6.25 | $6.25 |
| Dopłata za długi kontekst | Brak (płasko do 1 mln) | 2× wejście / 1,5× wyjście powyżej 272 tys. wejścia |
| Tryb Fast | 2× cena, ~2,5× szybkość | 2× cena, ~2,5× szybkość |
Cała różnica kosztów w krótkim kontekście spada na generację, więc premia Sol najmocniej boli przy rozwlekłym rozumowaniu i długiej formie. Kurczy się przy pracy z wyszukiwaniem, gdzie wysyłasz dużo więcej tokenów do wejścia niż na wyjściu — do momentu, gdy zadziała dopłata Sol za długi kontekst.
Oba modele mają teraz tryb Fast mniej więcej za 2× standardowej ceny i z ok. 2,5× prędkością. OpenAI 30 lipca 2026 scaliło dawny Priority Processing Sol w tryb Fast, więc ta dźwignia jest symetryczna i nie rozstrzyga wyboru.
Ile kosztuje prawdziwa praca
Stawki za milion tokenów trudno przełożyć na budżet, a jeden stały stosunek maskuje najważniejszy aspekt: różnica między tymi modelami zależy wyłącznie od kształtu obciążenia. Oto trzy reprezentatywne kształty przy stawkach standardowych, bez cache i zniżek batch.
| Obciążenie | Założona wielkość | Claude Opus 5 | GPT-5.6 Sol | Sol vs Opus |
|---|---|---|---|---|
| Ciężar na generacji | 250 tys. in / 1 mln out | $26.25 | $31.25 | +19% |
| Wyszukiwanie, poniżej 272 tys. | 250 tys. in / 25 tys. out | $1.88 | $2.00 | +7% |
| Wyszukiwanie, powyżej 272 tys. | 500 tys. in / 50 tys. out | $3.75 | $7.25 | +93% |
Przy pracy obciążonej generacją 20% premii na wyjściu niemal wprost przekłada się na koszt — Sol wychodzi o ok. 19% drożej. Przy krótkim wyszukiwaniu różnica niemal znika do ok. 7%, bo wyjście to zaokrąglenie w porównaniu z identyczną stawką wejścia.
Trzeci wiersz jest kluczowy. Gdy żądanie przekracza 272 tys. tokenów wejścia, dopłata Sol nakłada 2× wejście i 1,5× wyjście na całe żądanie, podczas gdy Opus 5 trzyma płasko do 1 mln, więc premia nie maleje w skali — niemal podwaja rachunek. Przy pracy ciężkiej na wyszukiwaniu lub dużym kontekście ta zmiana ma większe znaczenie niż nagłówkowa premia na wyjściu.
Dlaczego to samo zadanie kosztuje inaczej
Dwie rzeczy sprawiają, że identyczna praca generuje różne rachunki poza stawkami nagłówkowymi:
- Dopłata Sol za długi kontekst. Każde żądanie powyżej 272 tys. tokenów wejścia jest rozliczane jako 2× wejście i 1,5× wyjście dla całego żądania, więc jeden zbyt duży prompt przerzuca Sol do wyższej taryfy, której Opus 5 nie ma. To przełączenie stawki, nie różnica tokenowa — i jest już odzwierciedlone w trzecim wierszu powyżej.
- Sol
ultra. Ultra nie ma premii cenowej — rozlicza się w tych samych $5/$30 co bazowy Sol — ale jego tryb wieloagentowy, o wysokim wysiłku, zużywa znacznie więcej tokenów na zadanie, co może potroić koszt pracy agentowej względem bazowego Sol przy tych samych stawkach. To wartość raportowana, nie zmierzona.
Ta uwaga dotyczy ogólnie strony wyjścia. Deklaracje efektywności niemal zawsze porównują do innych modeli: Sol ma rzekomo mniej niż połowę tokenów wyjściowych Fable 5 na Coding Agent Index, a Anthropic raportuje, że Opus 5 generuje o 26% mniej tokenów niż Opus 4.8 przy maksymalnym rozumowaniu. Oba to porównania do poprzedników i nie zmieniają liczb powyżej.
Kiedy wybrać Claude Opus 5 vs GPT-5.6 Sol
Wyniki w wymiarach dość czysto odwzorowują rodzaje pracy, więc oto przewodnik decyzyjny, zanim rozwinę każdą stronę.
| Zastosowanie | Rekomendacja | Dlaczego |
|---|---|---|
| Rzeczywiście nowe problemy bez precedensu w treningu | Claude Opus 5 | 30,2% w ARC-AGI-3 wobec 7,78% Sol |
| Złożeni agenci terminalowi i wiersza poleceń | GPT-5.6 Sol | 88,8% w Terminal-Bench 2.1, rośnie do 91,9% z ultra |
| Refaktoryzacja i architektura na poziomie repozytorium | Claude Opus 5 | 79,2% w SWE-Bench Pro wobec 64,6% |
| Defensywne cyberbezpieczeństwo i odtwarzanie exploitów | GPT-5.6 Sol | 73,5% w ExploitBench; Opus 5 z założenia blokuje generowanie exploitów |
| Agenci sterujący GUI i obsługą komputera | Claude Opus 5 | 70,6% w OSWorld 2.0 wobec 62,6% |
| Długi kontekstowy retrieval na dużych zbiorach dokumentów | Claude Opus 5 | Kontekst 1 mln domyślnie, bez progu dopłaty |
| Wdrożenia enterprise multi-cloud | Claude Opus 5 | Dostępny na Bedrock, Vertex AI i Azure AI Foundry |
Wybierz Claude Opus 5, jeśli…
- Twoje problemy są naprawdę nowe. Różnica w ARC-AGI-3 to największy pojedynczy wynik w tym porównaniu i bezpośrednio przekłada się na prace badawcze i wszędzie tam, gdzie odpowiedzi nie ma w korpusie treningowym.
- Potrzebujesz agentów, którzy kończą zadania, a nie tylko je podejmują. Przewaga w AutomationBench to najsilniejszy sygnał o dowożeniu, a nie o samej zdolności.
- Pracujesz w długich kontekstach. 1 mln tokenów jako domyślny i maksymalny, bez progu dopłaty, to czystsza historia niż cokolwiek opublikował OpenAI o obsłudze kontekstu w Sol.
- Wymagasz wyrównania (alignment). Wynik audytu 2,3 to jak dotąd najlepszy wynik Anthropic — z najniższymi odsetkami zwodzenia i najmniejszą podatnością na skłonienie do nadużyć.
Wybierz GPT-5.6 Sol, jeśli…
- Uruchamiasz złożonych agentów żyjących w shellu. Tryb ultra wynosi go na szczyt
- Robisz pracę w defensywnym security. Wyniki ExploitBench, ExploitGym i SEC-Bench Pro są wysokie, a klasyfikatory Opus 5 aktywnie blokują generowanie exploitów — to nie jest bliski pojedynek.
- Chcesz wbudowaną orkiestrację wielu agentów.
ultrakoordynuje domyślnie czterech agentów i podbił BrowseComp do 92,2% przy szesnastu, a beta multi-agentowa w Responses API pozwala budować podobne wzorce samodzielnie.
Na koniec
Dwa tygodnie różnicy, dwie przeciwne strategie: Opus 5 stawia na nowatorskie rozumowanie i domykanie zadań, a Sol na pracę w terminalu, przeglądanie i defensywne bezpieczeństwo — z 20% premią na wyjściu.
Wybierz Opus 5, jeśli twoje problemy są naprawdę nowe, twoi agenci mają kończyć, a nie próbować, albo pracujesz w długich kontekstach, gdzie płaskie 1 mln bije dopłatę Sol; wybierz Sol, jeśli twoi agenci żyją w shellu, robisz odtwarzanie exploitów, które Opus 5 z założenia blokuje, lub stać cię na ultra, by przewodzić w terminalu i przeglądaniu.
W większości innych wymiarów różnice są mniejsze niż sugeruje marketing, więc dopasuj model do dominującego rodzaju pracy, nie do nagłówkowego benchmarku.
FAQ
Czy Claude Opus 5 czy GPT-5.6 Sol jest lepszy?
Żaden nie jest lepszy we wszystkim. Opus 5 prowadzi w rozumowaniu abstrakcyjnym i kodowaniu na poziomie repozytorium, podczas gdy GPT-5.6 Sol jest mocniejszy w zadaniach długohoryzontowych, a w kodowaniu terminalowym i kosztach są blisko. Właściwy wybór zależy od twojego konkretnego obciążenia, nie od ogólnego rankingu.
Który model jest tańszy?
Opus 5 jest tańszy we wszystkich trzech testowanych obciążeniach, ale różnica się zmienia: tylko 7% poniżej 272 tys. kontekstu, 19% przy zadaniach ciężkich na generacji i 93% po przekroczeniu 272 tys. tokenów wejściowych, gdzie stawka Sol skacze. Jeśli rzadko trafiasz duże konteksty, oba są prawie równe cenowo.
Który model jest lepszy do kodowania?
To zależy od rodzaju pracy programistycznej. W tych benchmarkach Opus 5 prowadzi w zadaniach na poziomie repo (SWE-Bench Pro, 79,2% vs 64,6%) i jest w przybliżeniu remis w terminalu (89,1% vs 88,8%), natomiast GPT-5.6 Sol prowadzi w długohoryzontowym kodowaniu (72,7% vs 68,8%). Nie ma jednego zwycięzcy — dobierz model do tego, czy twoja praca to edycje w repo, automatyzacja terminala, czy długie wieloetapowe zadania.
Czy mogę łatwo przełączać się między tymi modelami?
Częściowo. Oba działają na osobnych API z różnymi cenami, więc przejście oznacza nowe endpointy i trochę poprawek promptów. Większą pułapką jest koszt: cena Sol mniej więcej podwaja koszt względem Opus 5 powyżej 272 tys. tokenów, więc to, co jest tanie w jednym, może być drogie w drugim.
Czy wyniki benchmarków mówią mi, którego modelu użyć?
Częściowo. Różnica w rozumowaniu jest ogromna (30,2% vs 7,78%), ale oba modele mają tam niskie wyniki bezwzględne, więc może to nie wpływać na codzienne użycie. Wyniki w kodowaniu są wysokie i bliskie, więc testy na prawdziwych zadaniach znaczą więcej niż tabela wyników.
