course
Anthropic और OpenAI दोनों के इस सप्ताह नए रिलीज़ आए हैं, लेकिन दोनों लॉन्च अलग-अलग चरणों में हैं।
GPT-5.6 का अनावरण हो चुका है, लेकिन यह सीमित प्रीव्यू के पीछे लॉक है। और जबकि GPT-5.6 सामान्य रूप से उपलब्ध नहीं है, Claude Sonnet 5 आज शिप हो गया है और हर Claude प्लान पर लाइव है — ऐसे परिचयात्मक API मूल्य निर्धारण के साथ जो फिलहाल GPT-5.6 के मिड-टियर मॉडल Terra से भी सस्ता बैठता है।
यहाँ हम प्रत्येक मॉडल के बारे में क्या जानते हैं, वे एक-दूसरे के मुकाबले कैसे ठहरते हैं, और जहाँ संख्याएँ ओवरलैप होती हैं।
Claude Sonnet 5 क्या है?
Claude Sonnet 5 Anthropic का नवीनतम मिड-टियर मॉडल है, और कंपनी इसे अब तक का सबसे अधिक एजेंटिक Sonnet मॉडल बता रही है। दलील यह है कि यह प्लानिंग और टूल उपयोग पर Opus-क्लास मॉडलों के साथ का बड़ा अंतर घटाता है, जबकि कीमत अर्थपूर्ण रूप से कम रखता है।
Anthropic का कहना है कि Sonnet 5, Sonnet 4.6 की तुलना में रीज़निंग, कोडिंग, और टूल उपयोग पर एक बड़ा कदम आगे है, और अब इसका प्रदर्शन कई एजेंटिक इवैल्यूएशनों पर Opus 4.8 के कुछ क़रीब बैठता है, जिनमें BrowseComp (एजेंटिक सर्च) और OSWorld-Verified (कंप्यूटर उपयोग) शामिल हैं।
कच्ची शुद्धता पर Opus 4.8 अब भी आगे है, खासकर ऊँची या सर्वोच्च प्रयास सेटिंग्स पर, लेकिन Sonnet 5 डेवलपर्स को कीमत-से-प्रदर्शन का एक मजबूत विकल्प देता है। Anthropic के मिड-टियर मॉडलों का रिकॉर्ड रहा है कि नई पीढ़ी आने पर वे अपने वजन वर्ग से ऊपर मुक्का मारते हैं, जब तक अगला Opus रिफ्रेश पकड़ में न आ जाए। अब भले यह बहुत पुरानी बात लगे, पर Claude Sonnet 3.5 ने 2024 में कई बेंचमार्क पर पुराने Claude Opus 3 को वास्तव में पछाड़ दिया था।
Sonnet 5 एक अपडेटेड टोकनाइज़र भी उपयोग करता है, जिसका मतलब है कि वही इनपुट टेक्स्ट पहले की तुलना में अधिक टोकनों में मैप हो सकता है (लगभग 1.0–1.35x, सामग्री पर निर्भर)।
GPT-5.6 क्या है?
GPT-5.6 एक एकल मॉडल नहीं है। यह तीन मॉडलों का परिवार है, जो एक नई नेमिंग स्कीम के तहत संगठित है जहाँ नंबर जनरेशन को दर्शाता है और नाम क्षमता-टियर को:
-
Sol फ़्लैगशिप है। यह एकमात्र टियर है जिसे दो नए कंट्रोल्स का एक्सेस है: एक
maxरीजनिंग-इफ़र्ट सेटिंग औरultra mode, जो किसी कार्य को सबएजेंट्स के पूल में वितरित करता है। -
Terra रोज़मर्रा का, संतुलित मॉडल है — कुल मिलाकर गुणवत्ता पर लगभग GPT-5.5 के तुल्य, लगभग आधी कीमत पर।
-
Luna लो-कॉस्ट टियर है, जो लेटेंसी-संवेदनशील वर्कलोड्स के लिए लक्षित है।
इस खबर के साथ, OpenAI कोडिंग, बायोलॉजी, और साइबरसिक्योरिटी में बढ़त पर प्रकाश डाल रहा है। बड़ा बेंचमार्क किस्सा कई दिलचस्प बेंचमार्क्स पर इसका प्रदर्शन था — सबसे उल्लेखनीय Terminal-Bench 2.1, साथ ही GeneBench v1, जो एक लॉन्ग-होराइजन जीनोमिक्स बेंचमार्क है, और दो एक्सप्लॉइट-डेवलपमेंट बेंचमार्क (ExploitBench और ExploitGym)।
Claude Sonnet 5 और GPT-5.6 बेंचमार्क तुलना
अपने-अपने घोषणापत्रों से, Sonnet 5 और GPT-5.6 में ऐसा एक भी साझा बेंचमार्क नहीं है जहाँ दोनों के आँकड़े उपलब्ध हों।
हालाँकि Anthropic ने अपने लॉन्च पोस्ट और सिस्टम कार्ड में Sonnet 5 के कुछ ठोस आँकड़े प्रकाशित किए हैं, OpenAI ने अब तक GPT-5.6 के लिए केवल एक बेंचमार्क स्कोर की पुष्टि की है: Terminal-Bench 2.1। यहाँ दोनों पक्षों के लिए दर्ज बातों को साथ रखा गया है:
| बेंचमार्क | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Sol Ultra | GPT-5.6 Terra | GPT-5.6 Luna |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | प्रकाशित नहीं | 88.8% | 91.9% | 82.5% | 84.3% |
| SWE-bench Pro | 63.2% | प्रकाशित नहीं | — | प्रकाशित नहीं | प्रकाशित नहीं |
| OSWorld-Verified (कंप्यूटर उपयोग) | 81.2% | प्रकाशित नहीं | — | प्रकाशित नहीं | प्रकाशित नहीं |
| Humanity's Last Exam (टूल्स सहित) | 57.4% | प्रकाशित नहीं | — | प्रकाशित नहीं | प्रकाशित नहीं |
Terminal-Bench 2.1 वही पंक्ति है जहाँ GPT-5.6 ने कुछ भी प्रकाशित किया है, और Sonnet 5 के पास वहाँ रखने के लिए कोई प्रकाशित स्कोर नहीं है। हो सकता है यह रणनीतिक हो क्योंकि GPT-5.6 ने अच्छा किया।
जिन बेंचमार्क्स पर Sonnet 5 के पास आँकड़े हैं — SWE-bench Pro, OSWorld-Verified, Humanity's Last Exam — वहाँ GPT-5.6 ने अभी तक अपनी बाज़ी नहीं खोली है, इसलिए तुलना के लिए कुछ नहीं है।
ईमानदार निष्कर्ष यह है कि Sonnet 5 बनाम GPT-5.6 की सच्ची बेंचमार्क तुलना अभी पूरी तरह मौजूद नहीं है। प्रत्येक कंपनी ने अलग-अलग इवैल्स प्रकाशित किए हैं।
थोड़ा दूर से देखें: व्यापक परिदृश्य में प्रत्येक मॉडल कहाँ बैठता है
चूँकि Sonnet 5 और GPT-5.6 सीधे ओवरलैप नहीं करते, यह देखने लायक है कि प्रत्येक के प्रकाशित स्कोर बाकी फ़ील्ड — Opus 4.8, निलंबित Fable 5, GPT-5.5, और Gemini 3.1 Pro — के मुकाबले कैसे ठहरते हैं। यह Sonnet 5 बनाम GPT-5.6 का फैसला नहीं करेगा, पर यह दिखाता है कि दोनों समान प्रतिस्पर्धियों के सापेक्ष कहाँ स्थित हैं:
| बेंचमार्क | Claude Opus 4.8 | Claude Fable 5 (निलंबन से पहले) | GPT-5.5 | Gemini 3.1 Pro | GPT-5.6 Sol Ultra |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 78.9% | 83.4% | 88.0% | 70.7% | 91.9% |
| SWE-bench Pro | 69.2% | 80.3% | 58.6% | — | प्रकाशित नहीं |
| Humanity's Last Exam (बिना टूल्स) | 49.8% | 59.0% | — | 44.4% | प्रकाशित नहीं |
कुछ बातें: Terminal-Bench 2.1 पर, GPT-5.6 Sol Ultra का 91.9% हर दर्ज Claude मॉडल, जिनमें Opus 4.8 का 78.9% भी शामिल है, से अधिक है। इसलिए जब OpenAI, GPT-5.6 के Terminal-Bench 2.1 स्कोर पर शेख़ी बघार रहा था, तो वह बढ़ा-चढ़ाकर नहीं था।
Fable 5 अब भी SWE-bench Pro और Humanity's Last Exam पर Opus 4.8 और GPT-5.5 से आगे है, भले ही वह निलंबित हो। इसके आँकड़ों को अभी तक किसी ने नहीं पछाड़ा है, GPT-5.6 सहित (जिसने तुलना के लिए कोई SWE-bench या HLE स्कोर प्रकाशित नहीं किया)। Sonnet 5 का SWE-bench Pro पर 63.2% (ऊपर की तालिका से) GPT-5.5 के 58.6% से ऊपर बैठेगा, लेकिन Opus 4.8 और Fable 5 से नीचे — यह अधिकतम एक ढीला प्रॉक्सी है, क्योंकि दो अलग कंपनियों की अलग तालिकाओं में अलग मॉडल जनरेशन पढ़ी जा रही है।
Claude Sonnet 5 और GPT-5.6 की कीमतें
| मॉडल | इनपुट (प्रति 1M टोकन) | आउटपुट (प्रति 1M टोकन) |
|---|---|---|
| Claude Sonnet 5 (परिचयात्मक, 31 अगस्त, 2026 तक) | $2.00 | $10.00 |
| Claude Sonnet 5 (मानक) | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| GPT-5.6 Terra | $2.50 | $15.00 |
| GPT-5.6 Luna | $1.00 | $6.00 |
सूची मूल्य पर, Sonnet 5 का परिचयात्मक मूल्य GPT-5.6 Terra और Luna के बीच आता है, और Sol से काफी नीचे। लेकिन दिलचस्प बात यह है कि परिचयात्मक मूल्य $2/$10 पर, Sonnet 5 वास्तव में GPT-5.6 Terra के $2.50/$15 से सस्ता है — कम से कम गर्मियों तक, जब तक कीमत नहीं बढ़ती।
स्पष्ट रहे, मूल्य निर्धारण की कहानी सिर्फ साधारण अनुमानित गणित से थोड़ी अधिक जटिल है। Anthropic बताता है कि Sonnet 5 का परिचयात्मक मूल्य निर्धारण नए टोकनाइज़र के अधिक टोकन काउंट्स के बावजूद लगभग कॉस्ट-न्यूट्रल रहने के लिए कैलिब्रेट किया गया है। और OpenAI अपनी तरफ से GPT-5.6 और बाद के मॉडलों के लिए अधिक पूर्वानुमेय प्रॉम्प्ट कैशिंग पेश कर रहा है, जहाँ कैश राइट्स का बिलिंग अनकैश्ड इनपुट रेट के 1.25x पर होगी और कैश रीड्स पर 90% की छूट बनी रहेगी।
फिर शुरुआत से ही मानक दर तय करने के बजाय, परिचयात्मक रियायती मूल्य के साथ लॉन्च क्यों? टोकनाइज़र वाली व्याख्या इसका एक हिस्सा कवर करती है, लेकिन टाइमिंग भी उसी चीज़ से मेल खाती है जो हम देख रहे हैं: एक भीड़भाड़ और तेज़ी से बदलता मैदान। पिछले कुछ हफ्तों में ही, Sakana AI ने Fugu लॉन्च किया, जो एक ऑर्केस्ट्रेटर है जो फ्रंटियर मॉडलों के पूल में रूट करता है और दावा करता है कि वह Anthropic के ही Mythos-क्लास सिस्टम्स के नज़दीक पहुँच जाता है, वह भी बहुत कम लागत पर। तो अगस्त के अंत तक Sonnet 5 को $2/$10 पर कीमत देना Anthropic को एक सचमुच सस्ता, व्यापक रूप से उपलब्ध एजेंटिक मॉडल देता है, जबकि GPT-5.6 अब भी प्रीव्यू में बंद है। ऐसा मॉडल होना जिसे लोग वास्तव में कम कीमत पर आज़मा सकें, एक असली प्रतिस्पर्धात्मक बढ़त है।
Claude Sonnet 5 और GPT-5.6 की उपलब्धता
Claude Sonnet 5 आज, हर जगह उपलब्ध है। यह Free और Pro प्लान्स पर डिफ़ॉल्ट मॉडल है, Max, Team, और Enterprise पर सुलभ है, और Claude Code तथा Claude Platform पर API के ज़रिए लाइव है (मॉडल स्ट्रिंग claude-sonnet-5)। आप ने शायद घोषणा देखने से पहले ही चैट विंडो में Claude Sonnet 5 को देख लिया होगा।

GPT-5.6 सामान्य रूप से उपलब्ध नहीं है। प्रीव्यू के दौरान, यह केवल API और Codex के माध्यम से चुनिंदा साझेदारों के लिए सुलभ है। OpenAI कहता है कि व्यापक उपलब्धता आने वाली है, लेकिन तारीख नहीं दी है।
अंतिम विचार
एकमात्र ओवरलैपिंग बेंचमार्क पर, GPT-5.6 का फ़्लैगशिप टियर Claude के वर्तमान फ़्लैगशिप Opus 4.8 से ऊँचे स्कोर रिपोर्ट करता है, जो संकेत देता है कि GPT-5.6 के व्यापक रूप से शिप होने पर OpenAI के पास वास्तविक क्षमता बढ़त हो सकती है। लेकिन Sonnet 5 वास्तव में क्षमता पर Sol या Terra का सीधा प्रतिद्वंद्वी नहीं है — यह एक मिड-टियर मॉडल है जो प्रति डॉलर एजेंटिक प्रदर्शन पर प्रतिस्पर्धा करता है, और उस मोर्चे पर यह उपलब्ध है, इसकी कीमत आक्रामक है, और यह आज ही काम करता है।

मैं एक डेटा साइंस संपादक हूँ और वैज्ञानिक पत्रिकाओं में प्रकाशित शोध लेखों में योगदान दे चुका/चुकी हूँ। मुझे विशेष रूप से रैखिक बीजगणित, सांख्यिकी, R, और इसी तरह के विषयों में रुचि है।