मुख्य सामग्री पर जाएं

ARC-AGI-3: नया इंटरएक्टिव रीज़निंग बेंचमार्क

ARC-AGI-3 कैसे काम करता है, यह AI एजेंटों को एक्शन दक्षता पर कैसे स्कोर करता है, और क्यों लॉन्च पर परखे गए हर फ्रंटियर मॉडल का स्कोर 1% से नीचे रहा जबकि मनुष्यों ने सब हल कर लिया।
अपडेट किया गया 25 सित॰ 2026  · 13 मि॰ पढ़ें

AI के साथ खोजें

ChatGPTClaudePerplexity

अधिकांश AI बेंचमार्क एक ही फ़ॉर्मूला अपनाते हैं: मॉडल को एक प्रश्न दें, उत्तर लें, और जाँचें कि वह सही है या नहीं। वर्षों तक यह तरीका काफी हद तक काम करता रहा। लेकिन जैसे-जैसे फ्रंटियर मॉडल लगभग हर प्रमुख मूल्यांकन में 90% से ऊपर स्कोर करने लगे, एक जानी-पहचानी समस्या उभरी। बेंचमार्क अलग-अलग मॉडलों में फर्क बताने की क्षमता खोने लगे।

ARC-AGI-3 एक अलग राह लेता है। स्पष्ट इनपुट-आउटपुट जोड़ों वाले स्थिर पहेलियों की जगह, यह AI एजेंटों को बिना किसी निर्देश, घोषित लक्ष्य, या स्पष्ट नियमों के इंटरएक्टिव वातावरण में डालता है। एजेंट को हर चीज़ खुद परीक्षण और अवलोकन से समझनी पड़ती है—ठीक वैसे ही जैसे किसी व्यक्ति को ऐसा खेल थमा दिया जाए जिसे उसने पहले कभी न देखा हो।

25 मार्च, 2026 को ARC Prize Foundation द्वारा लॉन्च किए गए ARC-AGI-3 ने जारी होने पर एक उल्लेखनीय नतीजा दिया: हर फ्रंटियर AI मॉडल का स्कोर 1% से नीचे रहा, जबकि मनुष्यों ने बेंचमार्क के सभी वातावरण हल कर लिए।

ARC-AGI-3 क्या है

ARC-AGI-3 एक इंटरएक्टिव रीज़निंग बेंचमार्क है जिसे ARC Prize Foundation ने बनाया है, जिसके सह-संस्थापक AI शोधकर्ता François Chollet (Keras के निर्माता) और Mike Knoop (Zapier के सह-संस्थापक) हैं। यह बेंचमार्क ARC Prize टीम के एक मूल सिद्धांत पर आधारित है: सच्ची बुद्धिमत्ता इस बात पर नहीं टिकी कि कोई प्रणाली कितना जानती है, बल्कि इस पर कि वह पूरी तरह नई चीज़ को कितनी कुशलता से सीख सकती है।

जहां पहले के AI मूल्यांकन स्फटिकीकृत ज्ञान (याद किए तथ्यों की पुनर्प्राप्ति, प्रशिक्षित हीयूरिस्टिक्स का उपयोग) को परखते हैं, ARC-AGI-3 तरल बुद्धिमत्ता को निशाना बनाता है—यानी प्रशिक्षण के दौरान सीखी चीज़ों पर निर्भर रहने के बजाय नए समस्याओं पर तर्क करने और नई स्थितियों के अनुकूल होने की क्षमता। यह मापता है कि क्या कोई AI एजेंट अपरिचित वातावरण का अन्वेषण कर सकता है, नियम समझ सकता है, "जीतने" का स्वरूप पहचान सकता है, और फिर उस समझ पर कुशलता से अमल कर सकता है।

बेंचमार्क में सार्वजनिक, अर्ध-निजी और पूर्ण निजी सेटों में 135 वातावरण शामिल हैं। हर वातावरण एक टर्न-आधारित, गेम-जैसा परिदृश्य है जिसे इन-हाउस डिज़ाइन टीम ने बनाया है। एजेंट को कोई संकेत नहीं दिया जाता। वह बस दुनिया की स्थिति देखता है, एक क्रिया करता है, परिणाम देखता है, और दोहराता है।

ARC-AGI-3 का इंटरएक्टिव वातावरण गेमप्ले। वीडियो: लेखक।

इसकी तकनीकी शोध-पत्र में बेंचमार्क को चार मूल क्षमताओं की परीक्षा के रूप में वर्णित किया गया है: अन्वेषण, मॉडलिंग, लक्ष्य-निर्धारण, और योजना बनाना।

मूल ज्ञान पूर्वधारणाएँ

यह सुनिश्चित करने के लिए कि बेंचमार्क प्रशिक्षण डेटा की पुनरावृत्ति नहीं बल्कि तर्क को मापे, ARC-AGI-3 के वातावरण भाषा, संख्याएँ, अक्षर, सांस्कृतिक प्रतीक, या पहचाने जाने योग्य वास्तविक वस्तुओं से बचते हैं। इसके बजाय, वे केवल ARC Prize टीम द्वारा कही गई "कोर नॉलेज" पूर्वधारणाओं पर आधारित हैं—ऐसी बुनियादी संज्ञानात्मक क्षमताएँ जो सभी मनुष्यों में साझा होती हैं।

इन पूर्वधारणाओं में वस्तुनिष्ठता (यह समझना कि चीज़ें स्थायी इकाइयाँ हैं जो चल-टकरा सकती हैं), बुनियादी ज्यामिति और टोपोलॉजी (समानता, घूर्णन, "अंदर" बनाम "बाहर"), बुनियादी भौतिकी (संवेग, गुरुत्व, उछाल), और एजेंटनेस (यह पहचानना कि वातावरण में कोई चीज़ उद्देश्यपूर्वक कार्य कर रही है) शामिल हैं। अगर किसी वातावरण में यह जानना ज़रूरी हो कि चाबी ताला खोलती है, तो वह तर्क के बजाय प्रशिक्षण डेटा की परीक्षा होगी।

ARC-AGI-3 कैसे काम करता है

स्थिर मूल्यांकन से इंटरएक्टिव वातावरण की ओर झुकाव बेंचमार्क के वास्तविक मापन को बदल देता है।

एजेंट क्या देखते और करते हैं

हर ARC-AGI-3 वातावरण 64×64 ग्रिड प्रस्तुत करता है जहां प्रत्येक सेल 16 संभावित रंगों में से एक दिखाता है। एजेंट को दृश्य अवस्था ("फ्रेम") एक JSON ऑब्जेक्ट के रूप में मिलती है, फिर वह प्रति टर्न एक क्रिया सबमिट करता है। एक्शन स्पेस छोटा है: आमतौर पर पाँच दिशात्मक या कुंजी-आधारित कमांड, साथ में विशिष्ट ग्रिड सेल चुनने के लिए वैकल्पिक निर्देशांक-आधारित "क्लिक" क्रिया।

वातावरण सख्ती से टर्न-आधारित हैं। जब तक एजेंट कार्य नहीं करता, कुछ नहीं बदलता—जिसका अर्थ है कि बेंचमार्क तेज़ रिफ्लेक्स के बजाय सावधान तर्क को पुरस्कृत करता है। महत्वपूर्ण रूप से, आंतरिक प्रक्रियाएँ—जैसे रीज़निंग स्टेप्स, रिट्राई, या टूल कॉल—क्रिया नहीं मानी जातीं। केवल वे कमांड जो वास्तव में वातावरण की अवस्था बदलते हैं, एजेंट के स्कोर में गिनी जाती हैं।

लेवल और वातावरण का आपसी संबंध

हर वातावरण में कई लेवल होते हैं जो कठिनाई के बढ़ते क्रम में व्यवस्थित हैं। पहला लेवल ट्यूटोरियल की तरह काम करता है, जो न्यूनतम जटिलता के साथ बुनियादी यांत्रिकी से परिचय कराता है। बाद के लेवल नए नियम और अंतःक्रियाएँ जोड़ते हैं, इसलिए एजेंट को सीखी हुई चीज़ें आगे बढ़ाकर अधिक जटिल स्थितियों में लागू करनी पड़ती हैं।

ARC-AGI-3 में कठिनाई अस्पष्टता या पैमाने से नहीं आती। यह कई यांत्रिकियों की रचना से आती है, जो लेवल दर लेवल सीखी जाती हैं। एकल-यांत्रिकी वाला वातावरण ब्रूट-फोर्स से बहुत आसान हो जाएगा। असली परीक्षा कई सीखी हुई गतिशीलताओं को जोड़कर ऐसी समस्या हल करना है जिसे एजेंट ने पहले कभी नहीं देखा।

बेंचमार्क एक कस्टम Python-आधारित इंजन पर चलता है जिसे हेडलेस मोड में 1,000 FPS प्रदर्शन सीमा पूरी करने के लिए डिज़ाइन किया गया है। डेवलपर pip install arc-agi से शुरुआत कर सकते हैं और SDK या REST API के माध्यम से वातावरण के साथ इंटरेक्ट कर सकते हैं। आप ब्राउज़र में सार्वजनिक वातावरण खेल कर यह भी देख सकते हैं कि ये गेम कैसे दिखते हैं।

ARC-AGI-3 पर मॉडलों का प्रदर्शन

एक बात पहले से जान लें: ये स्कोर मार्च 2026 के अंत तक की लीडरबोर्ड स्थिति दर्शाते हैं और शोधकर्ता नए तरीकों के साथ आते ही लगभग निश्चित रूप से बदलेंगे।

लॉन्च पर, ARC Prize Foundation ने अर्ध-निजी मूल्यांकन सेट पर कई फ्रंटियर मॉडलों का परीक्षण किया।

लॉन्च-समय स्कोर (मार्च 2026): फ्रंटियर AI बनाम मानव बेसलाइन। इमेज: लेखक।

संदर्भ के लिए, यही फ्रंटियर मॉडल अधिकांश अन्य AI बेंचमार्क में हावी हैं। ARC-AGI-1 संतृप्ति के करीब है, जहां शीर्ष मॉडल अब 90% से काफी ऊपर स्कोर कर रहे हैं। ARC-AGI-3 पर 1% से कम का गिरना इंगित करता है कि यहां परखी जा रही क्षमताएँ मौजूदा मॉडलों की ताकतों से भिन्न हैं।

Grok-4.20 के लिए 0% स्कोर का मतलब यह नहीं कि मॉडल ने कोई क्रिया नहीं की। इसका अर्थ है कि मॉडल हर लेवल पर बेंचमार्क की एक्शन कटऑफ़ सीमा से अधिक चला गया। स्कोरिंग अनुभाग में मैं बताऊँगा कि वह कटऑफ़ कैसे काम करता है।

नॉन-LLM तरीकों से शुरुआती संकेत

प्रीव्यू अवधि में शीर्ष स्कोर करने वाले एजेंट भाषा मॉडल नहीं थे। प्रीव्यू प्रतियोगिता के दौरान (जिसमें 3 सार्वजनिक और 3 निजी वातावरण एक छिपे मूल्यांकन सेट के रूप में थे), Tufa Labs की StochasticGoose प्रणाली ने रीइन्फोर्समेंट लर्निंग और कन्वोल्यूशनल न्यूरल नेटवर्क्स के साथ 12.58% हासिल किया।

हालाँकि, जब StochasticGoose को लॉन्च पर पूरे आधिकारिक बेंचमार्क पर परखा गया, तो इसका स्कोर घटकर 0.25% रह गया—लगभग फ्रंटियर LLMs के बराबर। यह नतीजा बताने वाला है: कुछ जानी-पहचानी वातावरणों पर कारगर तरीका अनदेखे पूरे दायरे के सामने बहुत कमजोर पड़ गया—यह पुष्ट करता है कि ARC-AGI-3 कार्य-विशिष्ट ऑप्टिमाइज़ेशन के बजाय सामान्य अनुकूलनशीलता पर बहुत निर्भर करता है।

यह संकेत देता है कि इंटरएक्टिव फ़ॉर्मेट अलग आर्किटेक्चर के साथ बेहतर काम कर सकता है, क्योंकि भाषा मॉडल ऐसी समस्या पर तर्क से नहीं निकल सकता जिसमें आवश्यक जानकारी हर क्रिया के बाद ही प्रकट होती है।

ताज़ा स्कोर आप ARC-AGI-3 लीडरबोर्ड पर देख सकते हैं।

ARC-AGI-3 बनाम ARC-AGI-1 और ARC-AGI-2

इन संख्याओं का अर्थ तब बदल जाता है जब आप समझते हैं कि पहले के ARC बेंचमार्क क्या परखते थे। 2019 में Chollet द्वारा जारी ARC-AGI-1 ने अमूर्त दृश्य पहेलियों के माध्यम से तरल बुद्धिमत्ता को नापने की अवधारणा पेश की। फ़ॉर्मेट स्थिर था: मॉडल कुछ इनपुट-आउटपुट ग्रिड उदाहरण देखता, रूपांतरण नियम का अनुमान लगाता, और एक आउटपुट देता। मार्च 2025 में जारी ARC-AGI-2 ने उसी स्थिर फ़ॉर्मेट का इस्तेमाल किया, लेकिन कठिन, अधिक संयोज्य कार्यों के साथ।

ARC-AGI-1 ने बड़े रीज़निंग मॉडलों के उदय को एक नई श्रेणी के रूप में पहचानने में मदद की—OpenAI का o3 पहला स्पष्ट संकेत था। ARC-AGI-2 ने देखा कि वह रीज़निंग क्षमता कितनी तेज़ी से स्केल हुई। लेकिन स्थिर फ़ॉर्मेट में एक कमजोरी थी: टेस्ट-टाइम कम्प्यूट स्केलिंग। इन्फरेंस के दौरान हजारों प्रत्याशी समाधान समानांतर में जनरेट करके, लैब्स ने ARC-AGI-2 स्कोर को एक साल में एकल-अंकों से 50% से काफी ऊपर तक पहुँचा दिया।

Timeline diagram showing the evolution from ARC-AGI-1 static puzzles in 2019 to ARC-AGI-3 interactive environments in 2026

समय के साथ ARC-AGI बेंचमार्क का विकास। इमेज: लेखक।

ARC-AGI-3 ब्रूट-फोर्स सैंपलिंग रणनीति को लागू करना बहुत कठिन बना देता है क्योंकि, जैसा मैंने पहले कहा, वातावरण अपने नियम तभी प्रकट करता है जब एजेंट कार्य करता है। जब समस्या हर क्रिया के साथ बदलती है तो आप कॉन्टेक्स्ट विंडो में 10,000 प्रत्याशी समाधान नहीं जनरेट कर सकते।

ARC-AGI-3 शॉर्टकट्स का कैसे प्रतिरोध करता है

इंटरएक्टिव फ़ॉर्मेट के अलावा, ARC-AGI-3 में कुछ विशेष डिज़ाइन विकल्प शामिल हैं जो पहले के संस्करणों को प्रभावित करने वाले डेटा संदूषण और सिंथेटिक जनरेशन शॉर्टकट्स का मुकाबला करने के लिए बनाए गए हैं। सबसे उल्लेखनीय बदलाव है उलटा डेटासेट अनुपात। ARC-AGI-1 और ARC-AGI-2 में सार्वजनिक बनाम निजी कार्यों का अनुपात लगभग 10:1 था, जिससे शोधकर्ताओं को व्यापक प्रशिक्षण सामग्री मिली। ARC-AGI-3 इसे पलट देता है: केवल 25 वातावरण सार्वजनिक हैं, जबकि भारी बहुमत अर्ध-निजी और पूर्ण निजी सेटों में रखा गया है जिनका उपयोग मूल्यांकन के लिए होता है।

ARC Prize टीम ने यह भी संकेत दिया है कि कुछ फ्रंटियर मॉडलों के प्रशिक्षण सेट में ARC डेटा हो सकता है। ARC-AGI-2 के मूल्यांकन के दौरान, Gemini 3 की चेन-ऑफ-थॉट रीज़निंग ने बिना प्रॉम्प्ट के ARC-विशिष्ट रंग मैपिंग का संदर्भ दिया, जो प्रशिक्षण डेटा संतृप्ति का संकेत देता है। सार्वजनिक सतह क्षेत्र को घटाकर और ऐसे इंटरएक्टिव वातावरण पर शिफ्ट होकर जिन्हें स्थिर पैटर्न के रूप में याद नहीं किया जा सकता, ARC-AGI-3 ऐसे शॉर्टकट को बहुत कठिन बनाना चाहता है।

ARC-AGI-3 क्या मापने के लिए डिज़ाइन किया गया है

ये डिज़ाइन विकल्प तब और स्पष्ट हो जाते हैं जब आप समझते हैं कि बेंचमार्क असल में क्या परखना चाहता है। बेंचमार्क उस चीज़ को लक्षित करता है जिसे ARC Prize टीम "स्किल-अधिग्रहण दक्षता" कहती है: कोई AI एजेंट किसी ऐसी चीज़ को, जिसका उसने पहले कभी सामना न किया हो, कितनी कुशलता से सीख सकता है।

Diagram showing the four core capabilities tested by ARC-AGI-3: exploration, modeling, goal-setting, and planning

ARC-AGI-3 द्वारा मापी जाने वाली चार मूल क्षमताएँ। इमेज: लेखक।

ये चारों क्षेत्र हर वातावरण में एक साथ परखे जाते हैं—किसी भी चरण पर कोई निर्देश या घोषित उद्देश्य नहीं दिया जाता।

ARC-AGI-3 पर 100% स्कोर का अर्थ होगा कि कोई AI एजेंट हर वातावरण उतनी ही कुशलता से हल कर सकता है जितना कि दूसरे-सर्वश्रेष्ठ मानव परीक्षक। ARC Prize टीम स्पष्ट है कि यह AGI के बराबर नहीं होगा। इसका मतलब होगा कि AI और मानव सीखने के बीच का एक विशेष अंतर पाट दिया गया है।

ARC-AGI-3 का स्कोर कैसे किया जाता है

स्कोरिंग वह क्षेत्र है जहाँ ARC-AGI-3 सबसे अलग है। यह केवल यह नहीं देखता कि एजेंट अंततः किसी समाधान पर टकरा गया या नहीं। यह मापता है कि एजेंट वहाँ तक कितनी कुशलता से पहुँचा।

RHAE स्कोरिंग फ़ॉर्मूला

इस मीट्रिक को RHAE कहा जाता है—Relative Human Action Efficiency। प्रति-लेवल फ़ॉर्मूला है:

Level Score = min(1.0, (human_baseline_actions / AI_actions))²

मुख्य बात है वर्ग (स्क्वायर्ड) पद। यह रैखिक संबंध नहीं है। क्रिया-गिनती दोगुनी करने से स्कोर आधा नहीं, एक-चौथाई हो जाता है। दस गुना क्रिया स्कोर को लगभग शून्य तक गिरा देती है। यह पावर-लॉ डिज़ाइन ब्रूट-फोर्स तरीकों को कड़ी सज़ा देता है और उन एजेंटों को पुरस्कृत करता है जो वास्तव में वातावरण को समझते हैं।

Diagram illustrating RHAE scoring with three examples showing how AI action counts relative to a human baseline produce different scores

किये गए उदाहरणों के साथ RHAE स्कोरिंग फ़ॉर्मूला। इमेज: लेखक।

मानव बेसलाइन 10 परीक्षकों में से दूसरे-सर्वश्रेष्ठ प्रदर्शनकर्ता द्वारा तय होती है, जिन्होंने हर वातावरण को पहली बार में आज़माया। सर्वोत्तम के बजाय दूसरे-सर्वश्रेष्ठ का उपयोग सौभाग्य से मिलने वाले आउटलायर को फ़िल्टर करता है, जबकि वास्तविक खेल में जमे रहता है।

एक सख्त कटऑफ़ भी है: यदि कोई एजेंट किसी लेवल पर मानव क्रिया-गिनती के 5 गुना से अधिक लेता है, तो उसे काट दिया जाता है और उस लेवल पर शून्य स्कोर मिलता है। और स्कोर 1.0 पर कैप्ड हैं, इसलिए यदि कोई अनपेक्षित शॉर्टकट मानव बेसलाइन को मात देता है, तो भी बोनस क्रेडिट नहीं मिलता।

हर वातावरण के भीतर, बाद के लेवल अधिक मायने रखते हैं। स्कोरिंग वेटेड एवरेज का उपयोग करती है, जहाँ लेवल 1 का वेट 1, लेवल 2 का 2, और इसी तरह बढ़ता है। इसका मतलब है कि ट्यूटोरियल लेवल का प्रभाव मामूली होता है, जबकि वे कठिन लेवल जो कई सीखी हुई यांत्रिकियों को जोड़ना मांगते हैं, सबसे अधिक वजन रखते हैं।

दो लीडरबोर्ड

ARC-AGI-3 अलग नियमों के साथ दो स्वतंत्र लीडरबोर्ड बनाए रखता है। आधिकारिक (Official) लीडरबोर्ड फ्रंटियर मॉडलों का मूल्यांकन सामान्य-उद्देश्य API प्रणालियों का उपयोग करके करता है जिन्हें ARC-AGI-3 के लिए विशेष रूप से तैयार नहीं किया गया है। कम्युनिटी लीडरबोर्ड स्व-रिपोर्टेड परिणामों की अनुमति देता है और हार्नेस स्वीकार करता है। यह विभाजन महत्वपूर्ण है क्योंकि, जैसा मैंने पहले कहा, हाथ से बनाए हार्नेस ज्ञात वातावरणों पर स्कोर को नाटकीय रूप से बढ़ा सकते हैं, जबकि अनदेखे पर पूरी तरह विफल हो जाते हैं। आधिकारिक लीडरबोर्ड AI की वास्तविक अनुकूलनशीलता को मापने के लिए बनाया गया है, डेवलपर की स्कैफोल्डिंग को नहीं।

ARC Prize 2026 और ARC-AGI-3 प्रतियोगिता

ARC-AGI-3 इस वर्ष की प्रतियोगिता का केंद्रबिंदु है, पर यह एकमात्र ट्रैक नहीं है।

ARC Prize 2026 में कुल $2 मिलियन से अधिक की पुरस्कार-राशि तीन ट्रैक्स में विभाजित है। ARC-AGI-3 ट्रैक में कुल $850,000 के पुरस्कार हैं, जिसमें $700,000 का ग्रैंड प्राइज़ उस पहले पात्र एजेंट के लिए है जो पूर्ण निजी मूल्यांकन सेट पर 100% हासिल करे। यदि यह इस वर्ष नहीं जीता जाता, तो राशि 2027 में रोलओवर हो जाएगी। ग्रैंड प्राइज़ के अलावा, शीर्ष पाँच फिनिशरों में बाँटा जाने वाला $75,000 का टॉप-स्कोर अवॉर्ड है, और दो माइलस्टोन चेकपॉइंट (30 जून और 30 सितंबर, 2026) हैं, जो प्रत्येक तारीख पर शीर्ष तीन टीमों में $37,500 वितरित करते हैं।

Overview of ARC Prize 2026 competition showing three tracks and their prize allocations

ARC Prize 2026 प्रतियोगिता की पुरस्कार संरचना। इमेज: लेखक।

अन्य दो ट्रैक हैं ARC-AGI-2 ट्रैक ($700,000, और विशेष रूप से ARC-AGI-2 का आधिकारिक Kaggle प्रतियोगिता में उपयोग होने का अंतिम वर्ष) और पेपर प्राइज़ ट्रैक ($450,000 शोध-पत्रों के लिए)।

प्रतियोगिता Kaggle पर चलती है, पर कुछ ऐसे नियमों के साथ जो इसे एक सामान्य Kaggle प्रतियोगिता से अलग करते हैं। सब्मिशन एक सैंडबॉक्स्ड वातावरण में, बिना इंटरनेट एक्सेस के मूल्यांकित होते हैं—जिससे GPT, Claude, या Gemini जैसे होस्टेड मॉडलों को API कॉल संभव नहीं रहती। सभी पुरस्कार-योग्य समाधान निजी मूल्यांकन स्कोर प्राप्त करने से पहले एक अनुमतिपूर्ण या सार्वजनिक-डोमेन लाइसेंस (CC0 या MIT-0) के अंतर्गत जारी किए जाने चाहिए। प्रतियोगिता 25 मार्च, 2026 को खुली, अंतिम सब्मिशन की समय-सीमा 2 नवंबर, 2026 है, और परिणाम 4 दिसंबर, 2026 को घोषित होंगे।

ARC-AGI-3 क्यों महत्वपूर्ण है

बेंचमार्क तब सबसे अधिक मायने रखते हैं जब वे ऐसा अंतर उजागर करें जो पहले अंतर जैसा नहीं लगता था। इस कसौटी पर पहले दो ARC बेंचमार्क खरे उतरे: ARC-AGI-1 ने बड़े रीज़निंग मॉडलों के उभरने को सामने लाया, और ARC-AGI-2 ने टेस्ट-टाइम कम्प्यूट स्केलिंग कितनी दूर जा सकती है, इसे ट्रैक किया। ARC-AGI-3 एक अलग समस्या की ओर इशारा कर रहा है।

यह बेंचमार्क फिलहाल इसलिए प्रासंगिक है क्योंकि संदर्भ यही है। 2026 की शुरुआत तक, कई व्यापक रूप से प्रयुक्त AI बेंचमार्क संतृप्ति के करीब हैं। फ्रंटियर मॉडल MMLU, HumanEval, और GSM8K सहित अन्य पर 90% से ऊपर स्कोर करते हैं, जिससे ये मूल्यांकन प्रणालियों के बीच फर्क बताने की क्षमता सीमित कर देते हैं। ARC-AGI-3 ऐसी क्षमता की परीक्षा करता है जो मौजूदा मॉडलों में नज़र नहीं आती: अपरिचित वातावरणों के भीतर चलते-फिरते सीखना। 1% से कम AI स्कोर और 100% मानव हल-क्षमता के बीच का अंतर इतना बड़ा है कि यह केवल उसी परीक्षा का कठिन संस्करण नहीं, बल्कि अलग किस्म की चुनौती का संकेत देता है।

ARC Prize ARC-AGI-3 को इंटरएक्टिव रीज़निंग की सबसे महत्वपूर्ण परीक्षा के रूप में पेश करता है—हालाँकि याद रखना चाहिए कि यह फ्रेमिंग उसी संगठन से आती है जो बेंचमार्क चलाता है। यह दावे कितने टिकते हैं, यह इस पर निर्भर करेगा कि शोध समुदाय इसके अनुकूलन के साथ इसे कैसे परखता है।

सीमाएँ और खुले प्रश्न

कोई भी बेंचमार्क परिपूर्ण नहीं होता, और ARC-AGI-3 पर कुछ आलोचनाएँ भी हुई हैं जिनका उल्लेख करना उचित है।

एक आम चिंता स्वयं स्कोरिंग फ़ॉर्मूला है। वर्गीकृत दक्षता मीट्रिक अन्वेषण को कठोरता से दंडित करती है—जबकि तर्कसंगत रूप से अन्वेषण बुद्धिमत्ता का संकेत हो सकता है, विफलता का नहीं। यदि कोई एजेंट समाधान तक पहुँचने से पहले सीमाओं का सावधानीपूर्वक मानचित्रण करने में 50 क्रियाएँ लगाता है, तो उसका स्कोर उस मानव से बहुत खराब होगा जो 5 क्रियाओं में नियम का अनुमान लगा ले। कुछ समुदाय-सदस्यों का तर्क है कि इससे प्रदर्शन-अंतर कृत्रिम रूप से बड़ा दिखता है।

बेसलाइन चयन का प्रश्न भी है। जैसा कि मैंने स्कोरिंग अनुभाग में बताया, बेंचमार्क औसत के बजाय दूसरे-सर्वश्रेष्ठ मानव परीक्षक का उपयोग करता है, जो मानक को ऊँचा रखता है। इस दृष्टिकोण में सामान्य मनुष्य भी 100% से नीचे स्कोर करेंगे।

  • क्या अमूर्त गेम प्रदर्शन स्थानांतरित होता है? क्या इंटरएक्टिव ग्रिड गेम्स पर सफलता वास्तविक दुनिया की अनुकूलनशील बुद्धिमत्ता के बारे में कुछ भविष्यवाणी करती है, यह अब भी खुला प्रश्न है। बेंचमार्क तर्क के एक विशिष्ट, संकीर्ण आयाम की परीक्षा करता है।
  • एजेंट डिज़ाइन बनाम बेस मॉडल। यह स्पष्ट नहीं है कि प्रगति बेहतर एजेंट स्कैफोल्डिंग (हार्नेस, स्टेट-स्पेस सर्च, RL-आधारित तरीके) से आएगी या अलग मॉडल आर्किटेक्चर से। जैसा मैंने पहले बताया, StochasticGoose की प्रीव्यू-अवधि बढ़त पूरे बेंचमार्क पर गायब हो गई, इसलिए अभी कोई तरीका स्पष्ट सामान्यीकरण नहीं दिखा पाया है।
  • क्या बेंचमार्क प्रतिरोधी बना रहेगा? जैसा कि मैंने पहले बताया, लैब्स ने ARC-AGI-2 को एक साल से कम में एकल-अंकों से 50% से काफी ऊपर पहुँचा दिया, जब उन्होंने उस पर ध्यान केंद्रित किया। क्या ARC-AGI-3 के डिज़ाइन बदलाव (इंटरएक्टिव फ़ॉर्मेट, उलटा डेटासेट अनुपात, एक्शन-दक्षता स्कोरिंग) समान दबाव का प्रतिरोध करने के लिए पर्याप्त हैं—यह अब भी खुला प्रश्न है।
  • कॉन्टेक्स्ट विंडो लागत। 16 रंगों वाले 64×64 ग्रिड बिना संपीड़न के भाषा मॉडलों की कॉन्टेक्स्ट विंडो को जल्दी खपा सकते हैं, जिससे LLM-आधारित तरीकों को बड़े पैमाने पर चलाना महंगा पड़ता है।

ARC Prize टीम इस बेंचमार्क को किसी विशिष्ट कमी को मापने का वैज्ञानिक प्रयास मानती है, न कि सामान्य बुद्धिमत्ता की निर्णायक परीक्षा। आज जो हम जानते हैं, उसके आधार पर यह आकलन उचित लगता है।

निष्कर्ष

ARC-AGI-3 AI प्रणालियों के मूल्यांकन के लिए एक अलग तरीका अपनाता है। स्थिर पहेलियों से इंटरएक्टिव वातावरण की ओर बढ़कर, यह परखता है कि क्या मॉडल अन्वेषण कर सकते हैं, अपने लक्ष्य स्वयं तय कर सकते हैं, और निर्देशों के बजाय अनुभव के जरिए चीज़ें समझ सकते हैं।

शुरुआती संख्याएँ चौंकाने वाली हैं। कोडिंग बेंचमार्क, गणित प्रतियोगिताएँ, और ज्ञान परीक्षाओं में हावी मॉडल यहाँ 1% पार करने के लिए भी जूझते हैं। यह अंतर जल्दी पाट दिया जाएगा—जैसा पहले के ARC बेंचमार्क में हुआ था—या इंटरएक्टिव फ़ॉर्मेट को भेदना कठिन साबित होगा—यह ऐसी बात है जिस पर नज़र रखना सार्थक है।

एडैप्टिव AI प्रणालियों के पीछे की अवधारणाओं पर अधिक जानने के लिए हमारा AI Fundamentals स्किल ट्रैक या हमारा Building Scalable Agentic Systems कोर्स देखें।


Khalid Abdelaty's photo
Author
Khalid Abdelaty
LinkedIn

मैं एक डेटा इंजीनियर और कम्युनिटी बिल्डर हूँ, जो डेटा पाइपलाइनों, क्लाउड, और AI टूलिंग के साथ काम करता/करती हूँ, साथ ही DataCamp और उभरते डेवलपर्स के लिए व्यावहारिक, असरदार ट्यूटोरियल लिखता/लिखती हूँ।

FAQs

ARC-AGI-3 क्या है?

एक इंटरएक्टिव रीज़निंग बेंचमार्क जो यह परखता है कि क्या AI एजेंट बिना किसी निर्देश के नए वातावरणों का अन्वेषण कर सकते हैं, लक्ष्यों का अनुमान लगा सकते हैं, और कुशलता से कार्य कर सकते हैं।

ARC-AGI-3, ARC-AGI-2 से कैसे अलग है?

ARC-AGI-2 स्थिर इनपुट-आउटपुट पहेलियाँ उपयोग करता है; ARC-AGI-3 लाइव, इंटरएक्टिव वातावरण उपयोग करता है जहाँ नियम और लक्ष्य एजेंट की अपनी क्रियाओं से ही उभरते हैं।

क्या ARC-AGI-3 एक Kaggle प्रतियोगिता है?

यह ARC Prize 2026 के हिस्से के रूप में Kaggle पर होस्ट किया गया है, पर कड़े नियमों के साथ: मूल्यांकन के दौरान इंटरनेट एक्सेस नहीं, और पुरस्कार-योग्य समाधानों को अपना कोड और तरीक़े ओपन-सोर्स करने होंगे। फ्रंटियर मॉडल स्कोर (GPT-5.4, Gemini, आदि) अलग से API के जरिए एकत्र किए गए थे, Kaggle सब्मिशन के माध्यम से नहीं।

ARC-AGI-3 क्या मापता है?

स्किल-अधिग्रहण दक्षता: कोई AI एजेंट नए वातावरण में कितनी जल्दी चलना-फिरना (नेविगेट) सीख सकता है—मानव बेसलाइन के सापेक्ष क्रिया-गिनती से स्कोर किया जाता है।

क्या ARC-AGI-3 पास करना AGI के बराबर है?

नहीं। 100% स्कोर का मतलब है कि एजेंट इन विशिष्ट वातावरणों में मानव दक्षता के बराबर है, न कि उसने सामान्य बुद्धिमत्ता हासिल कर ली है।

विषय
कृत्रिम बुद्धिमत्ता

DataCamp के साथ सीखें

कोर्स

Understanding Artificial Intelligence

2 घंटा
426.1K
आर्टिफिशियल इंटेलिजेंस की बुनियादी अवधारणाएँ सीखें, जैसे मशीन लर्निंग, डीप लर्निंग, NLP, जनरेटिव AI और अधिक।
विवरण देखेंRight Arrow
पाठ्यक्रम शुरू करें

कोर्स

व्यवसाय में AI समाधान लागू करना

2 घंटा
55.5K
जानें कि AI से व्यावसायिक मूल्य कैसे निकालें। AI के अवसरों का दायरा तय करना, POCs बनाना, समाधान लागू करना और AI रणनीति विकसित करना सीखें।
और देखेंRight Arrow