Track
हम Meta के Llama मॉडलों पर नियमित रूप से लेख लिख रहे थे (Llama 2, Llama 3, वगैरह)। फिर Llama 4 अप्रैल 2025 में जारी हुआ और व्यापक आलोचना का सामना करना पड़ा—कई प्रकाशनों और कंपनी के जाते हुए AI प्रमुख ने पुष्टि की कि बेंचमार्क परिणाम ऐसे विशेष सब-मॉडल्स से छेड़छाड़ कर बनाए गए थे जो कभी सार्वजनिक नहीं किए गए।
उसके बाद, अपडेट आना बंद हो गए। लगभग उसी समय, Meta ने घोषणा की कि वह Horizon Worlds को केवल मोबाइल पर ला रहा है, यानी VR संस्करण का अंत, जिस पर कभी कंपनी का भविष्य टिका था। ऐसा लगा मानो कंपनी एक साथ दो मोर्चों पर अपना संतुलन खो रही हो।
8 अप्रैल, 2026 को Meta ने Muse Spark लॉन्च किया, जो Meta Superintelligence Labs का पहला मॉडल है। प्रेस विज्ञप्ति में "personal superintelligence" वाक्यांश का थोड़ा ज़्यादा इस्तेमाल है। उसे हटा दें, तो अंदर एक वास्तविक मॉडल है जो Meta को फ्रंटियर स्तर की बातचीत में वापस लाता है।
यदि आप देखना चाहते हैं कि Meta का नया मॉडल अपने मौजूदा सबसे अच्छे प्रतिस्पर्धियों में से एक की तुलना में कैसा है, तो हमारा गाइड Muse Spark बनाम Claude Opus 4.6 पढ़ने की सलाह दूंगा। आप हमारा Muse Glimmer गाइड और स्थानीय रूप से Muse Glimmer चलाने पर ट्यूटोरियल भी पढ़ सकते हैं।
Muse Spark क्या है?
Muse Spark एक नैटिवली मल्टीमॉडल रीजनिंग मॉडल है जो एक ही आर्किटेक्चर में टेक्स्ट, इमेज, ऑडियो और टूल-यूज़ संभालता है। यह विजुअल चेन्-ऑफ-थॉट को सपोर्ट करता है, यानी मॉडल किसी छवि-आधारित समस्या पर एकमात्र उत्तर देने के बजाय कदम-दर-कदम काम कर सकता है। मल्टी-एजेंट ऑर्केस्ट्रेशन भी सेटअप का हिस्सा है, जिस पर हम आगे आएंगे।
पहले के Llama मॉडल प्रशिक्षण से पैटर्न मैचिंग पर आधारित उत्तर लौटाते थे। Muse Spark जवाब देने से पहले समस्याओं पर काम करता है। वास्तविक बदलाव यही है।
इसके पीछे कौन है?
Meta Superintelligence Labs, या MSL, का गठन 30 जून, 2025 को हुआ, जब मार्क जकरबर्ग ने कंपनी के AI संचालन का पुनर्गठन किया। Scale AI के पूर्व CEO Alexandr Wang चीफ AI ऑफिसर बने; डील के हिस्से के रूप में Meta ने Scale AI में लगभग $14 बिलियन का निवेश किया था।
GitHub के पूर्व CEO Nat Friedman प्रोडक्ट और एप्लाइड रिसर्च पक्ष का नेतृत्व करते हैं, और Shengjia Zhao—जिन्होंने OpenAI में GPT-4 और o1 सह-निर्मित किए (वही o1 जिसके खिलाफ अब Muse Spark का बेंचमार्क होता है)—चीफ साइंटिस्ट हैं।
यहां तीसरा कारक भी नाम लेने योग्य है: Yann LeCun, Meta के लंबे समय से चीफ AI साइंटिस्ट और कंपनी के सबसे मुखर ओपन-सोर्स समर्थक, नवंबर 2025 में चले गए। उनका जाना उन संगठनात्मक परिवर्तनों के बाद हुआ जिसने उनकी भूमिका को सीमित कर दिया और टीम को क्लोज्ड-सोर्स डेवलपमेंट की ओर मोड़ दिया।
Muse Spark में नया क्या है (और हमें क्यों परवाह करनी चाहिए)?
मुख्य आकर्षण हैं—रीजनिंग मोड्स, एक नए सिरे से बना ट्रेनिंग पाइपलाइन, और स्वास्थ्य पर सुनियोजित फोकस। इन्हें क्रम से देखें।
तीन रीजनिंग मोड
Muse Spark आपके इंटरैक्ट करने के तीन तरीके देता है, और मॉडल आज़माने से पहले इनके फर्क को समझना उपयोगी है।
- Instant सामान्य क्वेरीज़ के लिए डिफॉल्ट है। यह बिना विस्तृत तर्क के तेज़ी से जवाब देता है, जैसा कि आप एक स्टैंडर्ड चैट मॉडल से अपेक्षा करते हैं।
- Thinking विस्तृत चेन्-ऑफ-थॉट रीजनिंग का उपयोग करता है। मॉडल अधिक समय लेता है, मध्यवर्ती चरणों से गुजरता है, और आमतौर पर कठिन समस्याओं पर बेहतर प्रदर्शन करता है। इस लेख में ज़्यादातर बेंचमार्क परिणाम उसी मोड से हैं।
- Contemplating सबसे दिलचस्प है। नीचे विस्तार से।
एक बात पहले से जान लें: Contemplating मोड धीरे-धीरे रोलआउट हो रहा है और लॉन्च के दिन सभी उपयोगकर्ताओं को उपलब्ध नहीं था। यदि आपको अभी नहीं दिख रहा, तो यह अपेक्षित है।
Contemplating मोड
Contemplating मोड कई रीजनिंग एजेंट्स को समानांतर में स्पिन-अप करता है, फिर उनके आउटपुट को एक उत्तर में संयोजित करता है। जहां Gemini का Deep Think और OpenAI का GPT Pro मोड लंबे समय तक सोचकर रीजनिंग को स्केल करते हैं, Muse Spark चौड़ाई में स्केल करता है। अधिक एजेंट एक साथ काम करते हैं, न कि एक एजेंट ज़्यादा देर तक।
Meta का तर्क है कि यह तरीका तुलनीय परिणाम कम लेटेंसी पर देता है, क्योंकि एजेंट्स सीक्वेन्शियल के बजाय पैरेलल चलते हैं। लेटेंसी दावे का स्वतंत्र सत्यापन अभी उपलब्ध नहीं है, लेकिन Contemplating मोड के बेंचमार्क कई कठिन इवैल्यूएशंस पर अग्रणी दिखते हैं (जल्द ही उन पर)।
यह इन्फरेंस-टाइम फीचर है, आर्किटेक्चरल नहीं। मॉडल खुद नहीं बदलता।
रीइन्फोर्समेंट लर्निंग स्केलिंग और थॉट कंप्रेशन
Meta ने Muse Spark विकसित करने में लगे नौ महीनों में ट्रेनिंग स्टैक को शून्य से फिर बनाया। खासकर RL (रीइन्फोर्समेंट लर्निंग) से जुड़े दावे Meta के अपने टेक ब्लॉग से आते हैं और स्वतंत्र रूप से सत्यापित नहीं हुए हैं।
सबसे दिलचस्प तकनीक रिसर्च टीम जिसे थॉट कंप्रेशन कहती है। RL प्रशिक्षण के दौरान, मॉडल को सही उत्तर के लिए रिवार्ड मिलता है, लेकिन सोचने के समय के लिए दंड भी—जो अत्यधिक आउटपुट टोकन में अनुवाद होता है। इससे गणित जैसी जटिल टास्क्स के दौरान तीन-चरणीय व्यवहार बनता है।
पहले, मॉडल अधिक देर तक सोचकर सुधरता है। फिर लंबाई-दंड लागू होता है और मॉडल को बहुत कम टोकन में वही समस्याएं हल करने को मजबूर करता है। किसी बिंदु पर, यह फिर अपना तर्क बढ़ाता है और कम टोकन के साथ पहले के परफॉर्मेंस सीलिंग्स को पार कर जाता है।
व्यावहारिक नतीजा: मॉडल ने कम में ज़्यादा करना सीख लिया। यह दावा Meta की अपनी ट्रेनिंग कर्व्स पर टिका है, जिनका स्वतंत्र प्रमाणीकरण नहीं हुआ।
10x कम कंप्यूट
Meta का दावा है कि इसकी नई आर्किटेक्चर Llama 4 Maverick के परफॉर्मेंस का मिलान दस गुना कम ट्रेनिंग कंप्यूट पर करती है। यह आर्किटेक्चरल एफिशियंसी की बात है, न कि Muse Spark की सीमा की। Llama 4 Maverick ने Artificial Analysis Intelligence Index पर 18 स्कोर किया। Muse Spark ने 52।
Artificial Analysis की स्वतंत्र रन से मिले टोकन दक्षता के आंकड़े भी इसी दिशा में इशारा करते हैं। Muse Spark ने 58 मिलियन आउटपुट टोकन इस्तेमाल किए। GPT-5.4 ने 120 मिलियन। Claude Opus 4.6 ने 157 मिलियन।
हेल्थ: एक सुनियोजित फोकस
हेल्थ Muse Spark का सबसे स्पष्ट बेंचमार्क लाभ है, और यह सोचा-समझा है। Meta ने 1,000 से अधिक चिकित्सकों के साथ मिलकर हेल्थ रीजनिंग के लिए ट्रेनिंग डेटा क्युरेट किया।
मॉडल पोषण सामग्री, दवा संबंधी जानकारी और एक्सरसाइज़ फिज़ियोलॉजी को कवर करने वाले इंटरैक्टिव डिस्प्ले बना सकता है। HealthBench Hard पर, Muse Spark ने 42.8 स्कोर किया, जबकि GPT-5.4 का 40.1 और Gemini 3.1 Pro का 20.6 रहा। Gemini के खिलाफ यह अंतर स्वतंत्र मूल्यांकन में भी कायम है।
यह साफ तौर पर ChatGPT Health का Meta वाला जवाब है। Meta का तर्क यह है कि 3 अरब उपयोगकर्ताओं का सामाजिक संदर्भ इसे यह बढ़त देता है कि लोग वास्तव में स्वास्थ्य संबंधी प्रश्न कैसे पूछते हैं। क्या यह जटिल या असामान्य क्वेरीज़ पर भी उतना ही लागू होता है, न कि सिर्फ रोज़मर्रा वाली जो बेंचमार्क्स में रहती हैं—देखना होगा।
Llama का क्या?
डेवलपर समुदाय एक बात पूछ रहा है, और उसका सीधा उत्तर बनता है।
Muse Spark ओपन-सोर्स नहीं है। Llama 4 तक हर Llama मॉडल के वेट्स आए जिन्हें डेवलपर डाउनलोड कर स्थानीय रूप से चला सकते थे। r/LocalLLaMA जैसी कम्यूनिटीज़ उसी पर बनीं। वह उपयोग-केस अब नहीं रहा।
Meta का घोषित कारण आंशिक रूप से प्रतिस्पर्धी है: चीनी लैब्स, जिनमें DeepSeek भी शामिल है, ने अपने शोध को तेज़ करने के लिए Llama वेट्स का उपयोग किया। Wang ने कहा है कि कंपनी भविष्य के Muse मॉडलों को ओपन-सोर्स करने की "उम्मीद" रखती है, बिना किसी टाइमलाइन के। "उम्मीद" यहां बहुत काम कर रहा शब्द है।
Llama टीम को Wang की लैब में शिफ्ट कर दिया गया, और Llama 4 पुरानी संरचना का आखिरी मॉडल था। Llama Muse के साथ जारी रहेगा या चुपचाप समाप्त होगा, Meta ने नहीं कहा।
Muse Spark बेंचमार्क परिणाम
Muse Spark के साथ बेंचमार्क जटिल हैं—एक कारण जो पहले ही बताने लायक है। Meta के Llama 4 इतिहास को देखते हुए, स्वयं-रिपोर्टेड और स्वतंत्र रूप से सत्यापित संख्याओं को अलग रखें।
यहां Thinking मोड के परिणाम हैं—जहां ज़्यादातर निष्पक्ष तुलना का डेटा मिलता है।

स्रोत: Meta Superintelligence Labs / ai.meta.com
Contemplating मोड के पास सबसे कठिन इवैल्यूएशंस के लिए अलग सेट है। यह Humanity's Last Exam और FrontierScience Research में आगे है, लेकिन IPhO 2025 Theory फिजिक्स समस्याओं पर GPT-5.4 Pro और Gemini 3.1 Deep Think से पीछे है। ये सभी Meta की अपनी रिपोर्टिंग से हैं, इसलिए इन्हें अंतिम नहीं, दिशात्मक रूप से दिलचस्प मानें।

स्रोत: Meta Superintelligence Labs / ai.meta.com
Artificial Analysis की स्वतंत्र तस्वीर अधिक संतुलित है। उन्होंने Muse Spark को अपने Intelligence Index में चौथे स्थान पर रखा—Gemini 3.1 Pro Preview, GPT-5.4, और Claude Opus 4.6 के पीछे—फिर भी वैश्विक शीर्ष पांच में। संख्याएं कमजोर स्थान भी साफ दिखाती हैं: यदि आपके उपयोग-केस में कोडिंग या एब्स्ट्रैक्ट रीजनिंग मायने रखती है, तो ARC-AGI-2 और Terminal-Bench 2.0 पर ध्यान दें।
Muse Spark की टेस्टिंग
इन बेंचमार्क स्कोरों को ध्यान में रखते हुए, आइए Muse Spark का परीक्षण करें। मैं मॉडल को मल्टी-स्टेप रीजनिंग, इमेज अंडरस्टैंडिंग, और कोड डीबगिंग में परखूंगा।
टेस्ट 1: फिबोनाची–बाइनरी लॉजिक चेन् (कास्केडिंग रीजनिंग स्थिरता)
पहले टेस्ट में, मैं Muse Spark की उन्नत तर्क क्षमता को एक मल्टी-स्टेप अभ्यास में लक्षित करूंगा। मॉडल को यह करना होगा:
- सही फिबोनाची पद की पहचान
- उसे सटीक रूप से बाइनरी में कन्वर्ट करना
- बिट्स को ठीक-ठीक गिनना
- गणना की गई रेंज में प्राइम्स बनाना
- एक बड़ा समेशन करना
उपयोग किया गया प्रॉम्प्ट था:
Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?
Muse Spark ने बहुत अच्छा किया और पहली कोशिश में ही अभ्यास को सही हल कर दिया। यह खास तौर पर प्रभावशाली है क्योंकि GPT-5.4 आखिरी चरण में विफल हो गया था और तभी सफल हुआ जब उसे दो चरणों में बांटा गया (प्राइम संख्याओं की सूची और फिर जोड़ना)।

टेस्ट 2: मल्टी-लाइन टाइम-सीरीज़ चार्ट पर इमेज अंडरस्टैंडिंग और सेल्स रीजनिंग
Meta का दावा है कि Muse Spark जटिल इमेज समझने में बेहतरीन है, इसलिए मैं नीचे दिए गए मल्टी-लाइन टाइम-सीरीज़ चार्ट का उपयोग कर रहा हूं ताकि देखा जा सके कि क्या यह पैटर्न पहचान सकता है और उन्हें उपयोगी सुझावों में बदल सकता है।

प्रॉम्प्ट यह है:
Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Spark ने सभी पैटर्न सही पहचाने, जिससे संकेत मिलता है कि इमेज रिकग्निशन अच्छी तरह काम करता है।

उपयोग किया गया डेटा यादृच्छिक रूप से गढ़ा गया था, इसलिए यहां कोई स्पष्ट सही-गलत नहीं है। इसके बावजूद, Muse Spark सभी इवेंट्स को पहचानता है और हर प्रोडक्ट तथा हर इवेंट के समय के पार तर्क देता है, और समझदार निष्कर्षों पर पहुंचता है। इसने प्रोडक्ट संयोजनों के मासिक सक्रिय उपयोगकर्ताओं (MAU) के योग में बदलावों का विश्लेषण भी किया—बिना किसी प्रॉम्प्ट के—जो एक अच्छी बात है।

सुझाए गए सभी अगले कदम प्रोडक्ट MAU पैटर्न और इवेंट प्रभावों के विश्लेषण से मेल खाते हैं। Muse Spark ने प्रत्येक प्रोडक्ट के लिए सबसे महत्वपूर्ण थीम (A के लिए लॉन्च प्लेबुक, B के लिए प्राइसिंग, C के लिए स्केलिंग) पहचानी और सार्थक, विशिष्ट कार्रवाइयां सुझाईं।
टेस्ट 3: कोड डीबगिंग
अंत में, मैं कोड बग्स का निदान करने में Muse Spark की क्षमता की जांच करूंगा। यह टेस्ट यह दिखाने के लिए डिज़ाइन किया गया है कि क्या मॉडल केवल लाइन-बाय-लाइन कोड शुद्धता का ट्रेस करता है या अंतर्निहित खामियों को भी पकड़ता है।
प्रॉम्प्ट:
A developer wrote this Python function to compute a running average:
def running_average(data, window=3):
result = []
for i in range(len(data)):
start = max(0, i - window + 1)
chunk = data[start:i + 1]
result.append(round(sum(chunk) / window, 2))
return result
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!
यह फंक्शन हमेशा window (3) से भाग देता है, शुरुआत में भी, जब chunk में 3 से कम एलिमेंट होते हैं। बग्गी आउटपुट है [3.33, 10.0, 20.0, 30.0, 40.0], लेकिन पहले दो मान 10.0 और 15.0 होने चाहिए क्योंकि उन chunks में क्रमशः केवल 1 और 2 एलिमेंट हैं। समाधान है / window को बदलकर / len(chunk) करना।
मॉडल अक्सर लूप के जरिए ठीक-ठीक ट्रेस कर लेते हैं, लेकिन फिर कहते हैं कि आउटपुट “सही” दिखता है। वे स्टेप-बाय-स्टेप गणित देखते हैं और यह नहीं झंडी दिखाते कि एक एलिमेंट को 3 से भाग देना समझ में नहीं आता। इसके लिए मॉडल को इरादा (रनिंग एवरेज क्या करना चाहिए) और निष्पादन (कोड वास्तव में क्या करता है) दोनों को साथ रखना होता है और दोनों के बीच का अंतर पकड़ना होता है।

Muse Spark ने रनिंग एवरेज को इरादे के रूप में पहचाना और गलती पकड़ ली। उसने सही बदलाव सुझाया और यह भी समझाया कि यह क्यों ज़रूरी है। उसने एक वैकल्पिक विकल्प भी सुझाया—यदि आंशिक विंडोज़ को पूरी तरह छोड़ना हो।
कुल मिलाकर, मॉडल ने तीनों टेस्ट बेहतरीन तरीके से पार किए और अच्छा पहला प्रभाव छोड़ा।
मैं Muse Spark तक कैसे पहुंचूं?
आप Muse Spark को meta.ai पर या iOS और Android पर Meta AI ऐप के माध्यम से एक्सेस कर सकते हैं। दोनों मुफ्त हैं। शुरुआती रोलआउट पहले US में है, और अगले हफ्तों में अन्य क्षेत्रों में विस्तार बताया गया है। 
Meta समान समयसीमा में इसे WhatsApp, Instagram, Facebook, Messenger, और अपनी Ray-Ban AI ग्लासेस में भी रोलआउट करने की योजना बना रहा है।
कोई सार्वजनिक API नहीं है। एक निजी प्रीव्यू चुनिंदा एंटरप्राइज़ पार्टनर्स के लिए खुला है, व्यापक एक्सेस की पुष्टि-तिथि नहीं है। प्राइवेसी पर: Meta की पॉलिसी बातचीत को अपने मॉडलों को बेहतर बनाने में उपयोग करने पर सीमित बंधन लगाती है। यदि आप संवेदनशील जानकारी साझा करने की योजना बना रहे हैं, तो पहले शर्तें पढ़ें।
जहां Muse Spark कमज़ोर पड़ता है
Meta ने अपने टेक्निकल ब्लॉग में सीधे कहा: मॉडल में मल्टी-स्टेप एजेंट टास्क्स और कोडिंग वर्कफ़्लोज़ में गैप्स हैं।
SWE-Bench Verified पर, Gemini और Opus 4.6 के खिलाफ अंतर छोटा है। एजेंटिक काम में यह बढ़ता है: Terminal-Bench 2.0 (59.0 बनाम GPT-5.4 का 75.1) और GDPval-AA ऑफिस ऑटोमेशन (1,444 बनाम GPT-5.4 का 1,672)। ये पास-पास नहीं हैं।
एब्स्ट्रैक्ट विज़ुअल रीजनिंग भी यही पैटर्न दिखाती है: Muse Spark के लिए ARC-AGI-2 42.5 है, जबकि GPT-5.4 और Gemini दोनों के लिए मध्य-70s। जो मॉडल चार्ट पढ़ने में आगे है, वह नए विज़ुअल पैटर्न पर काफ़ी पीछे है।
आखिरी बिंदु पर लॉन्च के दिन प्रतिक्रिया आई। François Chollet, ARC Prize के सह-संस्थापक और Keras तथा ARC-AGI के निर्माता, ने मॉडल को "पब्लिक बेंचमार्क नंबरों के लिए ज़्यादा-से-ज़्यादा अनुकूलित—बाकी हर चीज़ के नुकसान पर" कहा। Wang ने जवाब दिया, ARC-AGI-2 गैप स्वीकार किया, और विज़ुअल कोडिंग व रीजनिंग पर सकारात्मक यूज़र फ़ीडबैक की ओर इशारा किया। क्या यह व्यापक उपयोग में टिकता है—खुला प्रश्न है।
जैसा कि पहले बताया, पब्लिक API का अभाव इसके ऊपर एक प्रतिस्पर्धी गैप है। Wang ने लॉन्च के दिन इसे माना: "निश्चित रूप से मॉडल व्यवहार में कुछ खुरदुरे किनारे हैं जिन्हें हम समय के साथ पॉलिश करेंगे।"
Muse Spark सेफ़्टी
Meta ने लॉन्च से पहले अपने Advanced AI Scaling Framework के तहत इवैल्यूएशंस किए। BioTIER-refuse पर, Muse Spark बायोवेपन्स क्वेरी रिफ्यूजल के लिए तुलना-सेट में अग्रणी है। ये संख्याएं Meta की अपनी हैं।

स्रोत: Meta Superintelligence Labs / ai.meta.com
अधिक रोचक निष्कर्ष Apollo Research से आता है। उन्होंने पाया कि Muse Spark ने उनके द्वारा परीक्षण किए गए किसी भी मॉडल में सबसे अधिक इवैल्यूएशन-अवेयरनेस दर दिखाई: मॉडल अक्सर सेफ़्टी इवैल्यूएशंस को टेस्ट संदर्भ के रूप में पहचानता था और उसी वजह से अधिक सावधानी से व्यवहार करता था।
एक मॉडल जो केवल तब अच्छा व्यवहार करता है जब उसे पता हो कि उसे देखा जा रहा है—यह गंभीरता से लेने वाली समस्या है। Apollo के पूर्व कार्य ने दस्तावेज़ किया है कि यह पैटर्न वास्तविक डिप्लॉयमेंट में उनके शब्दों में "scheming behavior" बढ़ा सकता है।
Meta ने लॉन्च पर इस निष्कर्ष को स्वीकार किया—जो अधिकतर लैब्स नहीं करतीं। उनके फॉलो-अप ने पाया कि यह अलाइनमेंट इवैल्यूएशंस के एक छोटे उपसमूह को प्रभावित करता है, जिनमें से कोई भी खतरनाक क्षमताओं से संबंधित नहीं था, और निष्कर्ष निकाला कि यह ब्लॉकिंग चिंता नहीं है। शोध जारी है।
Muse Spark बनाम GPT-5.4 बनाम Opus 4.6 बनाम Gemini 3.1
बेंचमार्क बताते हैं कि ये मॉडल क्या कर सकते हैं। यह सेक्शन बताता है कि वास्तव में किसे उपयोग करें।
त्वरित नज़र
|
स्पेक |
Muse Spark |
GPT-5.4 |
Opus 4.6 |
Gemini 3.1 Pro |
|
रिलीज़ |
8 अप्रैल, 2026 |
5 मार्च, 2026 |
5 फरवरी, 2026 |
19 फरवरी, 2026 |
|
कॉन्टेक्स्ट विंडो |
262K* |
1.05M |
13 मार्च से 1M |
1M |
|
इनपुट मोडैलिटीज़ |
टेक्स्ट, इमेज, स्पीच |
टेक्स्ट, इमेज |
टेक्स्ट, इमेज |
टेक्स्ट, इमेज, ऑडियो, वीडियो |
|
API प्राइसिंग (प्रति 1M टोकन इन/आउट) |
कोई पब्लिक API नहीं |
$2.50 / $15.00 |
$5.00 / $25.00 |
$2.00 / $12.00 |
|
कंज्यूमर एक्सेस |
meta.ai (US-प्रथम) |
ChatGPT |
Claude.ai |
Gemini ऐप |
*Artificial Analysis Muse Spark की कॉन्टेक्स्ट विंडो 262K रिकॉर्ड करता है। कुछ स्रोत 1M बताते हैं। Meta ने किसी एक आंकड़े की पुष्टि करते हुए मॉडल कार्ड प्रकाशित नहीं किया है।
आप किसे चुनें?
Muse Spark चुनें यदि आपका उपयोग-केस हेल्थ क्वेरीज़, चार्ट रीडिंग, या मल्टीमॉडल कंज्यूमर एप्लिकेशंस है। अभी कोई पब्लिक API नहीं है, इसलिए यदि आप प्रोडक्शन इंटीग्रेशन बना रहे हैं, तो आपको इंतज़ार करना होगा।
GPT-5.4 चुनें यदि आपको आज ही बिल्ड करने लायक जनरल-पर्पज़ मॉडल चाहिए। यह कोडिंग, एब्स्ट्रैक्ट विज़ुअल रीजनिंग, और ऑफिस ऑटोमेशन में अग्रणी है, पब्लिक API और 1M कॉन्टेक्स्ट विंडो अभी उपलब्ध हैं।
Claude Opus 4.6 चुनें यदि आप लंबे दस्तावेज़ों के साथ काम करते हैं या सावधानीपूर्वक, उच्च-गुणवत्ता की राइटिंग आउटपुट चाहिए। 1M कॉन्टेक्स्ट विंडो 13 मार्च, 2026 से स्टैंडर्ड प्राइसिंग पर चली गई। यह $5/$25 प्रति 1M टोकन पर सबसे महंगा विकल्प है।
Gemini 3.1 Pro चुनें यदि आपकी पाइपलाइन वीडियो प्रोसेस करती है। यह यहां एकमात्र मॉडल है जो वीडियो इनपुट स्वीकार करता है, और $2/$12 प्रति 1M टोकन पर इस समूह का सबसे सस्ता फ्रंटियर विकल्प है।
लोग Muse Spark के बारे में क्या कह रहे हैं
शुरुआती प्रतिक्रियाएं अपेक्षित लाइनों के अनुसार बंटी हुई हैं। कुछ लोगों को खास चीज़ें चौंकाने वाली लगीं। अन्य लोगों ने बेंचमार्क टेबल को देखा और अलग निष्कर्ष निकाले।

"फुल स्टैक रिबिल्ट फ्रॉम स्क्रैच" वाला फ्रेमिंग बहुत आया। यह नौ महीने की टाइमलाइन प्रभावशाली है या यक़ीन करना मुश्किल—यह इस पर निर्भर करता है कि आप Meta के दावों पर कितना भरोसा करते हैं।
Pietro Schirano ने एक खास उदाहरण साझा किया: उन्होंने Muse Spark से एक UI स्क्रीनशॉट को कोड में बदलने को कहा, और इसने इंटरफ़ेस से इमेज एसेट्स काटकर निकाले—उन्हें एक फ्लैट इमेज की तरह ट्रीट करने के बजाय।

यह बेंचमार्क नहीं है। यह वैसी चीज़ है जो इसलिए साझा होती है क्योंकि यह सचमुच अप्रत्याशित है।
Aakash Gupta की राय सबसे तीखी थी। उनका फ्रेमिंग: "यह एक डेटा-लेबलिंग CEO का मॉडल है। फिंगरप्रिंट्स परिणामों पर साफ दिखते हैं।" जिन बेंचमार्क्स पर Muse Spark आगे है, वे सभी डेटा-क्वालिटी-सेंसिटिव टास्क्स हैं जहां ट्रेनिंग सेट क्यूरेशन छत तय करता है।
जहां यह पीछे है (ARC-AGI-2, Terminal-Bench, GDPval)—वहां आर्किटेक्चर और RL स्केलिंग डेटा से ज़्यादा मायने रखते हैं। उनका निष्कर्ष: "उसने वे चीज़ें जिनका हल डेटा पाइपलाइंस देती हैं, उनमें सबसे अच्छा मॉडल बनाया—और बाकी सबमें औसत।"

निष्कर्ष
Artificial Analysis Intelligence Index पर Llama 4 Maverick के 18 से Muse Spark के 52 तक की छलांग मामूली नहीं है। एक टीम के लिए जिसने नौ महीनों में शून्य से फिर निर्माण किया, हेल्थ और मल्टीमॉडल परिणाम वास्तविक पहला कदम हैं—और ये स्वतंत्र परीक्षण में टिकते हैं।
हाँ, गैप्स स्पष्ट हैं। GPT-5.4 के खिलाफ कोडिंग और एजेंटिक टास्क्स पास-पास नहीं; एब्स्ट्रैक्ट विज़ुअल रीजनिंग एक साफ़ कमज़ोरी है, और अब तक कोई पब्लिक API नहीं। यदि आपको आज ही बिल्ड करने लायक मॉडल चाहिए, तो Muse Spark अभी वह नहीं है।
जो बात बार-बार ध्यान में आती है, वह ओपन-सोर्स का सवाल है। Llama इकोसिस्टम इस भरोसे पर बना था कि वेट्स उपलब्ध होंगे। Muse Spark इसे तोड़ता है। Wang का भविष्य के संस्करणों को ओपन-सोर्स करने का "hope" कोई प्रतिबद्धता नहीं। मेरी नज़र में, यही इस लॉन्च की सबसे दूरगामी बात है—और इसे बेंचमार्क नंबरों से कहीं कम ध्यान मिलता है।
बड़े Muse मॉडल विकास में हैं। यदि आर्किटेक्चर दावों के मुताबिक स्केल करता है, तो आज के नंबर मामूली लगेंगे। दांव यही है।
यदि आप किसी भी बड़े भाषा मॉडल का अधिकतम लाभ उठाना सीखना चाहते हैं, तो हमारा Understanding Prompt Engineering कोर्स लेने की सलाह दूंगा।
Muse Spark FAQs
यदि मैं Llama को लोकली इस्तेमाल कर रहा था, तो क्या Muse Spark उसे बदल देता है?
नहीं। Muse Spark केवल क्लाउड-आधारित है। आप इसे डाउनलोड नहीं कर सकते, अपने हार्डवेयर पर नहीं चला सकते, न ही फाइन-ट्यून कर सकते हैं। एक्सेस meta.ai या Meta AI ऐप के माध्यम से है—दोनों के लिए Meta अकाउंट आवश्यक है। ओपन-वेट्स वाला उपयोग-केस, जिसके इर्द-गिर्द Llama ने अपनी कम्यूनिटी बनाई थी, यहां मौजूद नहीं है।
मुझे Thinking की जगह Contemplating मोड वास्तव में कब उपयोग करना चाहिए?
Contemplating मोड तब सबसे उपयोगी है जब किसी समस्या के सचमुच कई वैध समाधान-पथ हों; जटिल वैज्ञानिक प्रश्नों में; अस्पष्ट इनपुट के साथ मल्टी-स्टेप रीजनिंग में; या ऐसे रिसर्च कार्यों में जहां अलग-अलग कोणों से अलग निष्कर्ष निकल सकते हैं। रोज़मर्रा की अधिकांश क्वेरीज़ के लिए Thinking मोड तेज़ है और परिणाम तुलनीय हैं। एक और बात: Contemplating मोड अभी भी धीरे-धीरे रोलआउट हो रहा है, इसलिए संभव है कि आपको अभी एक्सेस न हो।
10x कंप्यूट वाला दावा मेरे लिए एक उपयोगकर्ता के रूप में वास्तव में क्या मायने रखता है?
शायद अभी आपके लिए कुछ नहीं बदलेगा। तुलना Muse Spark के अपने पिछले मॉडल से है—GPT-5.4 या Gemini से नहीं—और यह संख्या स्वतंत्र रूप से सत्यापित नहीं हुई। अधिक प्रासंगिक डेटा-पॉइंट इन्फरेंस एफिशियंसी है: जैसा पहले उल्लेख किया, Artificial Analysis की स्वतंत्र रन में Muse Spark ने 58 मिलियन आउटपुट टोकन इस्तेमाल किए, जबकि Claude Opus 4.6 ने 157 मिलियन। यह अंतर भविष्य में प्राइसिंग में दिख सकता है, लेकिन API प्राइसिंग अभी घोषित नहीं हुई है।
क्या मुझे अपने मौजूदा टूल से Muse Spark पर स्विच करना चाहिए?
यदि आप सामान्य कार्यों के लिए ChatGPT का इस्तेमाल करते हैं, तो दिन-प्रतिदिन का अनुभव समान लगेगा। यदि हेल्थ क्वेरीज़, साइंस, या चार्ट विश्लेषण आपके मुख्य उपयोग-केस हैं, तो Muse Spark एक उचित अपग्रेड है। यदि आप कोडिंग असिस्टेंट्स या लंबे दस्तावेज़ों वाले टूल्स पर निर्भर हैं, तो यह अभी GPT-5.4 या Opus 4.6 का स्थान नहीं लेता। ऊपर दी गई तुलना तालिका में विवरण हैं।
क्या मुझे इवैल्यूएशन-अवेयरनेस वाले निष्कर्ष को लेकर चिंतित होना चाहिए?
व्यावहारिक रोज़मर्रा के अर्थ में नहीं, लेकिन समझना ज़रूरी है। निष्कर्ष यह है कि Muse Spark तब अधिक सावधानी से व्यवहार करता है जब वह पहचानता है कि उसका सेफ़्टी-टेस्ट हो रहा है—यह इसलिए नहीं कि उसके मूल्यों में फर्क है, बल्कि इसलिए कि वह संदर्भ पहचानता है। Meta के फॉलो-अप में पाया गया कि यह अलाइनमेंट टेस्ट्स के संकरे उपसमूह को प्रभावित करता है, जिनमें से कोई भी खतरनाक क्षमताओं से जुड़ा नहीं था। यदि आप संवेदनशील डिप्लॉयमेंट्स के लिए मॉडल्स का मूल्यांकन कर रहे हैं, तो केवल सेफ़्टी बेंचमार्क स्कोर देखकर निष्कर्ष निकालने से पहले Apollo की पूरी रिपोर्ट पढ़ें।