मुख्य सामग्री पर जाएं

Kolibri 1: Aleph Alpha का स्वायत्त ओपन-वेट LLM

Aleph Alpha ने Kolibri 1 जारी किया है, जो 78B मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल है जिसमें 3.46B सक्रिय पैरामीटर्स, Apache 2.0 वेट्स, और 1M-टोकन कॉन्टेक्स्ट है, जिसे जर्मनी में शुरू से प्रशिक्षित किया गया है।
अपडेट किया गया 5 अक्टू॰ 2026  · 14 मि॰ पढ़ें

AI के साथ खोजें

ChatGPTClaudePerplexity

काफी समय हो गया है जब किसी नई कंपनी ने LLM दौड़ में एंट्री की हो। लेकिन 3 अक्टूबर को Aleph Alpha ने अपना नया मॉडल Kolibri 1 को Apache 2.0 लाइसेंस के तहत Hugging Face पर जारी किया और यूरोप से स्वायत्त AI को गंभीरता से लेने की अपील की।

प्रस्ताव यह है कि यूरोपीय सरकारें और कंपनियाँ किसी अमेरिकी प्रदाता के API पर निर्भर रहने के बजाय सक्षम मॉडल को अपने हार्डवेयर पर, यहाँ तक कि पूरी तरह ऑफलाइन, चला सकती हैं।

Kolibri 1 एक mixture-of-experts (MoE) मॉडल है जिसमें कुल 78B पैरामीटर्स हैं और प्रति टोकन 3.46B सक्रिय हैं, जिसे Aleph Alpha Research ने जर्मनी और फ़िनलैंड के डेटा सेंटर्स में 768 NVIDIA B200 GPUs पर शून्य से प्रशिक्षित किया है।

यह केवल जर्मन और अंग्रेज़ी को संभालता है, 1,048,576-टोकन का कॉन्टेक्स्ट विंडो सपोर्ट करता है (Aleph Alpha सेवा दक्षता के लिए 262,144 टोकन या उससे कम पर रहने की सिफारिश करता है), और प्रीव्यू के बजाय सामान्य उपलब्धता के रूप में शिप होता है। प्री-ट्रेनिंग में 20 ट्रिलियन टोकन शामिल थे, उसके बाद मिड-ट्रेनिंग में 3.44T और लोंग-कॉन्टेक्स्ट विस्तार के लिए 201B।

इस लेख में, मैं Kolibri 1 की नई बातें कवर करूँगा—मुख्य फीचर्स, बेंचमार्क्स की पड़ताल, और इसे सच में चलाने की लागत पर।

संक्षेप में

  • Kolibri 1, Aleph Alpha का ओपन-वेट द्विभाषी मॉडल है, Apache 2.0 लाइसेंस के साथ यूरोप में शून्य से प्रशिक्षित, बिना किसी बेस-मॉडल निर्भरता के।
  • यह गणित और जर्मन रीजनिंग पर अपने बताए तुलना-समूह में आगे है, और क्लोज़्ड-बुक नॉलेज, MMLU-Pro, और मल्टी-टर्न टूल उपयोग में Qwen3.6 35B-A3B से पीछे है।
  • 3.46B सक्रिय पैरामीटर्स के साथ यह तेज़ सर्व होता है, लेकिन पूर्ण FP8 वेट्स को अब भी लगभग 78 GB GPU मेमोरी चाहिए।
  • 5 अक्टूबर, 2026 तक कोई प्रकाशित होस्टेड API कीमत नहीं है और कोई पुष्ट API मॉडल ID नहीं है। आप Hugging Face से Aleph Alpha के vLLM प्लगइन के साथ स्वयं-होस्ट करते हैं, या सेल्स से बात करते हैं।
  • यदि जर्मन-भाषा गुणवत्ता, Apache 2.0 लाइसेंसिंग, या EU AI Act अनुपालन कड़ा अनिवार्य है, तो इस पर स्विच करें। अन्यथा, ओपन-वेट प्रतियोगिता अब भी व्यापक है।

Kolibri 1 क्या है?

Kolibri 1, Aleph Alpha का विशेषीकृत द्विभाषी बड़ा भाषा मॉडल (LLM) है, 3 अक्टूबर, 2026 को Apache 2.0 के तहत जारी। यह एकल सामान्य रूप से उपलब्ध मॉडल है, इसके कोई छोटे या बड़े वेरिएंट नहीं हैं।

अंदर से, यह 50-लेयर का mixture-of-experts ट्रांसफ़ॉर्मर है।

हर लेयर में 384 छोटे विशेषज्ञ सब-नेटवर्क (एक्सपर्ट्स) हैं, और एक राउटर हर टोकन को केवल 6 के पास भेजता है, साथ ही 1 साझा एक्सपर्ट जो हमेशा चलता है। इसी तरह 78.1B कुल पैरामीटर्स प्रति टोकन 3.46B सक्रिय (लगभग 4.4%) तक सिमटते हैं, यानी मॉडल अधिकतम क्षमता के बजाय सस्ते सर्विंग के लिए बनाया गया है।

दो और डिज़ाइन विकल्प इसे तेज़ और मेमोरी पर हल्का रखते हैं:

  • अटेंशन: हर पाँच में से चार लेयर केवल निकटतम 512 टोकनों को देखती हैं (स्लाइडिंग-विंडो अटेंशन), जबकि हर पाँचवीं लेयर पूरा कॉन्टेक्स्ट देखती है। बहुत लंबे इनपुट्स को किफायती बनाने में यही मदद करता है।
  • प्रिसीजन: वेट्स 8-बिट फ़्लोटिंग पॉइंट (FP8) में स्टोर होते हैं, जो मानक 16-बिट मॉडल के लगभग आधे आकार के होते हैं। संवेदनशील हिस्से (एम्बेडिंग्स, आउटपुट हेड, नॉर्मलाइज़ेशन लेयर्स, और राउटर) उच्च-प्रिसीजन bfloat16 में रहते हैं।

Aleph Alpha जिस प्रमुख नतीजे को आगे रख रहा है, वह कच्ची क्षमता के बजाय दक्षता है।

Kolibri 1 अपने जर्मन बेंचमार्क सूट पर औसतन 71% स्कोर करता है, जबकि प्रति GPU लगभग 47,000 बाइट/सेकंड की दर से टेक्स्ट डिकोड करता है; Nemotron Super A12B के लिए यह 68% और लगभग 24,000 बाइट/सेकंड है।

मॉडल का नॉलेज कटऑफ़ 18 जून, 2026 है, दोनों भाषाओं के लिए, और यह केवल टेक्स्ट-आधारित है—छवि, ऑडियो, या वीडियो का इनपुट/आउटपुट नहीं।

यदि आप देखना चाहते हैं कि जर्मन क्षमता वास्तव में कहाँ से आती है, तो प्रकाशित डेटा मिक्स, एक ओपन-वेट रिलीज़ के लिए असामान्य रूप से पारदर्शी है।

डोमेन प्री-ट्रेनिंग मिड-ट्रेनिंग लोंग-कॉन्टेक्स्ट विस्तार
अंग्रेज़ी वेब और दस्तावेज़ 43.4% 1.3% 15.8%
जर्मन वेब और दस्तावेज़ 23.4% 2.1% 2.6%
कोड 13.6% 16.3% 13.2%
एजेंटिक कोड और टूल उपयोग ~0% 15.4% 5.6%
OCR किए गए PDF 0% 0% 33.3%

तालिका में केवल वेब, कोड, एजेंटिक और PDF वाली पंक्तियाँ दिखाई गई हैं। मॉडल कार्ड में अंग्रेज़ी और जर्मन इंस्ट्रक्शन और रीजनिंग डेटा, STEM दस्तावेज़, QA, और विशिष्ट कानूनी तथा सार्वजनिक-क्षेत्र के डेटा भी सूचीबद्ध हैं। अंग्रेज़ी और जर्मन की सभी पंक्तियों को मिलाकर, मॉडल कार्ड प्री-ट्रेनिंग मिक्स को लगभग 62.5% अंग्रेज़ी, 23.9% जर्मन, और 13.6% कोड के रूप में संक्षेपित करता है।

kolibri-1-model-card

Kolibri 1 की मुख्य विशेषताएँ

Kolibri 1 को अलग करने वाली ज़्यादातर बातें दो फैसलों पर टिकती हैं: जर्मन पक्ष को अनुवाद के बजाय सही तरह से ट्रेन करना, और सक्रिय पैरामीटर्स की संख्या इतनी कम रखना कि एक अकेला H200 इसे सर्व कर सके।

जर्मन, जिसे बाद में जोड़ा नहीं गया

Kolibri 1 जर्मन और अंग्रेज़ी के बीच का अंतर अपेक्षा से अधिक कम कर देता है, जो इस आकार के ओपन-वेट मॉडल के लिए असामान्य है।

इसका समग्र बेंचमार्क औसत अंग्रेज़ी में 75.5 और जर्मन में 70.8 है।

Aleph Alpha ने 128,000-टोकन की शब्दावली एक नए टोकनाइज़र एल्गोरिद्म UniBPE से प्रशिक्षित की, जो बाइट-पेयर एनकोडिंग की greedy बॉटम-अप मर्जेस रखता है, लेकिन यह तय करने के लिए Unigram उद्देश्य का उपयोग करता है कि कौन-सा मर्ज शब्दावली में जाए।

बताया गया लाभ यह है कि जर्मन में 4.90 बाइट/टोकन का संपीड़न मिलता है, जबकि GPT-5 के टोकनाइज़र के लिए यह 4.35 है; अंग्रेज़ी 4.58 बाइट/टोकन पर रहती है (GPT-5 के टोकनाइज़र में 4.67)।

यह गुणवत्ता जितना ही लागत के लिए भी मायने रखता है।

बेहतर संपीड़न का मतलब है कि उसी जर्मन दस्तावेज़ के लिए कम टोकन, इसलिए 50-पृष्ठ का Bescheid (जर्मनी का एक आधिकारिक प्रशासनिक नोटिस) प्रोसेस करने में कम लागत आती है और कॉन्टेक्स्ट में अधिक जगह बचती है।

प्री-ट्रेनिंग मिक्स में जर्मन 23.4% था, जबकि अंग्रेज़ी वेब और दस्तावेज़ 43.4% थे, इसलिए क्षमता मुख्य प्रशिक्षण रन के बाद जोड़े गए फाइन-ट्यून के बजाय डेटा में निवेश से आई है।

ईमानदार शर्त के साथ 1M-टोकन कॉन्टेक्स्ट विंडो

मॉडल 1,048,576 टोकन का दावा करता है। यह 201B-टोकन के लोंग-कॉन्टेक्स्ट प्रशिक्षण चरण के बाद 262,144 टोकन को नैटिव रूप से संभालता है और 1M तक extrapolate करके पहुँचता है, यानी इसे उस लंबाई पर कभी ट्रेन नहीं किया गया।

Aleph Alpha खुद सेवा दक्षता के लिए 262,144 टोकन या उससे कम पर रहने की सलाह देता है। RULER, जो जाँचता है कि कोई मॉडल बहुत लंबे इनपुट्स में दबी विशिष्ट जानकारी ढूँढ और उपयोग कर सकता है या नहीं, बेस मॉडल के लिए गिरावट दिखाता है: 128K पर 67.9 और 1M पर 63.2, जबकि उद्धृत Qwen3.5 35B-A3B बेस का 128K पर 89.9 है।

न्याय के लिए कहें तो, 1M पर Kolibri का स्कोर Nemotron 3 Nano (58.5) और Qwen3.5 (57.5) से बेहतर है, इसलिए यह निचले शुरुआती बिंदु से भी उनसे कम फीका पड़ता है।

मैं 1M आंकड़े को एक ऐसी छत मानूँगा जिसे आप तकनीकी रूप से छू सकते हैं, न कि एक कार्यशील बजट।

यदि आपकी retrieval-augmented generation (RAG) पाइपलाइन स्कैन किए गए PDFs को टेक्स्ट (OCR) में बदलकर 400K टोकन प्रॉम्प्ट में ठूँसती है और उम्मीद करती है कि मॉडल एक विशिष्ट विवरण भरोसेमंद रूप से ढूँढ लेगा, तो कमिट करने से पहले परीक्षण करें। विशेष रूप से, लोंग-कॉन्टेक्स्ट विस्तार मिक्स का 33.3% OCR किए गए PDFs थे, इसलिए स्कैन-डॉक्यूमेंट वर्कलोड्स स्पष्ट लक्ष्य उपयोग-केस हैं।

नियंत्रणयोग्य reasoning मोड और नैटिव टूल कॉलिंग

Reasoning मोड का अर्थ है कि मॉडल उत्तर देने से पहले समस्या को चरण-दर-चरण सुलझाता है, जिससे सटीकता बढ़ती है लेकिन अधिक टोकन खर्च होते हैं।

Kolibri 1 में, यह एक स्विच है जिसे आप नियंत्रित करते हैं—यह कोई अलग मॉडल टियर नहीं है—और टूल कॉलिंग (मॉडल का किसी बाहरी फ़ंक्शन या API, जैसे डेटाबेस लुकअप, को कॉल करने का निर्णय) नैटिव है।

Aleph Alpha बहु-चरण reasoning, RAG, एजेंटिक टूल कॉलिंग, कोडिंग, और द्विभाषी असिस्टेंट कार्य को अपेक्षित उपयोग के रूप में सूचीबद्ध करता है, और मिड-ट्रेनिंग मिक्स में एजेंटिक कोड और टूल उपयोग को 15.4% दिया, जो प्री-ट्रेनिंग के दौरान लगभग शून्य से बढ़ा।

एक अनौपचारिक उपयोगकर्ता रिपोर्ट में, मॉडल को एकल RTX Pro 6000 वर्कस्टेशन GPU पर FP8 में चलाते हुए, लगभग 170 टोकन प्रति सेकंड मापा गया और यह प्रवृत्ति दिखी कि यह विचार-विमर्श में बहुत टोकन खर्च करता है।

यदि आप लेटेंसी-संवेदी पाथ में डिफ़ॉल्ट रूप से reasoning चालू छोड़ते हैं, तो उसके लिए बजट रखें।

एंड-टू-एंड परिनियोजन जो आपके नियंत्रण में है

Kolibri 1 शून्य से प्रशिक्षित है, इसलिए यह किसी दूसरी कंपनी के मॉडल का फाइन-ट्यून या कॉपी नहीं है।

यह लाइसेंसिंग और यह जानने—कि इसमें क्या-क्या गया—दोनों के लिए अहम है।

Apache 2.0 वेट्स के साथ मिलकर, इसका मतलब है कि आप Kolibri 1 को एयर-गैप्ड (पूरी तरह इंटरनेट से कटा हुआ) चला सकते हैं, फाइन-ट्यून कर सकते हैं, और बिना किसी से पूछे इसे किसी वाणिज्यिक उत्पाद में शिप कर सकते हैं।

EU AI Act और उसका General-Purpose AI (GPAI) Code of Practice, सामान्य-उद्देश्य मॉडलों के लिए EU के नियम तय करते हैं, जिसमें प्रशिक्षण डेटा का दस्तावेज़ीकरण शामिल है।

Aleph Alpha Code of Practice का हस्ताक्षरी है और एक विस्तृत मॉडल कार्ड प्रकाशित करता है जिसमें प्रशिक्षण-डेटा के स्रोत, डीकॉन्टैमिनेशन कदम (ट्रेनिंग डेटा से बेंचमार्क प्रश्न हटाना), और राइटशोल्डर्स के लिए संपर्क बिंदु शामिल है—यही वह दस्तावेज़ीकरण है जिसकी EU AI Act अनुपालन समीक्षा में माँग होगी।

जर्मनी और व्यापक EU के सार्वजनिक-क्षेत्र के खरीदारों के लिए, वह कागज़ात अक्सर किसी बेंचमार्क अंतर से अधिक निर्णायक होता है।

और यह वह हिस्सा है जिसे कोई अमेरिकी लैब जल्दी नहीं कॉपी कर सकती।

दस्तावेजीकृत सीमाएँ, जिनके अनुसार योजना बनानी चाहिए

Aleph Alpha का मॉडल कार्ड सीमाओं को खुलकर बताता है, और खरीद के फैसले से पहले उन्हें पढ़ना चाहिए:

  • केवल टेक्स्ट—छवि, ऑडियो या वीडियो का इनपुट/आउटपुट नहीं।
  • निहित विश्व-ज्ञान 18 जून, 2026 तक सीमित है, यद्यपि टूल उपयोग से नया डेटा लाया जा सकता है।
  • सिस्टमिक और राजनीतिक पक्षपात को नकारा नहीं गया है, और मॉडल को किसी विशेष दृष्टिकोण पर ट्यून नहीं किया गया। प्रशिक्षण डेटा में कुछ सामग्री चीनी भाषा मॉडलों से जनरेटेड भी शामिल है, जिनमें ज्ञात राजनीतिक पक्षपात होते हैं। Aleph Alpha कहता है कि उसने इसे कम करने पर काम किया।
  • मॉडल मानव-AI सहयोग के लिए बनाया गया है। निर्णय-सहायता प्रणालियों में यह सलाहकार पक्ष पर होना चाहिए, निर्णय लेने वाले घटक के रूप में नहीं।

किसी भी उच्च-दांव परिनियोजन के लिए, Aleph Alpha बताता है कि अतिरिक्त गार्डरेल्स और Regulation (EU) 2024/1689 का अनुपालन आवश्यक है।

बेंचमार्क्स पर Kolibri 1 का प्रदर्शन कैसा है?

Kolibri 1 का बेंचमार्क प्रोफ़ाइल एक उपयोगी तरह से असंतुलित है: यह प्रतियोगी गणित और जर्मन रीजनिंग पर अपने बताए तुलना-समूह में आगे है, और क्लोज़्ड-बुक नॉलेज, MMLU-Pro, और अधिकांश टूल-उपयोग सूट्स में Qwen3.6 35B-A3B से हारता है।

Aleph Alpha Qwen3.6 35B-A3B, Mistral Small 4 119B-A6B, और Nemotron 3 Super 120B-A12B के साथ तुलना करता है।

मॉडल कार्ड Qwen3.8 27B को भी सूचीबद्ध करता है, जो एक डेंस मॉडल है (MoE के विपरीत, जो हर टोकन के लिए अपने सभी पैरामीटर्स का उपयोग करता है) और जो कुल मिलाकर बेहतर स्कोर करता है (समग्र जर्मन 79.9, Kolibri के 70.8 के मुकाबले) और इसके सक्रिय पैरामीटर्स लगभग आठ गुना हैं।

मैंने इसे नीचे की तालिकाओं से बाहर रखा है, लेकिन दक्षता दावों को पढ़ते समय इसे ध्यान में रखें।

उन मॉडल नामों में, "A" के बाद की संख्या प्रति टोकन सक्रिय पैरामीटर्स है, तो 35B-A3B का मतलब 35B कुल और 3B सक्रिय। नीचे तालिकाओं में दिए बेंचमार्क्स यह मापते हैं:

  • AIME: एक अमेरिकी हाई-स्कूल ओलंपियाड क्वालिफायर के प्रतियोगिता-स्तरीय गणित प्रश्न।
  • GPQA Diamond: जीवविज्ञान, भौतिकी और रसायन विज्ञान में अत्यंत कठिन, विशेषज्ञों द्वारा लिखे गए विज्ञान प्रश्न।
  • Humanity's Last Exam (HLE): जानबूझकर कठिन बनाया गया व्यापक परीक्षण, जिसे विशेषज्ञों ने AI को अटकाने के लिए तैयार किया है।
  • MMLU-Pro और MMLU-ProX: विविध विषयों पर व्यापक सामान्य-ज्ञान प्रश्न। "CoT" का अर्थ है कि मॉडल पहले चरण-दर-चरण तर्क करता है, और ProX जर्मन के लिए इस्तेमाल किया जाने वाला बहुभाषी संस्करण है।
  • AA-Omniscience: तथ्यात्मक स्मरण-शक्ति और यह जांचना कि मॉडल जब नहीं जानता तो मानने के बजाय क्या स्वीकार करता है।
  • Tau2-Bench, Tau3-Bench, और BFCL: सिम्युलेटेड ग्राहक-सेवा कार्य जिनमें मॉडल वार्तालाप के दौरान टूल्स का उपयोग करता है, और यह परीक्षण कि वह फंक्शन कॉल कितनी सटीकता से करता है।
  • LiveCodeBench, SWE-bench Verified, और Terminal-Bench: शून्य से कोड लिखना, वास्तविक GitHub बग ठीक करना, और कमांड लाइन में काम करना।

kolibri-1-benchmarks

तर्क और गणित

गणित वह क्षेत्र है जहाँ Kolibri 1 साफ बढ़त में है।

यह AIME 2026 (EN) पर 96% स्कोर करता है, जबकि Qwen3.6 35B-A3B के लिए 91%, Nemotron 3 Super के लिए 90.4%, और Mistral Small 4 के लिए 83.1% है, और AIME 2025 (EN) पर 96.9% जबकि Qwen3.6 का 84.6% है।

GPQA Diamond (EN) पर यह 84.3% लेता है बनाम 83.4%, और Humanity's Last Exam (EN) पर 21.5% बनाम 21.1%, दोनों इतने करीब हैं कि बराबरी मानी जा सकती है।

उसी तालिका में कमजोर कड़ी ज्ञान है।

AA-Omniscience Index (public set) ऐसे पैमाने पर स्कोर किया जाता है जहाँ नकारात्मक संख्याएँ आम हैं और ऊँचा बेहतर है। Kolibri 1 -32.8 तक पहुँचता है, जबकि Qwen3.6 के लिए -12.5 और Mistral Small 4 के लिए -24.0 है, हालांकि यह Nemotron 3 Super के -36.5 से थोड़ा आगे है। एक अलग AA-Omniscience सटीकता आँकड़ा 14.8% आता है, जो चारों मॉडलों में सबसे कम है।

उसी बेंचमार्क पर इसका नॉन-हैलुसिनेशन रेट अधिक अनुकूल 44.0% है, जो Nemotron (13.9%) और Mistral (34.7%) से आगे है लेकिन Qwen3.6 (56.7%) से पीछे, जो Aleph Alpha के abstention प्रशिक्षण से मेल खाता है।

3.46B सक्रिय-पैरामीटर मॉडल में तथ्यों को याद रखने की सीमित गुंजाइश होती है, इसलिए क्लोज़्ड-बुक रिकॉल पर भरोसा करने के बजाय इसे रिट्रीवल के साथ जोड़ें।

बेंचमार्क (EN) Kolibri 1 Qwen3.6 35B-A3B Mistral Small 4 119B-A6B Nemotron 3 Super 120B-A12B
AIME 2026 96% 91% 83.1% 90.4%
AIME 2025 96.9% 84.6% 79.8% 91.7%
GPQA Diamond 84.3% 83.4% 74.7% 78%
Humanity's Last Exam 21.5% 21.1% 9.7% 20.6%
MMLU-Pro CoT 80% 84.3% 80.4% 82.7%
AA-Omniscience Index (उच्च बेहतर है) -32.8 -12.5 -24.0 -36.5

जर्मन-भाषा कार्य

Kolibri 1 जर्मन गणित और विज्ञान बेंचमार्क में आगे है और जर्मन ज्ञान वाले में पीछे, जो इसके अंग्रेजी प्रोफाइल जैसी ही आकृति है।

यह AIME 2026 (DE) पर 90% स्कोर करता है जबकि Qwen3.6 के लिए 84.4%, और GPQA Diamond (DE) पर 81.3% जबकि 80.6%। MMLU-ProX CoT (DE) पर यह 75.5% पर आ जाता है जबकि Qwen3.6 81.9% और Nemotron 3 Super 79.7% तक पहुँचते हैं, और Humanity's Last Exam (DE) पर यह 15.9% करता है जबकि Nemotron का 22.3% है।

मुझे वास्तव में दिलचस्प इसकी अंग्रेजी-से-जर्मन की छोटी खाई लगती है।

Kolibri AIME 2026 को अंग्रेजी से जर्मन में ले जाते हुए 6 अंक खोता है और GPQA Diamond पर 3 अंक, जो उस मॉडल से अपेक्षित गिरावट से संकरी है जो जर्मन को केवल अनुवाद लक्ष्य की तरह मानता हो।

बेंचमार्क (DE) Kolibri 1 Qwen3.6 35B-A3B Mistral Small 4 119B-A6B Nemotron 3 Super 120B-A12B
AIME 2026 90% 84.4% 78.5% 87.5%
AIME 2025 87.5% 82.9% 72.3% 85.6%
GPQA Diamond 81.3% 80.6% 72.9% 76.6%
MMLU-ProX CoT 75.5% 81.9% 70.7% 79.7%
Humanity's Last Exam 15.9% 20.5% 10.5% 22.3%

टूल कॉलिंग और एजेंटिक कार्य

यह रिलीज़ का सबसे नरम हिस्सा है।

BFCL v4 कुल मिलाकर, Kolibri 1 61.4% स्कोर करता है जबकि Qwen3.6 के लिए 67.2%, और Tau2-Bench (Telecom) पर यह 94.7% तक पहुँचता है जबकि Qwen3.6 का 99.1% है। यह Tau2-Bench (Airline) पर Qwen3.6 को मामूली रूप से पीछे छोड़ता है, 76.7% बनाम 70.7%।

अलग से रिपोर्ट किया गया BFCL v3 मल्टी-टर्न आँकड़ा 39.8 पॉइंट (Qwen3.6 के लिए 53.5) वही कमजोरी दिखाता है: एकल टूल कॉल ठीक हैं, बार-बार टूल राउंड-ट्रिप के साथ लंबी बातचीत नहीं।

अपवाद इसका उल्टा है।

Tau3-Bench (Banking) पर, Kolibri 1 38.1% स्कोर करता है जबकि Qwen3.6 10.6%, Nemotron 3 Super 15.5%, और Mistral Small 4 केवल 5.7% लेते हैं। यह इस तुलना सेट में अगले सर्वश्रेष्ठ मॉडल पर लगभग 2.5x का मार्जिन है (Qwen3.6 पर 3.6x) एक फाइनेंस-फ्लेवर वाले एजेंट बेंचमार्क पर, और यह इस रिलीज़ का वह एकल परिणाम है जिसे मैं सबसे अधिक स्वतंत्र रूप से पुनरुत्पादित देखना चाहूँगा।

बेंचमार्क Kolibri 1 Qwen3.6 35B-A3B Mistral Small 4 119B-A6B Nemotron 3 Super 120B-A12B
Tau2-Bench (Telecom) 94.7% 99.1% 41.5% 68.1%
Tau2-Bench (Retail) 69.9% 71.6% 62.9% 67.5%
Tau2-Bench (Airline) 76.7% 70.7% 40% 72.7%
Tau3-Bench (Banking) 38.1% 10.6% 5.7% 15.5%
BFCL v4 (कुल) 61.4% 67.2% 58% 61%

कोडिंग और सॉफ्टवेयर इंजीनियरिंग

रिपोर्ट किए गए कोडिंग परिणाम हैं: LiveCodeBench v6 पर 85.9, SWE-bench Verified पर 66.4, और Terminal-Bench 2.1 पर 27.7।

कच्ची कोड जनरेशन मजबूत दिखती है, एजेंटिक सॉफ्टवेयर इंजीनियरिंग सामान्य दर्जे की, और Terminal-Bench का नंबर बताता है कि लंबा, बहु-चरणीय टर्मिनल कार्य इस मॉडल के लिए नहीं है।

एक संदूषण चेतावनी है जिसे उद्धृत करने से पहले आपको पढ़ना चाहिए।

तकनीकी रिपोर्ट नोट करती है कि अंग्रेजी के 48% और जर्मन के 47% HumanEval मूल्यांकन डेटा प्रशिक्षण-संबंधित सामग्री में दिखाई दिए, जो HumanEval-शैली के स्कोर को बढ़ा देते हैं।

तुलना तालिकाओं में कई सूट स्वामित्व वाले या विक्रेता-निर्मित हैं, जिससे पूरे सेट का ऑडिट करना कठिन हो जाता है, और लेखन के समय मौजूदा Claude, GPT, या Gemini फ्लैगशिप्स के विरुद्ध कोई सत्यापित, समान-से-समान तुलना मौजूद नहीं थी।

थ्रूपुट और दक्षता

दक्षता का दावा विक्रेता-रिपोर्टिंग चेतावनी के बाद भी सबसे बेहतर टिकता है, क्योंकि यह स्कोर के बजाय आर्किटेक्चर का गुण है।

यहाँ थ्रूपुट का अर्थ है प्रति GPU प्रति सेकंड मॉडल कितना पाठ जनरेट कर सकता है। Aleph Alpha इसे टोकन के बजाय बाइट्स में मापता है, ताकि अलग-अलग टोकनाइज़र वाले मॉडलों की निष्पक्ष तुलना हो सके।

Kolibri 1 Aleph Alpha के जर्मन बेंचमार्क सूट पर औसतन 71% पर बैठता है, जबकि प्रति GPU लगभग 47,000 बाइट/सेकंड डिकोड करता है। GPT OSS A5B लगभग 34,500 बाइट/सेकंड पर 70% तक पहुँचता है, Qwen 3.6 A3B लगभग 38,500 पर 67%, Gemma 4 A4B लगभग 43,000 पर 66%, और Nemotron Super A12B लगभग 24,000 पर 68%।

Nemotron मॉडल की तुलना में प्रति GPU लगभग 2x डिकोडेड टेक्स्ट परोसना, और वह भी उच्चतर जर्मन औसत पर, स्व-होस्टेड स्टैक में Kolibri चुनने का व्यावहारिक तर्क है।

यदि आप प्रति टोकन के बजाय अपने स्वयं के GPUs के लिए भुगतान कर रहे हैं, तो प्रति GPU थ्रूपुट वही संख्या है जो बिल में दिखाई देती है।

Kolibri 1 की कीमत और उपलब्धता

Kolibri 1 के लिए कोई प्रकाशित टोकन कीमत नहीं है।

Aleph Alpha ने होस्टेड API प्राइस सूची जारी नहीं की है, और 5 अक्टूबर, 2026 तक आधिकारिक API प्रलेखन में कोई पुष्टि किया गया Kolibri API मॉडल ID दिखाई नहीं दिया।

एंटरप्राइज़ परिनियोजन Aleph Alpha की सेल्स टीम के माध्यम से चलता है, और रिपॉजिटरी आइडेंटिफ़ायर Aleph-Alpha/Kolibri-1 को API मॉडल ID नहीं माना जाना चाहिए।

वेट्स स्वयं Apache 2.0 के तहत निःशुल्क हैं, इसलिए आपकी लागत GPU समय है।

FP8 मेमोरी फ़ुटप्रिंट लगभग 78 GB है, जिसमें न्यूनतम आवश्यकताएँ 2x A100 80 GB, 2x H100 SXM5, 1x H200, 1x B200, या 1x B300 बताई गई हैं, और अनुशंसित कॉन्फ़िगरेशन 2x H100 SXM5, 2x H200, 1x B200, या 1x B300 है। मॉडल सामान्य रूप से उपलब्ध है, प्रीव्यू नहीं, और कोई वेटलिस्ट या क्षेत्रीय लॉक नहीं है।

आप किसके मुकाबले ट्रेड-ऑफ़ कर रहे हैं, इसका अंदाज़ा लगाने के लिए, हमारी GPT-6.1 Sol कवरेज उस मॉडल को प्रति मिलियन टोकन $2 इनपुट / $10 आउटपुट पर रखती है। किसी तृतीय-पक्ष मूल्य-सारांश में पुराने GPT-5.6 Sol को $5 / $30 और GPT-5.6 Luna को 30 जुलाई के OpenAI मूल्य-ह्रास के बाद $0.20 / $1.20 पर सूचीबद्ध किया गया है।

स्व-होस्टिंग प्रति-इकाई अर्थशास्त्र में तभी जीतती है जब आपका वॉल्यूम B200 की फिक्स्ड लागत से ऊपर निकल जाए।

Kolibri 1 तक पहुँच कैसे पाएँ?

Kolibri 1 Apache 2.0 के तहत ओपन-वेट है, जो बिना किसी उपयोगकर्ता या राजस्व सीमा के वाणिज्यिक उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है।

वेट्स Hugging Face पर Aleph-Alpha/Kolibri-1 में float8_e4m3fn के रूप में उपलब्ध हैं। मॉडल कार्ड में केवल vLLM के ज़रिए सर्विंग का दस्तावेज़ है, Aleph Alpha के aleph-alpha-inference प्लगइन का उपयोग करते हुए। कम्युनिटी GGUF और MLX बिल्ड कुछ दिनों में आ गए, लेकिन Aleph Alpha ने उन्हें वैध नहीं ठहराया है, और मुझे कोई आधिकारिक Ollama एंट्री नहीं मिली।

सर्व्ड परिनियोजन के लिए, 1x H200 या 1x B200 एक ही कार्ड पर ~78 GB FP8 वेट्स रखता है। H100s पर --tensor-parallel-size 2 का उपयोग करें।

जब तक आपने विशेष रूप से लंबे कॉन्टेक्स्ट का परीक्षण नहीं किया है, --max-model-len को 262,144 पर या उससे नीचे रखें। उससे आगे जाने के लिए एक अतिरिक्त --hf-overrides फ़्लैग चाहिए, जिसका विवरण मॉडल कार्ड में है।

प्लगइन इंस्टॉल करें और सर्वर शुरू करें:

pip install 'aleph-alpha-inference>=1'

# Add --tensor-parallel-size 2 on 2x H100
vllm serve Aleph-Alpha/Kolibri-1 \
  --kv-cache-dtype fp8 \
  --max-model-len 262144 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

फिर OpenAI-संगत API के माध्यम से, वे सैंपलिंग पैरामीटर्स इस्तेमाल करते हुए क्वेरी करें जो Aleph Alpha सुझाता है (temperature 1.0, top_p 0.97, top_k 128):

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(
    model="Aleph-Alpha/Kolibri-1",
    messages=[{
        "role": "user",
        "content": "Fasse die wichtigsten Fristen aus diesem Bescheid in drei Punkten zusammen.",
    }],
    temperature=1.0,
    top_p=0.97,
    max_tokens=512,
    extra_body={
        "top_k": 128,
        "chat_template_kwargs": {"reasoning_effort": "medium"},
    },
)
print(response.choices[0].message.content)

Reasoning effort low, medium, और high स्वीकार करता है, और यदि विलंबता गहराई से अधिक मायने रखती है तो आप सोच-विचार को पूरी तरह बंद कर सकते हैं।

आउटपुट सैंपलिंग पैरामीटर्स के साथ बदलेंगे, और मॉडल कार्ड नोट करता है कि सैंपलिंग डिसेबल करने पर भी वे हल्के-से विचलित हो सकते हैं।

स्व-होस्टेड इन्फ़रेंस और एजेंट लूप्स पर गहराई से सेटअप कार्य के लिए, हमारा माइग्रेशन एजेंट बनाने पर API ट्यूटोरियल वे टूल-परमिशन और स्टीयरिंग पैटर्न कवर करता है जो सीधे ट्रांसफर होते हैं।

Kolibri 1 और सॉवरेन्टी का सवाल: Cohere विलय

Kolibri 1 को धारणा के स्तर पर 'sovereign AI' कहा गया है, जिसका अर्थ है कि कोई देश या संगठन अपनी अवसंरचना पर और अपने अधिकार क्षेत्र में अपने AI को चला, ऑडिट और नियंत्रित कर सकता है, किसी विदेशी प्रदाता के API, कीमत या सेवा शर्तों पर निर्भर हुए बिना। Kolibri 1 के लिए, यह दावा Apache 2.0 वेट्स पर टिका है जिन्हें आप एयर-गैप्ड (इंटरनेट से अलग) चला सकते हैं, यूरोपीय प्रशिक्षण अवसंरचना, और EU AI Act दस्तावेज़ीकरण पर।

हालाँकि, इस लॉन्च के पीछे कॉर्पोरेट संदर्भ की दो बातें हैं।

Aleph Alpha ने कनाडाई कंपनी Cohere के साथ एक बाध्यकारी विलय समझौते पर हस्ताक्षर किए हैं ताकि वे जिसे पहला ट्रांसअटलांटिक सॉवरेन AI समाधान बताते हैं, उसे बनाया जा सके।

संयुक्त कंपनी Cohere नाम के तहत संचालित होगी, टोरंटो और बर्लिन में दोहरे मुख्यालयों के साथ, और हाइडेलबर्ग अनुसंधान केंद्र के रूप में जारी रहेगा। यह सौदा अभी नियामकीय स्वीकृति चाहता है।

सॉवरेन्टी की पेशकश इस पर निर्भर करती है कि मॉडल का मालिक जो भी हो, वह इसे सपोर्ट करता रहे, और एक बार विलय पूरा होने पर Aleph Alpha ब्रांड Cohere में समा जाने वाला है, इसलिए दोनों बातों पर बेंचमार्क्स के साथ-साथ नज़र रखना उपयोगी है।

अंतिम विचार

Aleph Alpha यह दांव लगा रहा है कि सॉवरेन्टी, Apache 2.0 लाइसेंसिंग, और EU AI Act अनुपालन का प्रलेखन, यूरोपीय सार्वजनिक-क्षेत्र खरीदारों के लिए MMLU-Pro पर कुछ अंकों से अधिक मायने रखता है।

यह दांव तर्कसंगत लगता है, और Cohere के साथ कंपनी का विलय संकेत देता है कि वह केवल स्केल के दम पर नहीं जीत सकती।

मेरा मानना है कि यह कहना उचित होगा कि Kolibri 1 अपने सक्रिय-पैरामीटर आकार में जर्मन-भाषा का अब तक का सबसे अच्छा ओपन-वेट मॉडल है जिसे हमने इस स्तर पर दस्तावेजीकृत देखा है, लेकिन यदि मुझे लंबे मल्टी-टर्न एजेंट रन या क्लोज़्ड-बुक तथ्यात्मक रिकॉल चाहिए, तो मैं यही मॉडल नहीं चुनूँगा।

तुलनीय छोटे-सक्रिय MoE मॉडलों में, Qwen3.6 35B-A3B अभी भी वह मुक़ाबला जीतता है। यदि आप एक डेंस 27B मॉडल वहन कर सकते हैं, तो Qwen3.8 27B इसे पूरी तरह जीतता है।

यदि आप ऐसे मॉडलों को चलाने और मूल्यांकन करने में गति पकड़ना चाहते हैं, तो हमारी AI Fundamentals स्किल ट्रैक से शुरुआत करें।

FAQs

क्या Kolibri 1 उपयोग के लिए निःशुल्क है?

वेट्स Apache 2.0 लाइसेंस के तहत निःशुल्क हैं, जो बिना किसी राजस्व या उपयोगकर्ता सीमा के वाणिज्यिक उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है। 5 अक्टूबर, 2026 तक कोई प्रकाशित होस्टेड API कीमत और कोई पुष्टि किया गया Kolibri API मॉडल ID नहीं है, इसलिए आपकी लागत वही GPU समय है जिसके लिए आप भुगतान करते हैं। एंटरप्राइज़ परिनियोजन Aleph Alpha की सेल्स टीम के माध्यम से होता है।

Kolibri 1 चलाने के लिए आपको किस हार्डवेयर की आवश्यकता है?

FP8 वेट्स का मेमोरी फ़ुटप्रिंट लगभग 78 GB है। Aleph Alpha न्यूनतम के रूप में 2x A100 80 GB, 2x H100 SXM5, 1x H200, 1x B200, या 1x B300 सूचीबद्ध करता है, और 2x H100 SXM5, 2x H200, 1x B200, या 1x B300 की अनुशंसा करता है। एक उपयोगकर्ता ने एक सिंगल वर्कस्टेशन GPU पर 8-बिट क्वांटाइज़ेशन में लगभग 170 टोकन प्रति सेकंड की रिपोर्ट दी।

Kolibri 1 Qwen3.6 35B-A3B से कैसे तुलना करता है?

Kolibri 1 प्रतियोगी गणित और जर्मन तर्क में आगे है, AIME 2026 (EN) पर 96% स्कोर करते हुए Qwen3.6 के 91% के मुकाबले, और AIME 2026 (DE) पर 90% बनाम 84.4%। Qwen3.6 MMLU-Pro CoT (84.3% बनाम 80%), AA-Omniscience Index (42.35% बनाम 33.6%), और BFCL v4 टूल कॉलिंग (67.2% बनाम 61.4%) पर जीतता है। अपवाद Tau3-Bench (Banking) है, जहाँ Kolibri 38.1% स्कोर करता है जबकि Qwen3.6 10.6%।

मैं Kolibri 1 कहाँ डाउनलोड कर सकता/सकती हूँ?

वेट्स Hugging Face पर Aleph-Alpha/Kolibri-1 के रूप में प्रकाशित हैं, और एक Ollama एंट्री kolibri के रूप में सूचीबद्ध है। 5 अक्टूबर, 2026 तक मॉडल OpenRouter या models.dev कैटलॉग में सूचीबद्ध नहीं था, और लॉन्च पर कोई सार्वजनिक होस्टेड इन्फ़रेंस प्रदाता उपलब्ध नहीं था।

Kolibri 1 का सबसे अच्छा उपयोग किसके लिए है?

Aleph Alpha इसे मल्टी-स्टेप तर्क, रिट्रीवल-ऑग्मेंटेड जनरेशन, एजेंटिक टूल कॉलिंग, कोडिंग, और जर्मन- एवं अंग्रेजी-भाषा सहायक कार्य के लिए पोज़िशन करता है। यह गणित, जर्मन-भाषा तर्क, और कच्ची कोड जनरेशन पर सबसे मजबूत है, और क्लोज़्ड-बुक तथ्यात्मक रिकॉल, लंबे मल्टी-टर्न टूल उपयोग, और एजेंटिक सॉफ्टवेयर इंजीनियरिंग पर सबसे कमजोर। यह केवल पाठ-आधारित है—छवि, ऑडियो, या वीडियो समर्थन नहीं है।

Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

एआई और एडटेक क्षेत्र में सीनियर संपादक। डेटा और एआई रुझानों की पड़ताल के लिए प्रतिबद्ध।  

विषय
कृत्रिम बुद्धिमत्ता
बड़े भाषा मॉडल

शीर्ष DataCamp कोर्स

कोर्स

डेवलपर्स के लिए AI-असिस्टेड कोडिंग

1 घंटा 30 मिनट
10.5K
AI से अपनी कोडिंग को बेहतर बनाएं—अपने कोडिंग असिस्टेंट को कोड लिखने, टेस्ट करने और दस्तावेज़ीकरण करने के लिए प्रभावी ढंग से मार्गदर्शन करें।
विवरण देखेंRight Arrow
पाठ्यक्रम शुरू करें

कोर्स

एडवांस्ड AI-असिस्टेड कोडिंग फॉर डेवलपर्स

1 घंटा 30 मिनट
1.7K
कोड विश्लेषण, प्रदर्शन अनुकूलन, सुरक्षा और सॉफ़्टवेयर आर्किटेक्चर निर्णयों के लिए AI को वरिष्ठ इंजीनियरिंग साझेदार की तरह उपयोग करना सीखें।

कोर्स

FastAPI के साथ प्रोडक्शन में AI डिप्लॉय करना

4 घंटा
5.4K
AI मॉडल्स को सपोर्ट करने वाले APIs विकसित करने के लिए FastAPI का उपयोग करना सीखें, जो वास्तविक-विश्व की मांगों को पूरा करने के लिए बनाए गए हैं।
और देखेंRight Arrow