course
OpenAI ने अपना नवीनतम लार्ज लैंग्वेज मॉडल GPT-4o, जो GPT-4 Turbo का उत्तराधिकारी है, की घोषणा की है। इसकी क्षमताओं, प्रदर्शन, और आप इसे कैसे उपयोग करना चाहेंगे—यह सब जानने के लिए आगे पढ़ें।
OpenAI का GPT-4o क्या है?
GPT-4o OpenAI का नवीनतम LLM है। GPT-4o में 'o' का अर्थ "omni"—यानी "सभी"—है, जो इस तथ्य की ओर संकेत करता है कि यह नया मॉडल टेक्स्ट, ऑडियो, इमेज और वीडियो के मिश्रण के रूप में दिए गए प्रॉम्प्ट स्वीकार कर सकता है। पहले, ChatGPT इंटरफ़ेस अलग-अलग कंटेंट प्रकारों के लिए अलग मॉडल इस्तेमाल करता था।
उदाहरण के लिए, जब आप Voice Mode के जरिए ChatGPT से बात करते थे, तो आपकी आवाज़ को Whisper से टेक्स्ट में बदला जाता था, GPT-4 Turbo से टेक्स्ट प्रतिक्रिया बनाई जाती थी, और फिर उस टेक्स्ट को TTS से स्पीच में बदला जाता था।

स्पीच इनपुट को प्रोसेस करने में GPT-4 Turbo और GPT-4o के तरीकों की तुलना
इसी तरह, ChatGPT में इमेज़ के साथ काम करने में GPT-4 Turbo और DALL-E 3 का संयोजन शामिल था।
विभिन्न कंटेंट माध्यमों के लिए एक ही मॉडल होने से गति और गुणवत्ता में वृद्धि, सरल इंटरफ़ेस, और कुछ नए उपयोग मामले संभव होने का वादा मिलता है।
GPT-4o mini क्या है?
GPT-4o Mini, GPT-4o का हल्का और तेज़ संस्करण है, जिसे गति और दक्षता पर अधिक ध्यान देने वाले कार्यों के लिए डिज़ाइन किया गया है। यह बड़े GPT-4o मॉडल से distillation नामक प्रक्रिया के माध्यम से निकाला गया है।
हालाँकि यह मूल मॉडल की मल्टीमॉडल इनपुट—टेक्स्ट, ऑडियो और इमेज—को प्रोसेस करने की क्षमता का अधिकांश हिस्सा बनाए रखता है, GPT-4o mini को हल्के-फुल्के अनुप्रयोगों के लिए अनुकूलित किया गया है जहाँ तेज़ प्रतिक्रिया समय महत्वपूर्ण है।
यह विशेष रूप से उन डेवलपर्स के लिए उपयोगी है जिन्हें कोडिंग, डीबगिंग, और रियल-टाइम इंटरैक्शन के लिए किफायती समाधान चाहिए, जहाँ GPT-4o की पूरी कंप्यूटेशनल शक्ति आवश्यक नहीं होती।
आप GPT-4o mini पर इस लेख में और विवरण पढ़ सकते हैं।
GPT-4 Turbo से GPT-4o को क्या अलग बनाता है?
ऑल-इन-वन मॉडल दृष्टिकोण का मतलब है कि GPT-4o ने पिछले वॉयस इंटरैक्शन की कई सीमाओं को पार कर लिया है।
1. अब टोन-ऑफ-वॉइस पर विचार होता है, जिससे भावनात्मक प्रतिक्रियाएं मिलती हैं
पहले के OpenAI सिस्टम में Whisper, GPT-4 Turbo, और TTS को पाइपलाइन में जोड़ने पर, तर्क इंजन GPT-4 के पास केवल बोले गए शब्दों तक ही पहुंच होती थी। इस विधि में वॉइस का टोन, बैकग्राउंड शोर, और कई वक्ताओं की आवाज़ों की जानकारी जैसी चीज़ें हटा दी जाती थीं। इस कारण GPT-4 Turbo वास्तव में अलग-अलग भावनाओं या बोलने की शैलियों के साथ प्रतिक्रियाएं व्यक्त नहीं कर पाता था।
टेक्स्ट और ऑडियो पर तर्क कर सकने वाले एकल मॉडल के होने से, यह समृद्ध ऑडियो जानकारी उच्च-गुणवत्ता वाली प्रतिक्रियाएं देने और अधिक विविध बोलने की शैलियों को सक्षम करने में काम आती है।
निम्नलिखित उदाहरण में, जो OpenAI ने प्रदान किया, GPT-4o तंजपूर्ण (sarcastic) आउटपुट देता है।
2. कम विलंबता रियल-टाइम बातचीत को संभव बनाती है
मौजूदा तीन-मॉडल पाइपलाइन का मतलब था कि ChatGPT से बात करने और प्रतिक्रिया मिलने के बीच एक छोटा-सा विलंब ("latency") होता था।
OpenAI ने साझा किया कि Voice Mode की औसत विलंबता GPT-3.5 के लिए 2.8 सेकंड और GPT-4 के लिए 5.4 सेकंड है। तुलना के लिए, GPT-4o की औसत विलंबता 0.32 सेकंड है—GPT-3.5 से नौ गुना और GPT-4 से 17 गुना तेज़।
यह घटा हुआ विलंब मानव की औसत प्रतिक्रिया समय (0.21 सेकंड) के क़रीब है और वार्तालाप-आधारित उपयोग मामलों के लिए महत्वपूर्ण है, जहाँ इंसान और AI के बीच कई बार आगे-पीछे बातचीत होती है और प्रतिक्रियाओं के बीच के अंतराल जुड़ते जाते हैं।
यह फ़ीचर 2010 में Google द्वारा Instant लॉन्च करने की याद दिलाता है—सर्च क्वेरी के लिए ऑटो-पूर्णता। भले ही सर्च करने में ज़्यादा समय नहीं लगता, लेकिन हर बार कुछ सेकंड बचना प्रोडक्ट अनुभव को बेहतर बनाता है।
GPT-4o की कम विलंबता के साथ एक उपयोग मामला जो अधिक व्यावहारिक हो जाता है, वह है स्पीच का रियल-टाइम अनुवाद। OpenAI ने दो सहकर्मियों—एक अंग्रेज़ी वक्ता और दूसरा स्पेनिश वक्ता—का उपयोग मामला दिखाया, जो GPT-4o से अपनी बातचीत का अनुवाद करवा कर संवाद करते हैं।
3. एकीकृत विज़न कैमरा फीड का वर्णन करने में सक्षम बनाता है
वॉइस और टेक्स्ट इंटीग्रेशन के अतिरिक्त, GPT-4o में इमेज और वीडियो फ़ीचर्स भी शामिल हैं। इसका मतलब है कि यदि आप इसे किसी कंप्यूटर स्क्रीन तक पहुंच दें, तो यह ऑन-स्क्रीन क्या दिख रहा है उसका वर्णन कर सकता है, ऑन-स्क्रीन इमेज के बारे में सवालों का जवाब दे सकता है, या आपके काम के लिए सह-पायलट की तरह कार्य कर सकता है।
OpenAI के एक वीडियो में, जिसमें Khan Academy के Sal Khan हैं, GPT-4o Sal के बेटे के गणित के होमवर्क में मदद करता है।
स्क्रीन के साथ काम करने से आगे, यदि आप GPT-4o को किसी कैमरा—मसलन आपके स्मार्टफोन—तक पहुंच दें, तो यह जो देखता है उसका वर्णन कर सकता है।
OpenAI द्वारा प्रस्तुत एक लंबा डेमो इन सभी फ़ीचर्स को जोड़ता है। GPT-4o चलाने वाले दो स्मार्टफोन बातचीत करते हैं। एक GPT के पास स्मार्टफोन कैमरों तक पहुंच है और वह जो देख सकता है उसका वर्णन दूसरे GPT को करता है जो देख नहीं सकता।
नतीजा—एक इंसान और दो AI के बीच तीन-तरफ़ा बातचीत। वीडियो में AIs के गाने का एक हिस्सा भी शामिल है, जो पिछले मॉडलों के साथ संभव नहीं था।
4. गैर-रोमन लिपियों के लिए बेहतर टोकनाइज़ेशन, अधिक गति और लागत-प्रभावशीलता देता है
LLM वर्कफ़्लो का एक चरण वह होता है जब प्रॉम्प्ट टेक्स्ट को टोकन में बदला जाता है। ये टेक्स्ट की इकाइयाँ होती हैं जिन्हें मॉडल समझ सकता है।
अंग्रेज़ी में एक टोकन आमतौर पर एक शब्द या विराम चिह्न होता है, हालांकि कुछ शब्दों को कई टोकनों में तोड़ा जा सकता है। औसतन, तीन अंग्रेज़ी शब्द लगभग चार टोकन लेते हैं।
यदि किसी भाषा को मॉडल में कम टोकनों से दर्शाया जा सके, तो कम गणनाएँ करनी पड़ती हैं और टेक्स्ट जनरेशन की गति बढ़ जाती है।
इसके अलावा, चूँकि OpenAI अपने API के लिए इनपुट या आउटपुट प्रति टोकन शुल्क लेता है, कम टोकन का मतलब API उपयोगकर्ताओं के लिए कम कीमत है।
GPT-4o में एक बेहतर टोकनाइज़ेशन मॉडल है जिससे प्रति टेक्स्ट कम टोकनों की आवश्यकता पड़ती है। यह सुधार विशेष रूप से उन भाषाओं में अधिक दिखाई देता है जो रोमन लिपि का उपयोग नहीं करतीं।
उदाहरण के लिए, भारतीय भाषाओं को खासतौर पर लाभ हुआ है—हिंदी, मराठी, तमिल, तेलुगु और गुजराती में टोकन 2.9 से 4.4 गुना तक कम हुए हैं। अरबी में 2x टोकन कमी देखी गई, और चीनी, जापानी, कोरियाई, वियतनामी जैसी पूर्वी एशियाई भाषाओं में 1.4x से 1.7x तक कमी हुई।
5. फ्री प्लान पर रोलआउट
ChatGPT के लिए OpenAI की मौजूदा प्राइसिंग रणनीति के तहत, सर्वश्रेष्ठ मॉडल तक पहुंच के लिए भुगतान करना पड़ता था: GPT-4 Turbo केवल Plus और Enterprise पेड प्लान पर उपलब्ध था।
यह बदल रहा है—OpenAI ने GPT-4o को फ्री प्लान पर भी उपलब्ध कराने का वादा किया है। Plus उपयोगकर्ताओं को फ्री प्लान उपयोगकर्ताओं की तुलना में पाँच गुना अधिक संदेश मिलेंगे।
रोलआउट क्रमिक होगा, जिसमें रेड टीम (टेस्टर्स जो समस्याएँ खोजने के लिए मॉडल को तोड़ने की कोशिश करते हैं) की पहुंच तुरंत शुरू होगी और समय के साथ अधिक उपयोगकर्ताओं को पहुंच मिलेगी।
6. ChatGPT डेस्कटॉप ऐप का लॉन्च
हालाँकि यह ज़रूरी नहीं कि GPT-4o के लिए विशेष अपडेट हो, OpenAI ने ChatGPT डेस्कटॉप ऐप के रिलीज़ की भी घोषणा की। ऊपर बताई गई विलंबता और मल्टीमॉडलिटी में सुधार, ऐप के साथ मिलकर, यह दर्शाते हैं कि हम ChatGPT के साथ कैसे काम करते हैं, इसमें बदलाव आने वाला है। उदाहरण के लिए, OpenAI ने वॉइस और ChatGPT डेस्कटॉप ऐप का उपयोग करते हुए ऑगमेंटेड कोडिंग वर्कफ़्लो का डेमो दिखाया। उस उदाहरण को एक्शन में देखने के लिए यूज़-केस सेक्शन में नीचे स्क्रॉल करें!
GPT-4o कैसे काम करता है?
कई कंटेंट प्रकार, एक न्यूरल नेटवर्क
GPT-4o कैसे काम करता है, इस पर विवरण अभी कम हैं। OpenAI ने अपनी घोषणा में जो एकमात्र जानकारी दी, वह यह है कि GPT-4o एकल न्यूरल नेटवर्क है, जिसे टेक्स्ट, विज़न और ऑडियो इनपुट पर प्रशिक्षित किया गया है।
यह नया दृष्टिकोण उन पिछली तकनीकों से अलग है जिनमें अलग-अलग डेटा प्रकारों पर प्रशिक्षित अलग-अलग मॉडल होते थे।
हालाँकि, GPT-4o मल्टीमॉडल दृष्टिकोण अपनाने वाला पहला मॉडल नहीं है। 2022 में, TenCent Lab ने SkillNet बनाया, एक मॉडल जिसने LLM ट्रांसफॉर्मर विशेषताओं को कंप्यूटर विज़न तकनीकों के साथ जोड़ा ताकि चीनी अक्षरों को पहचानने की क्षमता में सुधार हो सके।
2023 में, ETH Zurich, MIT और Stanford University की एक टीम ने WhisBERT बनाया, जो BERT श्रृंखला के बड़े भाषा मॉडलों का एक रूपांतर है। पहला न होने पर भी, GPT-4o इन शुरुआती प्रयासों की तुलना में कहीं अधिक महत्वाकांक्षी और शक्तिशाली है।
क्या GPT-4o, GPT-4 Turbo से एक बड़ा बदलाव है?
GPT-4o की आर्किटेक्चर में GPT-4 Turbo की तुलना में कितना बड़ा बदलाव है, यह इस पर निर्भर करता है कि आप OpenAI की इंजीनियरिंग टीम से पूछते हैं या मार्केटिंग टीम से। अप्रैल में, LMSYS के Chatbot Arena—जो सर्वश्रेष्ठ जनरेटिव AI के लिए लीडरबोर्ड है—पर "im-also-a-good-gpt2-chatbot" नाम का एक बॉट दिखाई दिया। अब पता चला है कि वह रहस्यमयी AI, GPT-4o ही था।
नाम का "gpt2" हिस्सा महत्वपूर्ण है। GPT-2—जो GPT-3.5 और GPT-4 का पूर्ववर्ती है—से न मिलाएँ; "2" प्रत्यय को GPT श्रृंखला के लिए पूरी तरह नई आर्किटेक्चर का संकेत माना गया।
स्पष्ट रूप से, OpenAI की रिसर्च या इंजीनियरिंग टीम में किसी का मानना है कि टेक्स्ट, विज़न और ऑडियो कंटेंट प्रकारों को एकल मॉडल में जोड़ना इतना बड़ा बदलाव है कि छह वर्षों में पहली बार वर्ज़न नंबर में बढ़ोतरी जायज़ है।
वहीं, मार्केटिंग टीम ने अपेक्षाकृत मामूली नामकरण परिवर्तन चुना है, "GPT-4" परंपरा जारी रखते हुए।
अन्य मॉडलों के मुकाबले GPT-4o का प्रदर्शन
OpenAI ने GPT-4o की तुलना कई अन्य हाई-एंड मॉडलों से करते हुए बेंचमार्क आंकड़े जारी किए।
- GPT-4 Turbo
- GPT-4 (प्रारंभिक रिलीज़)
- Claude 3 Opus
- Gemini Pro 1.5
- Gemini Ultra 1.0
- Llama 3 400B
इनमें से वास्तव में तुलना के लिए तीन मॉडल मायने रखते हैं। GPT-4 Turbo, Claude 3 Opus, और Gemini Pro 1.5 ने पिछले कुछ महीनों से LMSYS Chatbot Arena लीडरबोर्ड पर शीर्ष स्थान के लिए टक्कर ली है।
Llama 3 400B भविष्य में दावेदार हो सकता है, लेकिन यह अभी तैयार नहीं है। इसलिए यहाँ हम केवल इन तीन मॉडलों और GPT-4o के परिणाम प्रस्तुत करते हैं।
छह बेंचमार्क के परिणामों का उपयोग किया गया।
- Massive Multitask Language Understanding (MMLU)। प्राथमिक गणित, अमेरिकी इतिहास, कंप्यूटर विज्ञान, क़ानून इत्यादि से संबंधित कार्य। इस परीक्षण में उच्च सटीकता प्राप्त करने के लिए मॉडलों के पास व्यापक विश्व ज्ञान और समस्या-समाधान क्षमता होनी चाहिए।
- Graduate-Level Google-Proof Q&A (GPQA)। जीवविज्ञान, भौतिकी और रसायन विज्ञान में डोमेन विशेषज्ञों द्वारा लिखे गए बहुविकल्पीय प्रश्न। ये उच्च-गुणवत्ता और अत्यंत कठिन हैं: संबंधित डोमेन में PhD धारक या उसका अध्ययन कर रहे विशेषज्ञ 74% सटीकता प्राप्त करते हैं।
- MATH। मिडिल स्कूल और हाई स्कूल स्तर की गणित समस्याएँ।
- HumanEval। कंप्यूटर कोड की फ़ंक्शनल शुद्धता की जाँच—कोड जनरेशन के आकलन के लिए।
- Multilingual Grade School Math (MSGM)। प्राथमिक गणित समस्याएँ, दस भाषाओं में अनूदित—जिनमें बंगाली और स्वाहिली जैसी कम प्रतिनिधित्व वाली भाषाएँ शामिल हैं।
- Discrete Reasoning Over Paragraphs (DROP)। ऐसे प्रश्न जो पूरे पैराग्राफ़ को समझने की माँग करते हैं—जैसे कई वाक्यों में फैली मानों को जोड़ना, गिनना, या क्रमबद्ध करना।

छह LLM बेंचमार्क पर GPT-4o, GPT-4 Turbo, Gemini Pro 1.5 और Claude 3 Opus का प्रदर्शन। प्रत्येक बेंचमार्क का स्कोर 0 से 100 के बीच है। OpenAI द्वारा प्रदान किए गए डेटा से पुनर्निर्मित। GPQA बेंचमार्क के लिए Gemini Pro 1.5 का कोई डेटा उपलब्ध नहीं था।
GPT-4o चार बेंचमार्क में शीर्ष स्कोर हासिल करता है, हालांकि MSGM में इसे Claude 3 Opus और DROP में GPT-4 Turbo पछाड़ देता है। समग्र रूप से, यह प्रदर्शन प्रभावशाली है और मल्टीमॉडल प्रशिक्षण के नए दृष्टिकोण के लिए आशाजनक संकेत देता है।
यदि आप GPT-4o के आँकड़ों को GPT-4 Turbo से बारीकी से तुलना करें, तो आप देखेंगे कि प्रदर्शन में बढ़ोतरी कुछ ही प्रतिशत अंकों की है।
एक साल बाद के लिए यह प्रभावशाली बढ़त है, लेकिन GPT-1 से GPT-2 या GPT-2 से GPT-3 जैसी नाटकीय छलाँगों से बहुत दूर है।
टेक्स्ट पर तर्क करने में साल-दर-साल 10% बेहतर होना शायद नया सामान्य है। आसान लक्ष्य हासिल किए जा चुके हैं और टेक्स्ट रीज़निंग में बड़े उछाल जारी रखना मुश्किल है।
दूसरी ओर, ये LLM बेंचमार्क मल्टीमॉडल समस्याओं पर AI के प्रदर्शन को नहीं पकड़ते। अवधारणा इतनी नई है कि हमारे पास अभी टेक्स्ट, ऑडियो और विज़न में किसी मॉडल की गुणवत्ता मापने के अच्छे तरीके नहीं हैं।
कुल मिलाकर, GPT-4o का प्रदर्शन प्रभावशाली है और यह मल्टीमॉडल प्रशिक्षण के नए दृष्टिकोण के लिए आशा जगाता है।
GPT-4o के उपयोग के मामले क्या हैं?
1. डेटा विश्लेषण और कोडिंग कार्यों के लिए GPT-4o
हालिया GPT मॉडल और उनके डेरिवेटिव, जैसे GitHub Copilot, पहले से ही कोड सहायता देने—कोड लिखने, समझाने और त्रुटियाँ ठीक करने—में सक्षम हैं। GPT-4o की मल्टीमॉडल क्षमताएँ कुछ दिलचस्प संभावनाएँ खोलती हैं।
OpenAI की CTO Mira Murati द्वारा होस्ट किए गए एक प्रमोशनल वीडियो में, दो OpenAI शोधकर्ताओं, Mark Chen और Barret Zoph ने GPT-4o का उपयोग करते हुए कुछ Python कोड पर काम करने का प्रदर्शन किया।
कोड GPT के साथ टेक्स्ट के रूप में साझा किया गया, और वॉइस इंटरैक्शन फ़ीचर का उपयोग करके GPT से कोड समझाने को कहा गया। बाद में, कोड चलाने के बाद, GPT-4o की विज़न क्षमता का उपयोग प्लॉट समझाने के लिए किया गया।
कुल मिलाकर, ChatGPT को अपनी स्क्रीन दिखाना और बोलकर सवाल पूछना—किसी प्लॉट को इमेज फ़ाइल के रूप में सेव करना, उसे ChatGPT पर अपलोड करना, फिर टाइप करके सवाल पूछने—की तुलना में संभवतः सरल वर्कफ़्लो है।
2. रियल-टाइम अनुवाद के लिए GPT-4o
GPT-4o को छुट्टियों पर साथ ले जाने के लिए तैयार हो जाइए। GPT-4o की कम विलंबता वाली स्पीच क्षमताओं का मतलब है कि अब रियल-टाइम अनुवाद संभव है (यदि आपके सेलफ़ोन प्लान में रोमिंग डेटा है!)। यानी ऐसे देशों में यात्रा करना, जहाँ आप भाषा नहीं बोलते, अब कहीं आसान हो गया है।
3. GPT-4o के साथ रोलप्ले
चाहे आप डेटा में अपने स्वप्निल करियर के लिए जॉब इंटरव्यू की तैयारी कर रहे हों या अपनी सेल्स टीम को आपके प्रोडक्ट को बेहतर बेचने के लिए ट्रेन कर रहे हों—ChatGPT पहले से ही रोलप्ले परिदृश्यों के लिए एक उपयोगी टूल रहा है।
अब तक यह टेक्स्ट-केवल रोलप्ले के लिए सबसे अच्छा काम करता था, जो इन उपयोग मामलों के लिए आदर्श नहीं था। बेहतर स्पीच क्षमताओं का मतलब है कि अब बोले गए रोलप्ले भी एक व्यावहारिक विकल्प हैं।
4. दृष्टिबाधित उपयोगकर्ताओं की सहायता के लिए GPT-4o
कैमरा से आने वाले वीडियो इनपुट को समझने और दृश्य का मौखिक वर्णन करने की GPT-4o की क्षमता दृष्टिबाधित लोगों के लिए एक अनिवार्य फ़ीचर हो सकती है। यह मूलतः टीवी पर मौजूद ऑडियो डिस्क्रिप्शन फ़ीचर जैसा है—लेकिन वास्तविक जीवन के लिए।
GPT-4o के साथ हाथों-हाथ
घोषणा के तुरंत बाद से मुझे GPT-4o की कुछ नई सुविधाओं तक पहुंच मिली हुई है (दुर्भाग्य से, अभी वॉइस चैट नहीं), और मैं इसके कई आउटपुट से प्रभावित हुआ हूँ। प्रतिक्रियाएँ तेज़ और अधिक सुसंगत लगती हैं, और यह मेरी रिक्वेस्ट्स को पहले से बेहतर समझता दिखता है। यह कहना नहीं है कि यह त्रुटिहीन रहा है।
यहाँ ChatGPT-4o के साथ मेरी कुछ इंटरैक्शन के उदाहरण हैं:
डेटा विश्लेषण कार्य
सबसे पहले, वॉइस चैट का उपयोग करते हुए, मैंने पूछा कि क्या उसके पास उस सॉकर टीम—Leeds United—के प्रदर्शन का विश्लेषण करने के लिए कोई विचार हैं जिसका मैं समर्थन करता हूँ। कई विकल्प देने के साथ, इसने कुछ उदाहरण Python कोड भी दिया:
import pandas as pd
# Sample data for Leeds United's match results
data = {
'Match': ['Match1', 'Match2', 'Match3', 'Match4', 'Match5'],
'Result': ['Win', 'Draw', 'Loss', 'Win', 'Win'],
'Goals Scored': [2, 1, 0, 3, 2]
}
# Create a DataFrame
df = pd.DataFrame(data)
# Summarize match results
summary = df['Result'].value_counts()
total_goals = df['Goals Scored'].sum()
average_goals = df['Goals Scored'].mean()
# Display summary
print("Match Results Summary:")
print(summary)
print("\nTotal Goals Scored:", total_goals)
print("Average Goals Per Match:", round(average_goals, 2))

हालाँकि, जब मैंने इस विचार-श्रृंखला में अधिक विस्तार से जाँच की, तो बातें थोड़ा बिगड़ गईं। मैंने पहले उपयोग के लिए कुछ वास्तविक डेटा माँगा—इसने वेब खोजकर दो अच्छे स्रोत ढूँढ लिए, लेकिन आँकड़े ग़लत बताए। Leeds ने नियमित सत्र में 46 मैच खेले, 81 गोल किए और +38 का गोल अंतर रहा—जबकि अपने जवाब में इसने 40 मैच खेले होने की बात कही।
फिर मैंने ChatGPT से प्रत्येक टीम के खिलाफ किए गए गोलों का विज़ुअलाइज़ेशन करने को कहा:

फिर से, यहाँ इसने आधा काम किया है। इसने अनुरोध के अनुसार एक विज़ुअलाइज़ेशन बनाया है, जो सतह पर ठीक दिखता है। पर वास्तव में, डेटा का काफी हिस्सा गढ़ा हुआ और गलत है (टीमें दो बार दिख रही हैं, गोल नहीं जोड़े गए, और कुछ टीमें Leeds के समान डिवीज़न में नहीं हैं)।
न्याय की दृष्टि से, मुझे लगता है कि अगर मैंने पूरा डेटासेट खुद उपलब्ध कराया होता, तो प्रदर्शन बेहतर होता, लेकिन मैं चाहता हूँ कि यह ऐसा कहे, बजाय इसके कि आत्मविश्वास से उत्तर गढ़ दे।
इमेज विश्लेषण
इसके बाद, मैंने GPT-4o से मेरे एक पौधे की तस्वीर का विश्लेषण करने के लिए कहा। मुझे अभी एकीकृत विज़न फ़ीचर तक पहुंच नहीं है, इसलिए मुझे तस्वीर लेनी पड़ी और ChatGPT से पूछना पड़ा कि यह कौन सा पौधा है:

यह बुरा प्रयास नहीं है, हालांकि बिल्कुल सटीक नहीं। यह एक बोन्साई पेड़ तो है, पर यह Carmona retusa के बजाय Ilex crenata है। फिर भी, दोनों काफ़ी समान दिखते हैं, इसलिए यह आसान गलती है, और मुझे पौधे की देखभाल पर अतिरिक्त संदर्भ पसंद आया।
इमेज जनरेशन
अंत में, मैं नए मॉडल की इमेज क्षमताओं को आज़माना चाहता था। मैंने पहले अपने कछुए Darwin की एक तस्वीर दिखाई और उससे मेरे दोस्त के बारे में बताने को कहा:

दोबारा, यह क़रीब है पर परफ़ेक्ट नहीं। Darwin वास्तव में Hermann’s नहीं, बल्कि Horsefield कछुआ है, लेकिन वे बहुत मिलते-जुलते दिखते हैं। फिर मैंने ChatGPT-4o से मूल इमेज को Hokusai की शैली में दोबारा बनाने को कहा। यह रहा परिणाम:

काफ़ी अच्छा प्रयास, हालांकि मूल इमेज से बहुत समानता नहीं है—पर यह वाजिब भी है। इसे बनाने में थोड़ा समय भी लगा।
कुल मिलाकर, मैं नए मॉडल की प्रतिक्रियाशीलता और मेरी रिक्वेस्ट्स को समझने की क्षमता से प्रभावित था। यह त्रुटिहीन नहीं है, और कभी-कभी आत्मविश्वास से भ्रम (hallucination) करता है, पर मैं बेहतर स्पीच और एकीकृत विज़न के साथ हाथों-हाथ काम करने का इंतज़ार नहीं कर सकता।
GPT-4o की सीमाएँ और जोखिम
जनरेटिव AI के लिए नियमन अभी शुरुआती चरणों में है; अब तक EU AI Act ही एक उल्लेखनीय क़ानूनी ढाँचा है। इसका मतलब है कि AI बनाने वाली कंपनियों को सुरक्षित AI की परिभाषा पर कुछ निर्णय स्वयं लेने होंगे।
OpenAI के पास एक preparedness framework है जिसका उपयोग वह यह तय करने के लिए करता है कि नया मॉडल जनता के लिए जारी करने योग्य है या नहीं।
यह फ़्रेमवर्क चिंता के चार क्षेत्रों का परीक्षण करता है।
- साइबर सुरक्षा। क्या AI साइबर अपराधियों की उत्पादकता बढ़ा सकता है और एक्सप्लॉइट बनाने में मदद कर सकता है?
- BCRN। क्या AI जैविक, रासायनिक, रेडियोलॉजिकल या नाभिकीय खतरों के निर्माण में विशेषज्ञों की मदद कर सकता है?
- प्रभावित करना (Persuasion)। क्या AI ऐसा (संभावित रूप से इंटरैक्टिव) कंटेंट बना सकता है जो लोगों को अपने विश्वास बदलने के लिए राज़ी करे?
- मॉडल स्वायत्तता। क्या AI एक एजेंट की तरह काम कर सकता है, अन्य सॉफ़्टवेयर के साथ क्रियाएँ कर सकता है?
चिंता के प्रत्येक क्षेत्र को Low, Medium, High, या Critical में ग्रेड दिया जाता है, और मॉडल का स्कोर चारों श्रेणियों में सबसे उच्च ग्रेड होता है।
OpenAI वादा करता है कि वह critical चिंता वाले मॉडल को जारी नहीं करेगा—हालाँकि यह तुलनात्मक रूप से कम सुरक्षा मानक है: उनकी परिभाषाओं के अनुसार, critical चिंता किसी ऐसी चीज़ से मेल खाती है जो मानव सभ्यता को उलट-पुलट दे। GPT-4o आराम से इससे बचता है और Medium चिंता स्कोर करता है।
अपूर्ण आउटपुट
सभी जनरेटिव AI की तरह, मॉडल हमेशा इच्छित तरीके से व्यवहार नहीं करता। कंप्यूटर विज़न परिपूर्ण नहीं है, इसलिए इमेज या वीडियो की व्याख्याएँ सुनिश्चित रूप से काम करें—यह गारंटी नहीं।
इसी तरह, स्पीच ट्रांसक्रिप्शन शायद ही 100% सही हो—खासकर जब वक्ता का उच्चारण भारी हो या तकनीकी शब्दों का उपयोग किया गया हो।
OpenAI ने कुछ आउटटेक्स का वीडियो प्रदान किया है जहाँ GPT-4o इच्छानुसार काम नहीं करता।
विशेष रूप से, दो गैर-अंग्रेज़ी भाषाओं के बीच अनुवाद उन मामलों में से एक था जहाँ यह विफल रहा। अन्य समस्याओं में अनुपयुक्त टोन (पैतृसत्तात्मक/उद्धत होना) और गलत भाषा में बोलना शामिल था।
ऑडियो डीपफेक्स का तेज़ होता जोखिम
OpenAI की घोषणा में उल्लेख है कि "हम मानते हैं कि GPT-4o की ऑडियो मोडेलिटी कई नए प्रकार के जोखिम प्रस्तुत करती है।" कई मायनों में, GPT-4o डीपफेक स्कैम कॉल्स के उभार को तेज़ कर सकता है, जहाँ AI सेलिब्रिटीज़, राजनेताओं, और लोगों के दोस्तों व परिवार की नकल करता है। यह समस्या ठीक होने से पहले और बदतर ही होगी, और GPT-4o के पास डीपफेक स्कैम कॉल्स को और भी विश्वसनीय बनाने की शक्ति है।
इस जोखिम को कम करने के लिए, ऑडियो आउटपुट केवल चयनित प्रीसेट आवाज़ों तक सीमित है।
संभवतः, तकनीकी रूप से सक्षम स्कैमर्स GPT-4o से टेक्स्ट आउटपुट जनरेट कर सकते हैं और फिर अपना खुद का टेक्स्ट-टू-स्पीच मॉडल इस्तेमाल कर सकते हैं, हालांकि यह स्पष्ट नहीं है कि क्या उन्हें तब भी GPT-4o द्वारा प्रदान की जाने वाली विलंबता और टोन-ऑफ-वॉइस के फ़ायदे मिलेंगे।
GPT-4o की रिलीज़ तिथि
19 जुलाई, 2024 तक, GPT-4o की कई सुविधाओं का क्रमिक रोलआउट हो चुका है। टेक्स्ट और इमेज क्षमताएँ कई Plus और फ्री प्लान उपयोगकर्ताओं के लिए जोड़ दी गई हैं। इसमें मोबाइल ब्राउज़र पर एक्सेस किया गया ChatGPT भी शामिल है। इसी तरह, GPT-4o की टेक्स्ट और विज़न सुविधाएँ पहले से ही API के माध्यम से उपलब्ध हैं।
iOS और Android मोबाइल ऐप्स पर GPT-4o की ये सुविधाएँ व्यापक रूप से उपलब्ध हैं। हालाँकि, हम अभी भी नए Voice Mode का इंतज़ार कर रहे हैं, जिसे GPT-4o के साथ अपडेट किया जाएगा; API, GPT-4o के लिए ऑडियो और वीडियो क्षमताएँ जोड़ेगा; और नया मॉडल Mac Desktop पर उपलब्ध होगा। बाद वाले तक पहुंच भी Plus उपयोगकर्ताओं को क्रमिक रूप से दी जा रही है, और Windows डेस्कटॉप एप्लिकेशन इस वर्ष के अंत में आने की योजना है।
नीचे GPT-4o की रिलीज़ तिथियों का सारांश दिया गया है:
- GPT-4o की घोषणा: 13 मई, 2024
- GPT-4o टेक्स्ट और इमेज क्षमताओं का रोलआउट: 13 मई, 2024 से
- फ्री टियर और Plus उपयोगकर्ताओं के लिए GPT-4o उपलब्धता: 13 मई, 2024 से
- GPT-4o के लिए API एक्सेस (टेक्स्ट और विज़न): 13 मई, 2024 से
- Plus उपयोगकर्ताओं के लिए Mac डेस्कटॉप पर GPT-4o की उपलब्धता: आने वाले हफ्तों में (13 मई, 2024 से शुरू)
- GPT-4o के साथ Voice Mode का नया संस्करण (अल्फ़ा): आने वाले हफ्तों/महीनों में (13 मई, 2024 के बाद)
- ऑडियो और वीडियो क्षमताओं के लिए API सपोर्ट: आने वाले हफ्तों/महीनों में (13 मई, 2024 के बाद)
- GPT-4o mini: 18 जुलाई, 2024
हालाँकि, नई वॉइस क्षमताओं के डेमो से उपजी विवाद के बाद, लगता है OpenAI रिलीज़ को लेकर सतर्क है। उनके अपडेटेड ब्लॉग के अनुसार, 'आने वाले हफ्तों और महीनों में, हम अन्य मोडेलिटी जारी करने के लिए ज़रूरी तकनीकी अवसंरचना, पोस्ट-ट्रेनिंग के जरिए उपयोगिता, और सुरक्षा पर काम करेंगे। उदाहरण के लिए, लॉन्च पर, ऑडियो आउटपुट को प्रीसेट आवाज़ों के चयन तक सीमित रखा जाएगा और वे हमारी मौजूदा सेफ़्टी नीतियों का पालन करेंगे।'
GPT-4o की कीमत कितनी है?
GPT-4 Turbo से तेज़ होने और बेहतर विज़न क्षमताओं के बावजूद, GPT-4o अपने पूर्ववर्ती से करीब 50% सस्ता होगा। OpenAI वेबसाइट के अनुसार, मॉडल का उपयोग करने पर इनपुट के लिए प्रति मिलियन टोकन $5 और आउटपुट के लिए प्रति मिलियन टोकन $15 का खर्च आएगा।
मैं ChatGPT के वेब संस्करण में GPT-4o तक कैसे पहुँच सकता/सकती हूँ?
ChatGPT का यूज़र इंटरफ़ेस बदल गया है। ChatGPT में सभी संदेश डिफ़ॉल्ट रूप से GPT-4o का उपयोग करते हैं, और प्रतिक्रिया के नीचे मौजूद टॉगल से मॉडल को GPT-3.5 में बदला जा सकता है।
भविष्य के लिए GPT-4o का क्या अर्थ है?
AI को किस दिशा में जाना चाहिए—इस पर दो मत हैं। एक यह कि AI लगातार अधिक शक्तिशाली हो और अधिक प्रकार के कार्य पूरे कर सके। दूसरा यह कि AI विशेष कार्यों को यथासंभव सस्ते में हल करने में बेहतर हो।
OpenAI का मिशन—artificial general intelligence (AGI) बनाना—और उसका बिज़नेस मॉडल, उसे पहले खेमे में मजबूती से रखता है। GPT-4o उस और भी शक्तिशाली AI की दिशा में एक और क़दम है।
यह OpenAI के लिए पूरी तरह नई मॉडल आर्किटेक्चर की पहली पीढ़ी है। इसका मतलब है कि आने वाले महीनों में कंपनी के पास सीखने और अनुकूलित करने के लिए बहुत कुछ है।
कम अवधि में, नए प्रकार की विचित्रताएँ और भ्रम (hallucinations) देखने की उम्मीद करें; लंबी अवधि में, गति और आउटपुट गुणवत्ता दोनों के लिहाज़ से प्रदर्शन में सुधार की।
GPT-4o का समय दिलचस्प है। जैसे ही टेक दिग्गजों को एहसास हुआ कि Siri, Alexa और Google Assistant वह पैसे कमाने वाले औज़ार नहीं हैं, जिनकी कभी उम्मीद थी, OpenAI AI को फिर से बातूनी बनाने की उम्मीद कर रहा है। सबसे अच्छे परिदृश्य में, यह जनरेटिव AI के लिए उपयोग मामलों की नई खेप लाएगा। कम से कम, अब आप अपनी पसंद की किसी भी भाषा में टाइमर सेट कर सकते हैं।
निष्कर्ष
GPT-4o, टेक्स्ट, ऑडियो और विज़ुअल प्रोसेसिंग को एक कुशल मॉडल में मिलाकर जनरेटिव AI में और प्रगति का प्रतिनिधित्व करता है। यह नवाचार तेज़ प्रतिक्रियाएँ, समृद्ध इंटरैक्शन, और रियल-टाइम अनुवाद से लेकर उन्नत डेटा विश्लेषण और दृष्टिबाधितों के लिए बेहतर पहुँच-योग्यता तक के व्यापक अनुप्रयोगों का वादा करता है।
हालाँकि डीपफेक स्कैम में संभावित दुरुपयोग और और अधिक अनुकूलन की आवश्यकता जैसी शुरुआती सीमाएँ और जोखिम मौजूद हैं, GPT-4o OpenAI के AGI लक्ष्य की ओर एक और क़दम है। जैसे-जैसे यह अधिक सुलभ होगा, GPT-4o हमारे AI के साथ इंटरैक्शन करने के तरीके को बदल सकता है, और रोज़मर्रा तथा पेशेवर कार्यों में समाहित हो सकता है।
कम लागत और उन्नत क्षमताओं के साथ, GPT-4o AI उद्योग में एक नया मानक स्थापित करने की स्थिति में है, और विभिन्न क्षेत्रों के उपयोगकर्ताओं के लिए संभावनाओं का विस्तार करेगा।
AI का भविष्य रोमांचक है—और यह जानना शुरू करने का इससे बेहतर समय नहीं कि यह तकनीक कैसे काम करती है। यदि आप इस क्षेत्र में नए हैं, तो हमारे AI Fundamentals स्किल ट्रैक से शुरुआत करें, जिसमें ChatGPT, लार्ज लैंग्वेज मॉडल्स, जनरेटिव AI व अन्य विषयों पर क्रियाशील ज्ञान शामिल है। आप हमारे हैंड्स-ऑन कोर्स में OpenAI API के साथ काम करना भी सीख सकते हैं, या हमारे AI कोर्सेज़ की पूरी कैटलॉग देखें।
FAQs
क्या GPT-4o बहुभाषी वार्तालाप संभाल सकता है?
हाँ, GPT-4o बहुभाषी वार्तालाप संभाल सकता है, अपनी कम-विलंबता स्पीच क्षमताओं के साथ भाषाओं के बीच रियल-टाइम अनुवाद प्रदान करता है। हालाँकि, डेमो में, अनुवाद प्रोसेसिंग के दौरान कुछ त्रुटियाँ देखी गईं।
क्या GPT-4o सभी भाषाओं का समान रूप से समर्थन करता है?
हालाँकि GPT-4o में गैर-रोमन लिपियों के लिए टोकनाइज़ेशन में सुधार है, प्रदर्शन अलग-अलग भाषाओं में भिन्न हो सकता है—खासकर उन भाषाओं के लिए जिनका प्रशिक्षण डेटा में प्रतिनिधित्व कम है।
GPT-4o ऑडियो इनपुट में बैकग्राउंड शोर को कैसे संभालता है?
GPT-4o ऑडियो इनपुट प्रोसेस करते समय बैकग्राउंड शोर पर भी विचार कर सकता है, जिससे अधिक प्रसंग-सचेत प्रतिक्रियाएँ मिल सकती हैं।
क्या GPT-4o वीडियो कंटेंट जनरेट करने में सक्षम है?
नहीं, GPT-4o वीडियो कंटेंट का विश्लेषण और वर्णन कर सकता है, लेकिन नया वीडियो कंटेंट जनरेट नहीं कर सकता। OpenAI का Sora वह मॉडल है जो वीडियो कंटेंट जनरेट कर सकता है।
क्या GPT-4o विशिष्ट आवाज़ों की नकल कर सकता है?
नहीं, GPT-4o ऑडियो आउटपुट के लिए चयनित प्रीसेट आवाज़ों का उपयोग करता है, ताकि डीपफेक स्कैम जैसे जोखिमों को कम किया जा सके।
GPT-4o में इनपुट किया गया डेटा कितना सुरक्षित है?
OpenAI कड़े सुरक्षा उपायों का पालन करता है, लेकिन उपयोगकर्ताओं को हमेशा सावधान रहना चाहिए और संवेदनशील जानकारी साझा करने से बचना चाहिए।
क्या GPT-4o को मौजूदा एप्लिकेशनों में इंटीग्रेट किया जा सकता है?
हाँ, GPT-4o को OpenAI API के माध्यम से विभिन्न एप्लिकेशनों में एकीकृत किया जा सकता है, जिससे अलग-अलग प्लेटफ़ॉर्म पर उन्नत क्षमताएँ सक्षम होती हैं।
AI-समर्थित एप्लिकेशन विकसित करने की अपनी यात्रा शुरू करने के लिए हमारे OpenAI API कोर्स पर नज़र डालें।
मुझे GPT-4o के बजाय GPT-4o Mini कब उपयोग करना चाहिए?
GPT-4o Mini उन कार्यों के लिए आदर्श है जहाँ जटिल तर्क या मल्टीमॉडल इंटरैक्शन के बजाय गति और दक्षता प्राथमिकता हैं। यह साधारण कोडिंग कार्यों, डीबगिंग, या हल्के-फुल्के एप्लिकेशनों में त्वरित प्रतिक्रियाओं के लिए उपयुक्त है—ऐसे प्रोजेक्ट्स के लिए किफायती विकल्प जो GPT-4o की पूरी शक्ति नहीं मांगते।
GPT-4o और o1 मॉडल में क्या अंतर हैं?
GPT-4o को मल्टीमॉडल कार्यों के लिए डिज़ाइन किया गया है—यह टेक्स्ट, ऑडियो, और विज़ुअल इनपुट को कुशलता से संभालता है। वहीं o1 मॉडल उन्नत तर्क और जटिल समस्या-समाधान पर केंद्रित है, और कोडिंग व विज्ञान जैसे क्षेत्रों में उत्कृष्टता दिखाता है। जहाँ GPT-4o बहुमुखी प्रतिभा और गति प्रदान करता है, o1 मॉडल जटिल तर्क कार्यों के लिए गहन, तार्किक प्रोसेसिंग को प्राथमिकता देता है।