मुख्य सामग्री पर जाएं

रिज़िडुअल प्लॉट समझें: रिग्रेशन मॉडल की मान्यताओं की जाँच कैसे करें

जानें कि रिज़िडुअल प्लॉट क्या है, सामान्य पैटर्नों की व्याख्या कैसे करें, और कैसे रिज़िडुअल प्लॉट गैर-रेखीयता, हेेटेरोस्केडैस्टिसिटी, आउटलायर, और अन्य रिग्रेशन समस्याओं की पहचान में मदद करते हैं।
अद्यतन 10 सित॰ 2026  · 9 मि॰ पढ़ना

AI के साथ खोजें

ChatGPTClaudePerplexity

आपने एक रिग्रेशन मॉडल फिट किया है, R² ठीक-ठाक दिख रहा है, और गुणांक सहज समझ में आते हैं। लेकिन एक आकर्षक सारांश तालिका एक गलत-निर्दिष्ट मॉडल को छिपा सकती है। एक स्कैटर प्लॉट अक्सर वह पकड़ लेता है जो संख्याएँ चूक जाती हैं: रिज़िडुअल प्लॉट।

यह लेख बताता है कि रिज़िडुअल प्लॉट क्या होते हैं, उन्हें कैसे पढ़ें, कौन से पैटर्न जानने योग्य हैं, और Python तथा R दोनों में इन्हें कैसे बनाएँ। अधिकतर शुरुआती पूरी तरह से डायग्नोस्टिक चरण छोड़ देते हैं। अंत तक आते-आते, आप नहीं छोड़ेंगे।

रिज़िडुअल प्लॉट क्या है?

रिज़िडुअल आपके मॉडल के पूर्वानुमान और वास्तव में क्या हुआ उसके बीच का अंतर है: residual = observed − predicted. एक रिज़िडुअल प्लॉट इन अंतरालों को सामने रखता है। x-अक्ष पर या तो पूर्वानुमानित (fitted) मान होते हैं या कोई व्याख्यात्मक चर; y-अक्ष पर रिज़िडुअल होते हैं। शून्य पर एक क्षैतिज संदर्भ रेखा होती है, जो परिपूर्ण पूर्वानुमान का प्रतिनिधित्व करती है।

शून्य के आसपास अनियमित बिखराव: एक स्वस्थ रिज़िडुअल प्लॉट। चित्र: लेखक द्वारा। 

मूल विचार: यदि आपके मॉडल ने संबंध को अच्छी तरह पकड़ा है, तो रिज़िडुअल शोर जैसे दिखने चाहिए। शून्य के आसपास अनियमित रूप से बिखरे हुए, कोई स्पष्ट पैटर्न नहीं। जैसे ही कोई आकृति उभरती है, आपका मॉडल आपको वह बता रहा होता है जो वह केवल गुणांकों के माध्यम से नहीं कह सका।

रिज़िडुअल प्लॉट की व्याख्या कैसे करें

पैटर्न ढूँढ़ें। आदर्श रूप से, कोई स्पष्ट पैटर्न नहीं होना चाहिए। यही पूरा नियम है। रिज़िडुअल्स का स्थान, फैलाव, और आकृति क्या बताती है—यही असल में दिलचस्प हिस्सा है।

स्थान: क्या बिखराव शून्य के केंद्र में है?

यदि कुछ fitted मानों के दायरे में रिज़िडुअल शून्य से ऊपर हैं और अन्य में नीचे, तो मॉडल पक्षपाती है। वह कुछ क्षेत्रों में लगातार अधिक या कम पूर्वानुमान कर रहा है। यह अक्सर किसी छूटे हुए चर या ऐसे गैर-रेखीय संबंध की ओर इशारा करता है जिसे सीधी-रेखा मॉडल नहीं पकड़ पा रहा।

फैलाव: क्या वैरिएंस लगभग स्थिर रहता है?

बाएँ से दाएँ स्कैन करें। यदि सभी fitted मानों पर रिज़िडुअल का फैलाव लगभग समान है, तो यह अच्छा संकेत है। यदि fitted मान बढ़ने पर बिंदु बाहर की ओर फैलते हैं, तो वैरिएंस बदल रहा है। इसे हेटेरोस्केडैस्टिसिटी कहते हैं। यह गुणांक के अनुमानों को नहीं बिगाड़ता, लेकिन मानक त्रुटियों को अविश्वसनीय बना देता है—जो महत्वपूर्ण है यदि आप कोई परिकल्पना परीक्षण कर रहे हैं।

आकृति: क्या कोई वक्र या प्रवृत्ति है?

समतल और बिना पैटर्न का होना वांछनीय है। U-आकृति या मेहराब बताता है कि मॉडल में कोई गैर-रेखीय पद गायब है। समूह या पट्टियां उपसमूहों का संकेत देती हैं जिन्हें मॉडल एक जैसा मान रहा है। कोई एकल बिंदु जो बाकी सब से बहुत दूर बैठा है, जाँच के लायक है।

आम रिज़िडुअल प्लॉट पैटर्न और उनका अर्थ

चार रिज़िडुअल प्लॉट पैटर्न जो मॉडल समस्याएँ संकेत करते हैं। चित्र: लेखक द्वारा।

शून्य के आसपास अनियमित बिखराव

यह अच्छा परिणाम है। शून्य रेखा के ऊपर और नीचे बिंदुओं का लगभग समान वितरण, कोई स्पष्ट रुझान नहीं—आम तौर पर इंगित करता है कि मॉडल ने संबंध को उचित रूप से पकड़ लिया है। कुछ यादृच्छिकता अपेक्षित है।

वक्राकार पैटर्न

वक्र या मेहराबनुमा पैटर्न आमतौर पर किसी अनमॉडल्ड गैर-रेखीय संबंध का संकेत है। मॉडल ऐसे डाटा में सीधी रेखा फिट कर रहा है जो मुड़ता है। समाधान प्रायः किसी बहुपद पद (जैसे x²) को जोड़ना या प्रेडिक्टर पर रूपांतरण लगाना होता है। यह व्यवहार में काफ़ी आम है, विशेषकर जब आवास कीमतों या जैविक वृद्धि जैसी चीज़ों का मॉडलिंग करते हैं।

फनल या पंखा-आकृति

fitted मान बढ़ने पर रिज़िडुअल का फैलना: यह हेेटेरोस्केडैस्टिसिटी है, वैरिएंस स्थिर नहीं है। वित्तीय डाटा में आम, जहाँ पूर्वानुमान त्रुटियाँ स्वाभाविक रूप से परिणाम के परिमाण के साथ बढ़ती हैं। रिस्पॉन्स चर का लॉग रूपांतरण अक्सर अच्छा पहला कदम होता है; weighted least squares एक और विकल्प है।

क्लस्टर या समूह

रिज़िडुअल प्लॉट में स्पष्ट समूह आम तौर पर दर्शाते हैं कि डाटा में उप-जनसंख्याएँ हैं जिनका मॉडल हिसाब नहीं रख रहा। संभवतः कोई श्रेणीगत चर (क्षेत्र, ट्रीटमेंट समूह, उत्पाद प्रकार) मॉडल में होना चाहिए। यदि आपको दो या तीन सघन पट्टियां दिखें, तो यहीं से शुरू करें।

बड़े, अलग-थलग रिज़िडुअल

एक अकेला बिंदु जो बाकी से बहुत दूर बैठा है, ध्यान देने योग्य है। यह वास्तविक आउटलायर, डाटा एंट्री त्रुटि, या असामान्य विशेषताओं वाला प्रेक्षण हो सकता है। इसे स्वतः न हटाएँ। पहले समझें। रखना या हटाना संदर्भ पर निर्भर करता है, सुविधा पर नहीं।

इन प्रत्येक पैटर्न के लिए, रिज़िडुअल प्लॉट लक्षण दिखाता है, निदान नहीं। यह बताता है कि कुछ गड़बड़ है; क्यों है, यह आपको अभी भी निकालना होगा।

रिग्रेशन की कौन-सी मान्यताओं की जाँच रिज़िडुअल प्लॉट से हो सकती है?

पैटर्न ध्यान में रखते हुए, यह स्पष्ट करना उपयोगी है कि कौन-सी रिग्रेशन मान्यताओं का आकलन रिज़िडुअल प्लॉट कर सकता है और कौन-सी का नहीं।

  • रेखीयता: यदि प्रेडिक्टर्स और आउटकम के बीच संबंध वास्तव में रेखीय है, तो fitted मानों के विरुद्ध प्लॉट करने पर रिज़िडुअल में कोई रुझान नहीं होना चाहिए। वक्र या मेहराब सीधे दर्शाता है कि रेखीयता नहीं निभ रही।
  • स्थिर वैरिएंस: फनल पैटर्न ठीक वही है जो हेेटेरोस्केडैस्टिसिटी दिखती है। यदि fitted मानों के साथ फैलाव बढ़ता है, तो समान वैरिएंस का उल्लंघन होता है। residuals-vs-fitted प्लॉट इसे पकड़ने का शायद सबसे आम औज़ार है।
  • स्वतंत्रता: यदि आपके प्रेक्षणों का कोई प्राकृतिक क्रम है (समय, स्थान, विषय समूह), तो आप उस क्रम के विरुद्ध रिज़िडुअल प्लॉट कर पैटर्न देख सकते हैं। समय-क्रमित प्लॉट में ट्रेंडिंग रिज़िडुअल ऑटोकॉरिलेशन का संकेत देते हैं। एक साधारण residuals-vs-fitted प्लॉट यह हमेशा नहीं दिखाएगा; कभी-कभी समर्पित residuals-vs-order प्लॉट चाहिए।
  • आउटलायर और प्रभावशाली प्रेक्षण: बड़े, अलग-थलग रिज़िडुअल वे प्रेक्षण चिन्हित करते हैं जिन्हें मॉडल ने खराब पूर्वानुमानित किया। विशिष्ट रूप से प्रभाव के लिए—ऐसे प्रेक्षण जो रिग्रेशन रेखा को असंगत रूप से खींचते हैं—Residuals vs. Leverage प्लॉट बुनियादी रिज़िडुअल प्लॉट से अधिक सूचनाप्रद है।

एक चीज़ जो रिज़िडुअल प्लॉट विश्वसनीय रूप से नहीं आँक सकता वह है सामान्यता। एक समतल residuals-vs-fitted प्लॉट यह नहीं सिद्ध करता कि त्रुटियाँ सामान्य वितरण का पालन करती हैं। इसके लिए आपको Q-Q प्लॉट चाहिए। यह भ्रम का आम स्रोत है और इसे साफ़ रखना ज़रूरी है।

Python में रिज़िडुअल प्लॉट कैसे बनाएँ

मानक कार्यप्रवाह scikit-learn से मॉडल फिट करता है और रिज़िडुअल निकालता है, फिर matplotlib से उनका विज़ुअलाइज़ेशन करता है। यहाँ हाउसिंग डाटा पर साधारण रेखीय रिग्रेशन का एक संपूर्ण उदाहरण है:

import numpy as np
import matplotlib.pyplot as plt
from sklearn.linear_model import LinearRegression

# Sample data: square footage predicting home price
sqft = np.array([800, 1000, 1200, 1500, 1800, 2000, 2200, 2500, 3000, 3500])
price = np.array([150, 180, 210, 260, 300, 330, 370, 420, 500, 560])

# Reshape for sklearn and fit the model
X = sqft.reshape(-1, 1)
model = LinearRegression()
model.fit(X, price)

# Generate predictions and calculate residuals
predicted = model.predict(X)
residuals = price - predicted

# Plot residuals against fitted values
plt.figure(figsize=(8, 5))
plt.scatter(predicted, residuals, color='steelblue', edgecolors='white', s=80)
plt.axhline(y=0, color='red', linestyle='--', linewidth=1.2)
plt.xlabel('Fitted Values')
plt.ylabel('Residuals')
plt.title('Residual Plot')
plt.tight_layout()
plt.show()

मुख्य पंक्ति है residuals = price - predictedaxhline() कॉल शून्य संदर्भ रेखा जोड़ती है; इसके बिना प्लॉट पढ़ना काफी कठिन हो जाता है। यदि यह आउटपुट लगभग बिना पैटर्न का दिखता है, तो आप ठीक राह पर हैं। ध्यान दें कि उच्च fitted मानों पर रिज़िडुअल बड़े होते जाते हैं। केवल 10 बिंदुओं के साथ सुनिश्चित होना मुश्किल है, लेकिन यह उसी तरह के फैन आकार का संकेत देता है जिसकी हमने पहले चर्चा की।

Python में रिग्रेशन पर और गहराई से देखने के लिए, हमारा Introduction to Regression with statsmodels in Python पाठ्यक्रम मॉडल फिटिंग, मान्यता जाँच और व्याख्या को विस्तार से समझाता है।

R में रिज़िडुअल प्लॉट कैसे बनाएँ

R यह काम बॉक्स से बाहर थोड़ा आसान कर देता है। एक बार जब आपने lm() से मॉडल फिट कर लिया, तो बिल्ट-इन plot() फ़ंक्शन स्वतः एक पूरा डायग्नोस्टिक पैनल बनाता है, जिसमें residuals-vs-fitted प्लॉट शामिल होता है।

# Same housing data in R
sqft <- c(800, 1000, 1200, 1500, 1800, 2000, 2200, 2500, 3000, 3500)
price <- c(150, 180, 210, 260, 300, 330, 370, 420, 500, 560)

# Fit the model and view diagnostics
housing_model <- lm(price ~ sqft)
plot(housing_model, which = 1) # which = 1 gives residuals vs. fitted

आर्गुमेंट which = 1 केवल residuals-vs-fitted प्लॉट दिखाता है। इसे छोड़ दें, और आपको चारों मानक डायग्नोस्टिक प्लॉट मिलेंगे: residuals vs. fitted, Q-Q, scale-location, और residuals vs. leverage। जब आपको जल्दी में पूरी तस्वीर चाहिए, तो यह उपयोगी है। R सबसे चरम तीन बिंदुओं को इंडेक्स द्वारा अंकित भी करता है, जिससे आउटलायर ढूँढ़ने की मशक्कत बचती है।

R में रिग्रेशन का पूरा वॉकथ्रू देखने के लिए, हमारा Introduction to Regression in R पाठ्यक्रम आधार से लेकर मॉडल बिल्डिंग और डायग्नोस्टिक्स को कवर करता है।

रिज़िडुअल प्लॉट बनाम अन्य रिग्रेशन डायग्नोस्टिक प्लॉट

residuals-vs-fitted प्लॉट शुरुआत है, पूरी तस्वीर नहीं। कुछ संबंधित प्लॉट अलग-अलग सवालों का जवाब देते हैं।

रिज़िडुअल प्लॉट बनाम Q-Q प्लॉट

residuals-vs-fitted प्लॉट रेखीयता और स्थिर वैरिएंस की जाँच करता है। Q-Q प्लॉट सामान्यता की जाँच करता है—क्या रिज़िडुअल सामान्य वितरण का पालन करते हैं। ये अलग प्रश्न हैं। साफ़-सुथरा रिज़िडुअल प्लॉट सामान्यता की गारंटी नहीं देता, और Q-Q प्लॉट वैरिएंस के बारे में कुछ नहीं बताता। आम तौर पर दोनों चाहिए।

दो अलग प्लॉट, आपके मॉडल के दो अलग सवाल। चित्र: लेखक द्वारा।

रिज़िडुअल प्लॉट बनाम स्केल-लोकेशन प्लॉट

स्केल-लोकेशन प्लॉट (spread-location भी कहा जाता है) standardized रिज़िडुअल के परिमाण के वर्गमूल को fitted मानों के विरुद्ध प्लॉट करता है। यह हेेटेरोस्केडैस्टिसिटी पकड़ने के लिए बनाया गया है और अक्सर कच्चे रिज़िडुअल प्लॉट की तुलना में फनल पैटर्न को देखना आसान बना देता है, क्योंकि यह रिज़िडुअल के संकेत को हटा देता है और केवल फैलाव पर ध्यान केंद्रित करता है।

रिज़िडुअल प्लॉट बनाम residuals vs. leverage प्लॉट

Leverage मापता है कि किसी प्रेक्षण के प्रेडिक्टर मान कितने असामान्य हैं, यह नहीं कि मॉडल ने उसे कितना खराब पूर्वानुमानित किया। उच्च leverage और बड़ा रिज़िडुअल साथ में संभावित रूप से प्रभावशाली प्रेक्षण होते हैं। residuals-vs-leverage प्लॉट इन संयोजनों की पहचान करता है और अक्सर सबसे समस्याग्रस्त बिंदुओं को नाम से हाइलाइट करता है। यदि आपको आशंका है कि प्रभावशाली प्रेक्षण आपका मॉडल विकृत कर रहे हैं, तो इसे जाँचें।

जब रिज़िडुअल प्लॉट समस्या दिखाए तो क्या करें

रिज़िडुअल प्लॉट एक डायग्नोस्टिक है, निर्णय नहीं। कोई पैटर्न दिखना यह नहीं बताता कि मॉडल बेकार है। आम पैटर्नों के अनुसार अगले कदम इस प्रकार हैं:

  • वक्राकार पैटर्न: किसी बहुपद पद को जोड़ने या प्रेडिक्टर को रूपांतरित करने पर विचार करें। x का लॉग रूपांतरण या x² पद अक्सर चीज़ों को सीधा कर देता है।
  • फनल आकृति: रिस्पॉन्स चर का लॉग या वर्गमूल रूपांतरण आज़माएँ। यदि यह काम न करे, तो weighted least squares शोरयुक्त प्रेक्षणों को कम वज़न देता है।
  • बड़े, अलग-थलग रिज़िडुअल: प्रेक्षण की जाँच करें। पहले डाटा एंट्री त्रुटियों की जाँच करें। यदि बिंदु वैध है, तो देखें कि आपका मॉडल उस असामान्यता का हिसाब रखने की ज़रूरत तो नहीं।
  • क्लस्टर या समूह: किसी ऐसे श्रेणीगत चर को खोजें जिसे आपने शामिल नहीं किया है। कभी-कभी अलग-अलग उपसमूहों के लिए अलग मॉडल सही उत्तर होते हैं।

रिज़िडुअल प्लॉट लक्षण दिखाता है। यह आपको सटीक कारण नहीं बताता, और एक ही पैटर्न के कई स्पष्टीकरण हो सकते हैं। इसे बेहतर सवाल पूछने के संकेत के रूप में उपयोग करें।

रिज़िडुअल प्लॉट पढ़ते समय आम गलतियाँ

  • बिल्कुल यादृच्छिक प्लॉट की अपेक्षा: वास्तविक डाटा गंदा होता है। कुछ अनुपालन न करने वाले बिंदु, हल्की विषमता, छोरों पर कुछ क्लस्टरिंग—यह सामान्य है। सवाल यह नहीं कि प्लॉट पूर्णतः यादृच्छिक है या नहीं; सवाल यह है कि क्या कोई तंत्रबद्ध पैटर्न है जिसे बेहतर मॉडल हटा देगा।
  • हर आउटलायर को खराब डाटा मान लेना: बड़ा रिज़िडुअल मतलब मॉडल ने उस प्रेक्षण का खराब अनुमान लगाया—यह नहीं कि प्रेक्षण गलत है। कभी-कभी आउटलायर डेटासेट का सबसे दिलचस्प बिंदु होता है। तभी हटाएँ जब आप समझ लें कि वह क्या है।
  • मान लेना कि रिज़िडुअल प्लॉट सामान्यता सिद्ध करता है: ऐसा नहीं है। साफ़ residuals-vs-fitted प्लॉट रेखीयता और स्थिर वैरिएंस के बारे में बताता है। सामान्यता के लिए Q-Q प्लॉट चाहिए। ये दोनों डायग्नोस्टिक्स परस्पर पूरक हैं, अदला-बदली योग्य नहीं।
  • संदर्भ पर विचार किए बिना प्लॉट देखना: टाइम सीरीज़ मॉडल का रिज़िडुअल प्लॉट क्रॉस-सेक्शनल डेटासेट से अलग तरह से पढ़ना होता है। कौन-सा पैटर्न चिंता का विषय है यह डाटा संरचना, नमूना आकार, और मॉडल के उपयोग पर निर्भर करता है। कोई पैटर्न जो फोरकास्टिंग मॉडल में ठीक करने लायक है, वह अन्वेषणात्मक विश्लेषण में नज़रअंदाज़ किया जा सकता है।

निष्कर्ष

मॉडल फिट करें, सारांश जाँचें, R² पर अच्छा महसूस करें: अधिकतर लोग यहीं रुकते हैं। इसके बाद आपको रिज़िडुअल प्लॉट देखना चाहिए—और यह अक्सर अलग कहानी कहता है। शून्य के आसपास यादृच्छिक बिखराव वांछनीय है। वक्र, फनल, क्लस्टर, और चरम, अलग-थलग बिंदु—प्रत्येक किसी ऐसी चीज़ की ओर इशारा करता है जिसका मॉडल ने हिसाब नहीं रखा।

कोई एकल प्लॉट पूरी तस्वीर नहीं देता। सामान्यता के लिए Q-Q प्लॉट, वैरिएंस के लिए स्केल-लोकेशन प्लॉट, और यदि प्रभावशाली प्रेक्षण चिंता हैं तो leverage प्लॉट को residuals-vs-fitted प्लॉट के साथ जोड़ें। हर एक अलग सवाल का जवाब देता है।

यदि आप आगे बढ़ना चाहते हैं, हमारा Intermediate Regression with statsmodels in Python पाठ्यक्रम मान्यता जाँच को गहराई से कवर करता है, जिसमें यह भी शामिल है कि डायग्नोस्टिक्स समस्या दिखाएँ तो कैसे प्रतिक्रिया दें। रिग्रेशन मान्यताओं और मॉडल मूल्यांकन की व्यापक समझ के लिए हमारा Assumptions of Linear Regression in Python ट्यूटोरियल अगला स्वाभाविक पाठ है।


Vinod Chugani's photo
Author
Vinod Chugani
LinkedIn

विनोद चुगानी ने टोक्यो में जेपीमॉर्गन के सबसे कम उम्र के हेज फंड सेल्स डेस्क हेड के रूप में अपना करियर शुरू किया और बाद में लेहमन ब्रदर्स में व्यक्तिगत बिक्री का रिकॉर्ड बनाया, फिर 30 देशों में फैला एक इलेक्ट्रॉनिक्स डिस्ट्रीब्यूशन व्यवसाय बनाया, जिसकी आय SG$100 मिलियन से आगे बढ़ी, इसके बाद उन्होंने डेटा की ओर रुख किया। ड्यूक में अर्थशास्त्र के स्नातक और NYC डेटा साइंस अकादमी के पूर्व छात्र, वे मेवन पर ह्यूगो बोव्न-एंडरसन के Building AI Applications कोर्स के लिए 100+ आवेदनों में से तीन छात्रवृत्ति प्राप्तकर्ताओं में से एक थे। आज, वे DataCamp, KDnuggets, Machine Learning Mastery, और Statology के लिए सांख्यिकी से लेकर एजेंटिक एआई तक के विषयों पर लिखते हैं, और NYC डेटा साइंस अकादमी में डेटा प्रोफेशनलों को मेंटर करते हैं, उनके नाम पर 1,000 से अधिक एक-से-एक सत्र हैं।

 

FAQs

जब रिज़िडुअल प्लॉट वक्राकार पैटर्न दिखाए तो इसका क्या अर्थ है?

वक्र या मेहराबनुमा पैटर्न आम तौर पर आपके प्रेडिक्टर और आउटकम के बीच गैर-रेखीय संबंध को इंगित करता है जिसे मॉडल ने नहीं पकड़ा। क्योंकि रेखीय रिग्रेशन सीधी रेखा फिट करता है, वास्तविक संबंध में किसी भी मोड़ का असर रिज़िडुअल में तंत्रबद्ध वक्र के रूप में दिखता है। सामान्य समाधान किसी बहुपद पद (जैसे x²) को जोड़ना या प्रेडिक्टर चर पर लॉग या वर्गमूल रूपांतरण लगाना है।

सामान्य डेटासेट में कितने रिज़िडुअल आउटलायर जैसे दिखने चाहिए?

अच्छी तरह फिटिंग वाले मॉडल में, जहाँ त्रुटियाँ सामान्य रूप से वितरित हैं, केवल संयोगवश लगभग 5% standardized रिज़िडुअल ±2 के बाहर और 0.3% से भी कम ±3 के बाहर होंगे—इसलिए कुछ चरम बिंदु अपेक्षित हैं और अपने-आप समस्या नहीं हैं। आपको देखना यह है कि क्या वे बिंदु कोई पैटर्न बनाते हैं, या कोई एक बिंदु इतना असामान्य रिज़िडुअल दिखाता है कि संभावित डाटा समस्या की जाँच बनती है।

क्या मैं सभी रिग्रेशन मान्यताओं की जाँच के लिए रिज़िडुअल प्लॉट का उपयोग कर सकता/सकती हूँ?

नहीं—और यही अक्सर भ्रम का कारण है। residuals-vs-fitted प्लॉट रेखीयता, स्थिर वैरिएंस, और यदि आप प्रेक्षण क्रम में रिज़िडुअल प्लॉट करें तो संभावित स्वतंत्रता की जाँच में मदद करता है। यह सामान्यता का विश्वसनीय आकलन नहीं कर सकता; उसके लिए आपको Q-Q प्लॉट चाहिए। प्रभावशाली प्रेक्षणों के लिए residuals-vs-leverage प्लॉट अधिक सूचनाप्रद है। रिज़िडुअल प्लॉट को पहला डायग्नोस्टिक समझें, अकेला नहीं।

रिज़िडुअल प्लॉट और स्केल-लोकेशन प्लॉट में क्या अंतर है?

दोनों वैरिएंस का आकलन करते हैं, लेकिन अलग तरीके से। रिज़िडुअल प्लॉट कच्चे रिज़िडुअल (धनात्मक और ऋणात्मक) को fitted मानों के विरुद्ध दिखाता है—समग्र पैटर्न, जिनमें वक्र और क्लस्टर शामिल हैं, पकड़ने में उपयोगी। स्केल-लोकेशन प्लॉट standardized रिज़िडुअल (सभी धनात्मक) के परिमाण के वर्गमूल को fitted मानों के विरुद्ध दिखाता है, जिससे हेेटेरोस्केडैस्टिसिटी अलग करना आसान हो जाता है। यदि फनल पैटर्न सूक्ष्म हो, तो स्केल-लोकेशन प्लॉट अक्सर उसे स्पष्ट कर देता है।

यदि रिज़िडुअल प्लॉट बड़े, अलग-थलग रिज़िडुअल दिखाए तो क्या मुझे आउटलायर हटा देने चाहिए?

ज़रूरी नहीं। बड़ा रिज़िडुअल का अर्थ है कि मॉडल ने उस प्रेक्षण का खराब पूर्वानुमान किया—यह नहीं कि प्रेक्षण गलत है। कुछ भी हटाने से पहले देखें कि बिंदु डाटा एंट्री त्रुटि है, असामान्य लेकिन वैध मामला है, या मॉडल के दायरे से बाहर कुछ है। केवल रिज़िडुअल प्लॉट सुधारने के लिए वैध डाटा हटाना मॉडल में हेरफेर है। यदि प्रेक्षण वैध है, तो अधिक ईमानदार तरीका यह है कि मॉडल की सीमाओं को स्वीकार करें या अलग मॉडल संरचना की जाँच करें।

रिज़िडुअल प्लॉट में हेेटेरोस्केडैस्टिसिटी वास्तव में किसे प्रभावित करती है?

फनल या पंखा पैटर्न आपके गुणांक अनुमानों को पक्षपाती नहीं करता—मॉडल अब भी औसत प्रभाव सही देता है। जो टूटता है वह है आपकी मानक त्रुटियों की विश्वसनीयता, और इसलिए p-मूल्य तथा विश्वसनीयता अंतराल। यदि आप केवल पूर्वानुमान के लिए रिग्रेशन का उपयोग कर रहे हैं, तो इसका महत्व कम हो सकता है। यदि आप परिकल्पना परीक्षण कर रहे हैं या विश्वसनीयता अंतराल बना रहे हैं, तो आपको या तो रिस्पॉन्स चर को रूपांतरित करना होगा या असमान वैरिएंस के लिए मानक त्रुटि सुधारों का उपयोग करना होगा।

क्या बहुविकली रिग्रेशन मॉडलों के लिए भी रिज़िडुअल प्लॉट उतने ही उपयोगी हैं जितने सरल रिग्रेशन के लिए?

हाँ, और तर्कसंगत रूप से ये बहुविकली रिग्रेशन में अधिक महत्वपूर्ण हैं क्योंकि मॉडल के गलत होने के और तरीके होते हैं। मानक तरीका है कि समग्र दृश्य के लिए रिज़िडुअल को fitted मानों के विरुद्ध प्लॉट करें, फिर प्रत्येक प्रेडिक्टर के विरुद्ध अलग से—ऐसी गैर-रेखीयताओं की जाँच हेतु जिन्हें मॉडल छोड़ सकता है। व्याख्या के नियम वही हैं: पैटर्न ढूँढ़ें और किसी भी तंत्रबद्ध चीज़ की जाँच करें।

टाइम सीरीज़ बनाम क्रॉस-सेक्शनल रिग्रेशन में रिज़िडुअल प्लॉट कैसे भिन्न होते हैं?

क्रॉस-सेक्शनल रिग्रेशन में, आप residuals-vs-fitted प्लॉट में स्थानिक पैटर्न—वक्र, फनल, क्लस्टर—ढूँढ़ते हैं। टाइम सीरीज़ रिग्रेशन में, आपको यह भी जाँचना होता है कि क्या रिज़िडुअल समय के साथ सहसंबद्ध हैं, क्योंकि ऑटोकॉरिलेशन स्वतंत्रता मान्यता का उल्लंघन करता है और मानक त्रुटियों को अविश्वसनीय बनाता है। रिज़िडुअल को समय इंडेक्स के विरुद्ध प्लॉट करें और ट्रेंड या दोलनकारी पैटर्न देखें; Durbin-Watson सांख्यिकीय भी प्रथम-क्रम ऑटोकॉरिलेशन की जाँच कर सकता है। साधारण residuals-vs-fitted प्लॉट यह स्वयं नहीं पकड़ पाएगा।

विषय
डेटा विश्लेषण
डेटा साइंस

DataCamp के साथ सीखें

course

Statistical Thinking के केस स्टडीज़

4 घंटा
16.2K
वास्तविक डेटा सेट्स पर अपनी सांख्यिकीय सोच कौशल लागू करते हुए महारत की ओर महत्वपूर्ण कदम बढ़ाएँ और उनसे कार्रवाई योग्य अंतर्दृष्टियाँ निकालें।
विस्तृत जानकारी देखेंRight Arrow
कोर्स शुरू करें

course

Statistics परिचय

4 घंटा
159K
सांख्यिकी की बुनियादी बातें सीखें, जिसमें केंद्र और प्रसार के माप, प्रायिकता वितरण, और परिकल्पना परीक्षण शामिल हैं—बिना किसी कोडिंग के!
और देखेंRight Arrow