Sari la conținutul principal

Diagramele reziduurilor explicate: cum verifici ipotezele modelului de regresie

Află ce este o diagramă a reziduurilor, cum interpretezi tiparele frecvente și cum diagramele reziduurilor te ajută să identifici neliniaritatea, eteroscedasticitatea, outlierii și alte probleme de regresie.
Actualizat 10 sept. 2026  · 9 min. citire

Explorează cu AI

ChatGPTClaudePerplexity

Ai ajustat un model de regresie, R² arată bine, iar coeficienții au sens intuitiv. Dar un tabel de sumar atrăgător poate ascunde un model specificat greșit. Un singur scatter plot prinde adesea ce scapă din numere: diagrama reziduurilor.

Acest articol explică ce sunt diagramele reziduurilor, cum să le citești, tiparele care merită cunoscute și cum să creezi una atât în Python, cât și în R. Majoritatea începătorilor sar complet peste pasul de diagnostic. La final, tu nu vei mai face asta.

Ce este o diagramă a reziduurilor?

Un reziduu este diferența dintre ce a prezis modelul tău și ce s-a întâmplat de fapt: reziduu = observat − prezis. O diagramă a reziduurilor pune acele diferențe în evidență. Axa x arată fie valorile prezise (ajustate), fie o variabilă explicativă; axa y arată reziduurile. O linie de referință orizontală se află la zero, reprezentând predicția perfectă.

Puncte împrăștiate aleatoriu în jurul lui zero: o diagramă a reziduurilor sănătoasă. Imagine de autor. 

Ideea centrală: dacă modelul tău a surprins bine relația, reziduurile ar trebui să arate ca zgomot. Împrăștiate aleatoriu în jurul lui zero, fără un tipar evident. În momentul în care apare o formă, modelul îți spune ceva ce nu putea exprima doar prin coeficienți.

Cum interpretezi o diagramă a reziduurilor

Caută tipare. Ideal, nu ar trebui să existe unul evident. Asta e toată regula. Ce dezvăluie poziția, răspândirea și forma reziduurilor devine partea interesantă.

Poziție: este împrăștierea centrată pe zero?

Reziduurile care stau deasupra lui zero în unele regiuni ale valorilor ajustate și dedesubt în altele înseamnă că modelul este părtinitor. Supraprevede sau subprevede constant în anumite regiuni. Asta indică adesea o variabilă lipsă sau o relație neliniară pe care un model în linie dreaptă nu o poate surprinde.

Răspândire: rămâne varianța aproximativ constantă?

Scanează de la stânga la dreapta. Dacă răspândirea reziduurilor este aproximativ aceeași peste toate valorile ajustate, e un semn bun. Dacă punctele se evazează pe măsură ce valorile ajustate cresc, varianța se schimbă. Asta se numește eteroscedasticitate. Nu strică estimările coeficienților, dar face erorile standard nesigure, ceea ce contează dacă faci testarea ipotezelor.

Formă: există o curbă sau o tendință?

Plat și fără tipar este ce îți dorești. O formă de U sau de arc spune că modelului îi lipsește un termen neliniar. Clustere sau benzi sugerează subgrupuri pe care modelul le tratează ca un singur grup. Un singur punct aflat departe de restul merită investigat.

Tipare frecvente în diagramele reziduurilor și ce înseamnă

Patru tipare în diagramele reziduurilor care semnalează probleme ale modelului. Imagine de autor.

Împrăștiere aleatorie în jurul lui zero

Rezultatul bun. Puncte distribuite aproximativ uniform deasupra și dedesubtul liniei zero, fără tendință vizibilă, indică în general că modelul surprinde relația rezonabil de bine. Un pic de aleatoriu este de așteptat.

Tipar curbat

Un tipar curbat sau în formă de arc indică de obicei o relație neliniară nemodelată. Modelul potrivește o linie dreaptă prin date care se curbează. De obicei, soluția este să adaugi un termen polinomial (cum ar fi x²) sau să aplici o transformare predictorului. Este unul dintre cele mai comune tipare în practică, mai ales când modelezi lucruri precum prețuri ale locuințelor sau creștere biologică.

Formă de pâlnie sau evantai

Reziduurile se lărgesc pe măsură ce valorile ajustate cresc: asta e eteroscedasticitate, varianța nu e constantă. Comună în date financiare, unde erorile de predicție cresc natural odată cu magnitudinea rezultatului. O transformare log a variabilei răspuns este adesea un prim pas rezonabil; cea mai mică pătratelor ponderată este o altă opțiune.

Clustere sau grupuri

Grupuri distincte în diagrama reziduurilor înseamnă de obicei că datele conțin subpopulații pe care modelul nu le ia în calcul. Probabil există o variabilă categorială (regiune, grup de tratament, tip de produs) care ar trebui inclusă în model. Dacă vezi două sau trei benzi strânse de puncte, începe de acolo.

Reziduuri izolate mari

Un singur punct aflat departe de rest merită o privire. Poate fi un outlier autentic, o eroare de introducere a datelor sau o observație cu caracteristici neobișnuite. Nu-l șterge automat. Înțelege-l mai întâi. Dacă îl păstrezi sau îl elimini depinde de context, nu de comoditate.

Pentru fiecare dintre aceste tipare, diagrama reziduurilor identifică un simptom, nu un diagnostic. Îți spune că ceva e în neregulă; tot tu trebuie să afli de ce.

Ce ipoteze de regresie pot verifica diagramele reziduurilor?

Cu tiparele în minte, merită să fim clari în privința ipotezelor de regresie pe care o diagramă a reziduurilor le poate și nu le poate evalua.

  • Liniaritate: Dacă relația dintre predictori și rezultat este cu adevărat liniară, reziduurile nu ar trebui să arate o tendință când sunt reprezentate față de valorile ajustate. O curbă sau un arc este un semn vizual direct că liniaritatea nu se menține.
  • Varianță constantă: Tiparul de pâlnie este exact cum arată eteroscedasticitatea. Dacă răspândirea crește odată cu valorile ajustate, egalitatea varianței este încălcată. Diagrama reziduuri vs. ajustate este probabil cel mai comun instrument pentru a depista asta.
  • Independență: Dacă observațiile tale au o ordine naturală (timp, spațiu, clustere pe subiecți) poți reprezenta reziduurile în funcție de acea ordine pentru a căuta tipare. Reziduurile care tind într-un plot ordonat temporal sugerează autocorelație. O simplă diagramă reziduuri vs. ajustate nu va dezvălui mereu asta; uneori ai nevoie de o diagramă reziduuri vs. ordine dedicată.
  • Outlieri și observații influente: Reziduurile izolate mari semnalează observații pe care modelul le prezice prost. Pentru influență în mod specific, observațiile care trag disproporționat linia de regresie, diagrama Reziduuri vs. Levier este mai informativă decât diagrama de bază a reziduurilor.

Un lucru pe care diagramele reziduurilor nu îl pot evalua în mod fiabil este normalitatea. O diagramă plată reziduuri vs. ajustate nu confirmă că erorile sunt distribuite normal. Pentru asta, ai nevoie de un Q-Q plot. Aceasta este o sursă comună de confuzie și merită reținută.

Cum creezi o diagramă a reziduurilor în Python

Fluxul standard folosește scikit-learn pentru a ajusta modelul și a calcula reziduurile, apoi matplotlib pentru a le vizualiza. Iată un exemplu complet folosind regresie liniară simplă pe date imobiliare:

import numpy as np
import matplotlib.pyplot as plt
from sklearn.linear_model import LinearRegression

# Sample data: square footage predicting home price
sqft = np.array([800, 1000, 1200, 1500, 1800, 2000, 2200, 2500, 3000, 3500])
price = np.array([150, 180, 210, 260, 300, 330, 370, 420, 500, 560])

# Reshape for sklearn and fit the model
X = sqft.reshape(-1, 1)
model = LinearRegression()
model.fit(X, price)

# Generate predictions and calculate residuals
predicted = model.predict(X)
residuals = price - predicted

# Plot residuals against fitted values
plt.figure(figsize=(8, 5))
plt.scatter(predicted, residuals, color='steelblue', edgecolors='white', s=80)
plt.axhline(y=0, color='red', linestyle='--', linewidth=1.2)
plt.xlabel('Fitted Values')
plt.ylabel('Residuals')
plt.title('Residual Plot')
plt.tight_layout()
plt.show()

Linia cheie este residuals = price - predicted. Apelul axhline() adaugă linia de referință la zero; fără ea, diagrama e mult mai greu de citit. Dacă rezultatul arată aproximativ fără tipar, ești într-o formă rezonabilă. Observă că reziduurile devin mai mari la valori ajustate mai ridicate. Cu doar 10 puncte e greu de spus sigur, dar asta sugerează acel tipar de evantai despre care am vorbit mai devreme.

Pentru o privire mai profundă asupra regresiei în Python, cursul nostru Introduction to Regression with statsmodels in Python parcurge în detaliu ajustarea modelelor, verificarea ipotezelor și interpretarea.

Cum creezi o diagramă a reziduurilor în R

R face asta puțin mai ușor implicit. După ce ai ajustat un model cu lm(), funcția încorporată plot() produce automat un panou de diagnostic complet, inclusiv o diagramă reziduuri vs. ajustate.

# Same housing data in R
sqft <- c(800, 1000, 1200, 1500, 1800, 2000, 2200, 2500, 3000, 3500)
price <- c(150, 180, 210, 260, 300, 330, 370, 420, 500, 560)

# Fit the model and view diagnostics
housing_model <- lm(price ~ sqft)
plot(housing_model, which = 1) # which = 1 gives residuals vs. fitted

Argumentul which = 1 extrage doar diagrama reziduuri vs. ajustate. Dacă îl lași deoparte, primești toate cele patru diagrame standard de diagnostic: reziduuri vs. ajustate, Q-Q, scară-locație și reziduuri vs. levier. Utile când vrei rapid o imagine completă. R mai și adnotează cele trei puncte cele mai extreme după index, ceea ce te scutește să cauți manual outlierii.

Pentru un ghid complet al regresiei în R, cursul nostru Introduction to Regression in R acoperă de la zero construirea modelelor și diagnosticele.

Diagramele reziduurilor vs. alte diagrame de diagnostic în regresie

Diagrama reziduuri vs. ajustate este punctul de plecare, nu imaginea completă. Câteva diagrame înrudite răspund la întrebări diferite.

Diagrama reziduurilor vs. Q-Q plot

Diagrama reziduuri vs. ajustate verifică liniaritatea și varianța constantă. Q-Q plot-ul verifică normalitatea, adică dacă reziduurile urmează o distribuție normală. Sunt întrebări separate. O diagramă a reziduurilor care arată curat nu garantează normalitatea, iar un Q-Q plot nu îți spune nimic despre varianță. De obicei, ai nevoie de ambele.

Două diagrame diferite, două întrebări diferite despre modelul tău. Imagine de autor.

Diagrama reziduurilor vs. diagrama scară-locație

Diagrama scară-locație (numită și spread-location) reprezintă rădăcina pătrată a reziduurilor standardizate în valoare absolută în funcție de valorile ajustate. Este concepută pentru a detecta eteroscedasticitatea și adesea face tiparul de pâlnie mai ușor de observat decât diagrama brută a reziduurilor, deoarece elimină semnul reziduurilor și se concentrează integral pe răspândire.

Diagrama reziduurilor vs. diagrama reziduuri vs. levier

Levierul măsoară cât de neobișnuite sunt valorile predictorilor unei observații, nu cât de prost o prezice modelul. Levier mare combinat cu un reziduu mare este o observație potențial influentă. Diagrama reziduuri vs. levier identifică aceste combinații și de obicei evidențiază cele mai problematice puncte după nume. Dacă te îngrijorează observațiile influente care îți distorsionează modelul, verifică aceasta.

Ce faci când o diagramă a reziduurilor arată o problemă

O diagramă a reziduurilor este un diagnostic, nu un verdict. A vedea un tipar nu înseamnă că modelul este inutil. Iată cum se mapează tiparele comune la pașii următori:

  • Tipar curbat: Ia în considerare adăugarea unui termen polinomial sau transformarea unui predictor. O transformare log a lui x sau un termen x² adesea îndreaptă lucrurile.
  • Formă de pâlnie: Încearcă o transformare log sau rădăcină pătrată a variabilei răspuns. Dacă nu funcționează, cea mai mică pătratelor ponderată acordă mai puțină influență observațiilor mai zgomotoase.
  • Reziduuri izolate mari: Investighează observația. Verifică mai întâi erorile de introducere a datelor. Dacă punctul este legitim, gândește-te dacă modelul tău trebuie să țină cont de ceea ce îl face neobișnuit.
  • Clustere sau grupuri: Caută o variabilă categorială pe care nu ai inclus-o. Modelele separate pe subgrupuri sunt uneori răspunsul corect.

Diagrama reziduurilor arată simptome. Nu îți spune cauza exactă, iar un singur tipar poate avea uneori explicații multiple. Folosește-o ca un îndemn să pui întrebări mai bune.

Greșeli frecvente când citești diagramele reziduurilor

  • Așteptarea unei diagrame perfect aleatorii: Datele reale sunt dezordonate. Câteva puncte neconforme, asimetrie minoră, un pic de aglomerare la extreme: asta e normal. Întrebarea nu este dacă diagrama este perfect aleatorie; ci dacă există un tipar sistematic pe care un model mai bun l-ar elimina.
  • A trata fiecare outlier ca date rele: Un reziduu mare înseamnă că modelul a prezis prost acea observație. Nu înseamnă că observația este greșită. Uneori outlierul este cel mai interesant punct din setul de date. Șterge-l doar după ce înțelegi ce este.
  • Presupunerea că o diagramă a reziduurilor dovedește normalitatea: Nu o face. O diagramă curată reziduuri vs. ajustate îți spune despre liniaritate și varianță constantă. Normalitatea cere un Q-Q plot. Aceste două diagnostice sunt complementare, nu interschimbabile.
  • A privi diagrama fără a lua în calcul contextul: O diagramă a reziduurilor dintr-un model de serii temporale trebuie citită diferit față de una dintr-un set de date în secțiune transversală. Ce contează ca tipar îngrijorător depinde de structura datelor, dimensiunea eșantionului și de scopul modelului. Un tipar care merită corectat într-un model de prognoză poate fi ignorabil într-o analiză exploratorie.

Concluzie

Ajustează un model, verifică sumarul, simte-te bine cu R²: aici se opresc majoritatea oamenilor. Diagrama reziduurilor este ceea ce te uiți după aceea și spune frecvent o altă poveste. Împrăștiere aleatorie în jurul lui zero este ce vrei. Curbe, pâlnii, clustere și puncte extreme, izolate sugerează fiecare câte ceva ce modelul nu a luat în calcul.

Nicio diagramă singură nu îți oferă imaginea completă. Asociază diagrama reziduuri vs. ajustate cu un Q-Q plot pentru normalitate, o diagramă scară-locație pentru varianță și o diagramă de levier dacă te îngrijorează observațiile influente. Fiecare răspunde la o întrebare diferită.

Dacă vrei să mergi mai departe, cursul nostru Intermediate Regression with statsmodels in Python acoperă în profunzime verificarea ipotezelor, inclusiv cum să reacționezi când diagnosticele semnalează o problemă. Pentru o bază mai largă în ipotezele regresiei și evaluarea modelelor, tutorialul nostru Assumptions of Linear Regression in Python este o lectură firească următoare.


Vinod Chugani's photo
Author
Vinod Chugani
LinkedIn

Vinod Chugani și-a început cariera la Tokyo ca cel mai tânăr șef al desk-ului de vânzări pentru fonduri speculative al JPMorgan, iar ulterior a stabilit un record individual de vânzări la Lehman Brothers, apoi a construit o afacere de distribuție de electronice în 30 de țări care a depășit SG$100 de milioane în venituri, înainte de a se orienta către date. Absolvent de Economie la Duke și alumn al NYC Data Science Academy, a fost unul dintre cei trei beneficiari ai bursei din peste 100 de candidați pentru cursul lui Hugo Bowne-Anderson, Building AI Applications, pe Maven. Astăzi, scrie pentru DataCamp, KDnuggets, Machine Learning Mastery și Statology despre subiecte de la statistică la IA agențială și îndrumă profesioniști în domeniul datelor la NYC Data Science Academy, cu peste 1.000 de sesiuni unu-la-unu la activ.

 

Întrebări frecvente

Ce înseamnă când o diagramă a reziduurilor arată un tipar curbat?

Un tipar curbat sau în formă de arc indică de obicei o relație neliniară între predictor și rezultat pe care modelul nu a surprins-o. Deoarece regresia liniară potrivește o linie dreaptă, orice curbură în relația reală apare ca o curbă sistematică în reziduuri. Soluția obișnuită este să adaugi un termen polinomial (cum ar fi x²) sau să aplici o transformare log sau rădăcină pătrată variabilei predictor.

Câte reziduuri ar trebui să mă aștept să arate ca outlieri într-un set de date normal?

Într-un model bine ajustat, cu erori distribuite normal, aproximativ 5% dintre reziduurile standardizate vor cădea în afara intervalului ±2 și mai puțin de 0,3% în afara ±3 doar din întâmplare — deci câteva puncte extreme sunt de așteptat și nu reprezintă automat o problemă. Ce trebuie să urmărești este dacă acele puncte formează un tipar sau dacă un singur punct are un reziduu suficient de neobișnuit încât să sugereze o problemă de date care merită investigată.

Pot folosi o diagramă a reziduurilor pentru a verifica toate ipotezele regresiei?

Nu — și aceasta este o sursă comună de confuzie. O diagramă reziduuri vs. ajustate ajută la verificarea liniarității, a varianței constante și potențial a independenței dacă reprezinți reziduurile în ordinea observațiilor. Nu poate evalua în mod fiabil normalitatea; pentru asta, ai nevoie de un Q-Q plot. Pentru observații influente, o diagramă reziduuri vs. levier este mai informativă. Gândește-te la diagrama reziduurilor ca la primul diagnostic, nu la singurul.

Care este diferența dintre o diagramă a reziduurilor și o diagramă scară-locație?

Ambele evaluează varianța, dar diferit. O diagramă a reziduurilor arată reziduuri brute (pozitive și negative) în funcție de valorile ajustate — utilă pentru a depista tipare generale, inclusiv curbe și clustere. O diagramă scară-locație arată rădăcina pătrată a reziduurilor standardizate (toate pozitive) în funcție de valorile ajustate, făcând-o mai bună pentru izolarea eteroscedasticității. Dacă forma de pâlnie este subtilă, diagrama scară-locație adesea o face mai ușor de văzut.

Ar trebui să elimin outlierii dacă diagrama reziduurilor arată reziduuri izolate mari?

Nu automat. Un reziduu mare înseamnă că modelul a prezis prost acea observație — nu că observația este incorectă. Înainte de a elimina ceva, verifică dacă punctul este o eroare de introducere a datelor, un caz neobișnuit dar legitim sau ceva în afara domeniului modelului. Eliminarea datelor valide pentru a îmbunătăți o diagramă a reziduurilor este o formă de manipulare a modelului. Dacă observația este legitimă, abordarea mai onestă este să recunoști limitările modelului sau să investighezi o structură de model diferită.

Ce afectează de fapt eteroscedasticitatea într-o diagramă a reziduurilor?

Tiparul de pâlnie sau evantai nu părtineste estimările coeficienților — modelul îți oferă în continuare efectul mediu corect. Ce se strică este fiabilitatea erorilor standard și, prin urmare, a valorilor p și a intervalelor de încredere. Dacă folosești regresia exclusiv pentru predicție, s-ar putea să conteze mai puțin. Dacă testezi ipoteze sau construiești intervale de încredere, va trebui fie să transformi variabila răspuns, fie să folosești corecții ale erorilor standard pentru varianță inegală.

Funcționează diagramele reziduurilor pentru modele de regresie multiplă la fel de bine ca pentru regresia simplă?

Da, și sunt, probabil, mai importante în regresia multiplă deoarece există mai multe moduri în care modelul poate greși. Abordarea standard este să reprezinți reziduurile în funcție de valorile ajustate pentru o vedere de ansamblu, apoi în funcție de fiecare predictor separat pentru a verifica relații neliniare pe care modelul le poate rata. Regulile de interpretare sunt aceleași: caută tipare și investighează orice este sistematic.

Cum diferă diagramele reziduurilor în regresia pe serii temporale față de regresia pe secțiune transversală?

În regresia pe secțiune transversală, cauți tipare spațiale — curbe, pâlnii, clustere — în diagrama reziduuri vs. ajustate. În regresia pe serii temporale, trebuie de asemenea să verifici dacă reziduurile sunt corelate în timp, deoarece autocorelația încalcă ipoteza de independență și face erorile standard nesigure. Reprezintă reziduurile în funcție de indicele de timp și caută tendințe sau tipare oscilante; statistica Durbin-Watson poate testa, de asemenea, autocorelația de ordinul întâi. O simplă diagramă reziduuri vs. ajustate nu va depista asta de una singură.

Subiecte
Analiza datelor
Data Science

Învață cu DataCamp

course

Studii de caz în gândirea statistică

4 oră
16.2K
Aplică-ți abilitățile de gândire statistică pe seturi de date reale și extrage informații utile pentru a avansa spre stăpânire.
Vezi detaliiRight Arrow
Începeți Cursul
Vezi mai multRight Arrow