Calcolatore di regressione lineare

Migliore-fit line
Risultati

La regressione lineare adatta la singola retta y = mx + b che minimizza la somma degli errori verticali quadrati dai dati. È il primo strumento da utilizzare quando sospetti che una variabile influenzi un’altra, spesa pubblicitaria vs. iscrizioni, temperatura vs. vendite di gelato, altezza vs. numero di scarpe. Incolla coppie (x, y) e il calcolatore restituisce pendenza, intercetta, R-quadrato e il coefficiente di correlazione di Pearson.

Come adattare una linea di regressione

  1. 1

    Incolla i dati

    Una coppia per riga: x e y separati da virgola, tab o spazio. Le intestazioni vengono ignorate.

  2. 2

    Leggi pendenza e intercetta

    Pendenza m = variazione in y per variazione di 1 unità in x. Intercetta b = y quando x = 0.

  3. 3

    Controlla R²

    R² ∈ [0, 1], la quota di varianza in y spiegata da x. 0.7+ è solitamente forte nei dati sociali.

  4. 4

    Prevedi nuovi valori

    Inserisci qualsiasi x in y = m·x + b per ottenere la previsione del modello.

Le formule dietro l'adattamento

Date N punti dati (x_i, y_i), la pendenza e l’intercetta dei minimi quadrati ordinari sono:

m = Σ((x_i − x̄)(y_i − ȳ)) / Σ((x_i − x̄)²)
b = ȳ − m · x̄

R², il coefficiente di determinazione, è la quota di varianza in y spiegata da x:

R² = 1 − SS_res / SS_tot

dove SS_res è la somma dei residui quadratici e SS_tot è la somma delle deviazioni quadratiche di y dalla sua media. Pearson r è ±√R², portando il segno della pendenza.

Esempio pratico

Cinque punti dati:

x y
1 2
2 4
3 5
4 4
5 6

x̄ = 3, ȳ = 4.2. Numeratore della covarianza = (1-3)(2-4.2) + (2-3)(4-4.2) + (3-3)(5-4.2) + (4-3)(4-4.2) + (5-3)(6-4.2) = 4.4 + 0.2 + 0 − 0.2 + 3.6 = 8.0. Numeratore della varianza di x = 4 + 1 + 0 + 1 + 4 = 10.

  • Pendenza m = 8.0 / 10 = 0.8
  • Intercetta b = 4.2 − 0.8 × 3 = 1.8
  • Equazione: y = 0.8x + 1.8
  • R² ≈ 0.727

Cosa dicono (e non dicono) i numeri

  • Pendenza m risponde a “quanto si muove y per unità di x”. Ha le unità di y/x.
  • Intercetta b risponde a “qual è y quando x è 0”. Significativa solo se x = 0 è plausibile per i tuoi dati.
  • misura la qualità dell’adattamento, non la causalità. Un alto R² su dati proxy privi di rumore può comunque essere privo di significato.
  • Pearson r cattura l’associazione lineare. r vicino a 0 con una forte relazione curva significa comunque “nessun adattamento lineare”, non “nessuna relazione”.

Insidie

  • Outlier distorcono pesantemente gli adattamenti OLS perché la perdita è quadrata. Un punto anomalo può ruotare la linea di 20 gradi.
  • Non linearità non è rilevata da R² da sola, traccia sempre i residui rispetto a x.
  • La regressione non è simmetrica: adattare y su x dà una linea diversa rispetto ad adattare x su y.
  • Estrapolazione oltre l’intervallo dei tuoi dati è speculazione. L’adattamento conosce solo l’intervallo che ha visto.

Domande frequenti

Il 40% della variazione in y è spiegata dalla relazione lineare con x. Il restante 60% proviene da rumore, altre variabili o non linearità. In fisica è scarso; nei dati sociali o economici è spesso accettabile.

Inizia con la lineare. Se il grafico dei residui mostra una chiara curva, prova una trasformazione quadratica o logaritmica. Passare direttamente a un polinomio di alto grado sovradimensiona e generalizza male ai nuovi dati.

Matematicamente ne servono 2; significativamente, almeno 20. Sotto quel numero, un outlier domina l’adattamento. Per risultati pubblicati, controlla le linee guida sulla dimensione del campione specifiche per il tuo campo.

No. Le coppie (x, y) che incolli vengono adattate nel tuo browser e non lasciano mai la pagina.

Strumenti correlati

Strumento disponibile in altre lingue