Guida Pratica alla Correlazione: Come Interpretare i Dati Senza Fraintendimenti (3 Esercizi Svolti)

Cerca nel sito

Altri risultati..

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors

Cerca nelle Categorie

Vedi una forte correlazione tra due fenomeni- Attenzione a non saltare a conclusioni!

I numeri non mentono, ma possono essere dei narratori incredibilmente persuasivi. Ci raccontano storie di connessioni e tendenze, ma a volte omettono dettagli cruciali. Saper leggere queste storie, distinguendo una coincidenza da una causa reale, non è più un’abilità riservata solo agli statistici. È una competenza fondamentale per chiunque voglia prendere decisioni informate, che si tratti di ottimizzare una strategia di business, condurre una ricerca o semplicemente non cadere in facili tranelli mediatici.


In questo articolo non ci perderemo in formule astratte.

Invece, affronteremo tre “casi studio” pratici, tre storie raccontate dai dati. Partiremo da una relazione semplice e quasi intuitiva, per poi scoprire come i modelli lineari possano ingannarci e, infine, smaschereremo un colpevole inaspettato che si nasconde dietro una correlazione apparentemente ovvia.

Sei pronto a diventare un interprete più critico del linguaggio dei dati?

Esercizio 1: Ore di Sonno e Livello di Concentrazione

Uno studente di psicologia sta conducendo una piccola ricerca per esplorare la relazione tra il numero di ore di sonno che gli studenti universitari dichiarano di avere la notte prima di un esame e il loro livello di concentrazione percepito durante l’esame (su una scala da 1 a 10, dove 10 è massima concentrazione). Ha raccolto i dati da 9 studenti:

Tabella Dati

Studente Ore di Sonno (X) Concentrazione (Y)
1 7 8
2 5 4
3 8 9
4 6 6
5 7.5 8.5
6 4 3
7 6.5 7
8 8.5 9.5
9 5.5 5
  1. Calcola il coefficiente di correlazione di Pearson (r) per questi dati.
  2. Determina l’equazione della retta di regressione lineare ([math]Y = a + bX[/math]).
  3. Interpreta il coefficiente angolare (b) e l’intercetta (a) nel contesto del problema.
  4. Calcola e interpreta il coefficiente di determinazione ([math]R^2[/math]).
  5. Identifica se ci sono outlier evidenti nel dataset e discuti il loro potenziale impatto sulla correlazione e sulla retta di regressione.

Soluzione passo-passo

1. Calcolo del coefficiente di correlazione di Pearson (r)

Iniziamo calcolando le medie di X e Y.

[math]\bar{X} = (7+5+8+6+7.5+4+6.5+8.5+5.5) / 9 = 58 / 9 \approx 6.44[/math]
[math]\bar{Y} = (8+4+9+6+8.5+3+7+9.5+5) / 9 = 60 / 9 \approx 6.67[/math]

Ora, costruiamo la tabella per i calcoli intermedi:

Studente X Y [math]X – \bar{X}[/math] [math]Y – \bar{Y}[/math] [math](X – \bar{X})(Y – \bar{Y})[/math] [math](X – \bar{X})^2[/math] [math](Y – \bar{Y})^2[/math]
1 7 8 0.56 1.33 0.74 0.31 1.77
2 5 4 -1.44 -2.67 3.85 2.07 7.13
3 8 9 1.56 2.33 3.63 2.43 5.43
4 6 6 -0.44 -0.67 0.29 0.19 0.45
5 7.5 8.5 1.06 1.83 1.94 1.12 3.35
6 4 3 -2.44 -3.67 8.96 5.95 13.47
7 6.5 7 0.06 0.33 0.02 0.00 0.11
8 8.5 9.5 2.06 2.83 5.83 4.24 8.01
9 5.5 5 -0.94 -1.67 1.57 0.88 2.79
Somma 58 60 0 0 26.83 17.19 47.51

Applichiamo la formula per r:

[math]r = \frac{26.83}{\sqrt{17.19 \times 47.51}} = \frac{26.83}{\sqrt{816.70}} = \frac{26.83}{28.58} \approx \mathbf{0.9388}[/math]

Spiegazione didattica: Un valore di r di circa 0.9388 indica una correlazione lineare positiva molto forte. Questo suggerisce che, in generale, più ore di sonno sono associate a un livello di concentrazione più elevato.

2. Determinazione dell’equazione della retta di regressione lineare ([math]Y = a + bX[/math])

Calcoliamo i coefficienti ‘a’ e ‘b’:

[math]b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2} = \frac{26.83}{17.19} \approx \mathbf{1.5608}[/math]
[math]a = \bar{Y} – b\bar{X} = 6.67 – (1.5608 \times 6.44) = 6.67 – 10.05 \approx \mathbf{-3.38}[/math]

Quindi, l’equazione della retta di regressione è: [math]\mathbf{Y = -3.38 + 1.56X}[/math]

Spiegazione didattica: La retta di regressione ci permette di stimare il livello di concentrazione (Y) dato un certo numero di ore di sonno (X). È importante ricordare che questo è un modello basato sui dati osservati e non una legge universale.

3. Interpretazione del coefficiente angolare (b) e dell’intercetta (a)

  • Coefficiente angolare (b ≈ 1.56): Per ogni ora di sonno aggiuntiva, il livello di concentrazione percepito aumenta in media di circa 1.56 punti sulla scala da 1 a 10.
  • Intercetta (a ≈ -3.38): Questo valore rappresenta il livello di concentrazione previsto quando le ore di sonno sono zero. Un valore negativo per la concentrazione non ha un significato pratico in questo contesto, poiché non è possibile avere un livello di concentrazione negativo e zero ore di sonno non sono realistiche per un esame. Questo evidenzia che l’intercetta non sempre ha un’interpretazione significativa al di fuori del range dei dati osservati.
Ti potrebbe interessare anche:  Esercizi svolti di preparazione all’esame di statistica (II Parte)

4. Calcolo e interpretazione del coefficiente di determinazione ([math]R^2[/math])

[math]R^2 = r^2 = (0.9388)^2 \approx \mathbf{0.8813}[/math]

Interpretazione: Un [math]R^2[/math] di circa 0.8813 (o 88.13%) significa che l’88.13% della variabilità nel livello di concentrazione può essere spiegato dalla variabilità nelle ore di sonno. Il restante 11.87% è dovuto ad altri fattori non inclusi nel modello (es. stress, dieta, difficoltà dell’esame, abitudini di studio) o a variabilità casuale.

Spiegazione didattica: Un [math]R^2[/math] elevato indica che le ore di sonno sono un buon predittore del livello di concentrazione, ma non l’unico. Ci sono altri fattori che influenzano la concentrazione, e il modello non li cattura.

5. Identificazione e impatto degli outlier

Per identificare gli outlier, è utile osservare il diagramma a dispersione. I punti che si discostano significativamente dalla tendenza generale o dalla retta di regressione sono potenziali outlier. Nel nostro dataset, lo studente 6 (4 ore di sonno, 3 di concentrazione) e lo studente 8 (8.5 ore di sonno, 9.5 di concentrazione) sono i valori più estremi, ma sembrano seguire la tendenza generale. Non ci sono outlier evidenti che si discostino drasticamente dalla linea di tendenza.

Impatto degli Outlier:

Gli outlier possono avere un impatto significativo sul coefficiente di correlazione e sulla retta di regressione. Un singolo outlier può:

  • Distorcere il coefficiente di correlazione: Un outlier che si allontana dalla tendenza generale può ridurre la forza della correlazione (se si trova lontano dalla retta) o, al contrario, aumentarla artificialmente (se si trova in linea con la tendenza ma molto distante dagli altri punti, tirando la retta verso di sé).
  • Influenzare la pendenza e l’intercetta della retta di regressione: La retta di regressione è sensibile agli outlier perché il metodo dei minimi quadrati cerca di minimizzare la somma dei quadrati degli errori. Un outlier con un errore grande avrà un peso maggiore in questa somma, tirando la retta verso di sé. Questo può portare a una stima distorta dei coefficienti.

Strategia per gli Outlier:

Prima di rimuovere un outlier, è fondamentale indagarne la causa. Potrebbe essere un errore di misurazione, un errore di inserimento dati, o un evento genuinamente insolito. Se è un errore, può essere corretto o rimosso. Se è un dato valido ma insolito, la sua rimozione dovrebbe essere giustificata e documentata, e l’analisi dovrebbe essere condotta sia con che senza l’outlier per valutarne l’impatto. In questo caso, non ci sono outlier che richiedano un’azione immediata, ma è un concetto importante da considerare nell’analisi dei dati.

scatterplot_esercizio1

Ecco la trappola in cui cadono in molti: si fidano ciecamente del coefficiente r senza aver prima ‘guardato in faccia’ i dati con un grafico. Un software ti darà sempre un numero, ma l’intuizione e il pensiero critico per capire se quel numero ha senso sono, per ora, ancora unicamente umani.

 

Ti potrebbe interessare anche:  Esercizi svolti riepilogativi sugli indici di variabilità e sull' indice di Eterogeneità di Gini

Esercizio 2: Consumo di Caffè e Produttività Lavorativa: Un Caso di Correlazione Non Lineare?

Un ricercatore in ambito organizzativo vuole studiare la relazione tra il consumo giornaliero di caffè (in tazze) e il livello di produttività percepita (su una scala da 1 a 100) tra i dipendenti di un’azienda tecnologica. Ha raccolto i dati da 12 dipendenti:

Tabella Dati

Dipendente Tazze di Caffè (X) Produttività (Y)
1 0 50
2 1 65
3 2 80
4 3 90
5 4 95
6 5 92
7 6 85
8 7 70
9 8 55
10 9 40
11 10 25
12 11 10
  1. Costruisci un diagramma a dispersione per visualizzare la relazione tra il consumo di caffè e la produttività.
  2. Calcola il coefficiente di correlazione di Pearson (r) per questi dati. Cosa suggerisce il suo valore?
  3. Basandoti sul diagramma e sul valore di r, discuti se la correlazione lineare è il modello più appropriato per descrivere questa relazione. Se no, quale tipo di relazione sembra esserci?
  4. Considerando la natura della relazione, quali potrebbero essere le implicazioni per l’azienda in termini di politiche sul consumo di caffè?

Soluzione passo-passo

1. Costruzione del diagramma a dispersione

Rappresentiamo ogni coppia (Tazze di Caffè, Produttività) come un punto su un grafico cartesiano. L’asse X sarà il numero di tazze di caffè e l’asse Y il livello di produttività.

Spiegazione didattica: Il diagramma a dispersione è cruciale per identificare relazioni non lineari. Un r basso non significa assenza di relazione, ma assenza di relazione lineare.

2. Calcolo del coefficiente di correlazione di Pearson (r)

Iniziamo calcolando le medie di X e Y.

[math]\bar{X} = (0+1+2+3+4+5+6+7+8+9+10+11) / 12 = 66 / 12 = 5.5[/math]
[math]\bar{Y} = (50+65+80+90+95+92+85+70+55+40+25+10) / 12 = 757 / 12 \approx 63.08[/math]

Ora, costruiamo la tabella per i calcoli intermedi:

Dipendente X Y [math]X – \bar{X}[/math] [math]Y – \bar{Y}[/math] [math](X – \bar{X})(Y – \bar{Y})[/math] [math](X – \bar{X})^2[/math] [math](Y – \bar{Y})^2[/math]
1 0 50 -5.5 -13.08 71.94 30.25 171.09
2 1 65 -4.5 1.92 -8.64 20.25 3.69
3 2 80 -3.5 16.92 -59.22 12.25 286.29
4 3 90 -2.5 26.92 -67.30 6.25 724.69
5 4 95 -1.5 31.92 -47.88 2.25 1018.89
6 5 92 -0.5 28.92 -14.46 0.25 836.39
7 6 85 0.5 21.92 10.96 0.25 480.49
8 7 70 1.5 6.92 10.38 2.25 47.89
9 8 55 2.5 -8.08 -20.20 6.25 65.29
10 9 40 3.5 -23.08 -80.78 12.25 532.69
11 10 25 4.5 -38.08 -171.36 20.25 1450.09
12 11 10 5.5 -53.08 -291.94 30.25 2817.49
Somma 66 757 0 0 -678.58 143.00 8335.98

Applichiamo la formula per r:

[math]r = \frac{-678.58}{\sqrt{143.00 \times 8335.98}} = \frac{-678.58}{\sqrt{1191547.14}} = \frac{-678.58}{1091.58} \approx \mathbf{-0.6216}[/math]

Spiegazione didattica: Un valore di r di circa -0.6216 indica una correlazione lineare negativa di forza moderata. Questo suggerirebbe che all’aumentare del consumo di caffè, la produttività tende a diminuire. Tuttavia, questa interpretazione potrebbe essere fuorviante, come vedremo nel prossimo punto.

3. Discussione sulla correlazione lineare e tipo di relazione

Osservando il diagramma a dispersione, si nota chiaramente che la relazione tra il consumo di caffè e la produttività non è lineare. I punti formano una curva a forma di U rovesciata (parabola). La produttività aumenta con il consumo di caffè fino a un certo punto (circa 4 tazze), dopodiché inizia a diminuire drasticamente. Questo è un classico esempio di relazione non lineare.

Il coefficiente di correlazione di Pearson (r) di -0.6216 è fuorviante perché cerca di adattare una linea retta a una relazione curva. La correlazione lineare non è il modello più appropriato per descrivere questa relazione. Il valore negativo di r è dovuto al fatto che la parte decrescente della curva è più pronunciata e copre un range più ampio di valori di X, quindi la tendenza generale negativa domina il calcolo.

Ti potrebbe interessare anche:  Studio di Funzione: Guida Completa con Esercizi Svolti Passo Passo (da Base ad Avanzato)

Tipo di relazione: La relazione è quadratica o parabolica. Questo tipo di relazione è comune in molti contesti reali, dove un fattore ha un effetto positivo fino a un punto di saturazione o di rendimento decrescente, dopodiché diventa controproducente.

Spiegazione didattica:

  • Correlazione Non Lineare: Si verifica quando la relazione tra due variabili non può essere descritta adeguatamente da una linea retta. Esempi comuni includono relazioni quadratiche, esponenziali o logaritmiche.
  • Limiti del Coefficiente di Pearson: Il coefficiente di Pearson misura solo la forza della relazione lineare. Se la relazione è forte ma non lineare, r può essere vicino a 0 o dare un valore fuorviante. È per questo che è fondamentale visualizzare sempre i dati con un diagramma a dispersione prima di interpretare r.

4. Implicazioni per l’azienda

Le implicazioni per l’azienda sono significative e non potrebbero essere colte da una semplice analisi di correlazione lineare:

  • Consumo Ottimale: Esiste un livello ottimale di consumo di caffè (circa 4 tazze al giorno) che massimizza la produttività. Incoraggiare un consumo moderato potrebbe essere benefico.
  • Effetti Negativi dell’Eccesso: Un consumo eccessivo di caffè (oltre le 4-5 tazze) è controproducente e porta a una diminuzione della produttività, probabilmente a causa di effetti collaterali come ansia, nervosismo o difficoltà di concentrazione.
  • Politiche Aziendali: Invece di limitare o incoraggiare il consumo di caffè in modo generico, l’azienda potrebbe educare i dipendenti sugli effetti del consumo moderato vs. eccessivo. Potrebbe anche considerare di offrire alternative al caffè, come tè o bevande decaffeinate, per chi ha superato la soglia ottimale.

Osservazione strategica: Oltre la Correlazione Lineare

Questo esercizio dimostra l’importanza di non fermarsi al calcolo del coefficiente di correlazione. L’analisi dei dati richiede un approccio critico e visivo. Quando si sospetta una relazione non lineare, si possono utilizzare modelli di regressione più complessi (es. regressione polinomiale) per descrivere la relazione in modo più accurato. In questo caso, un modello di regressione quadratica ([math]Y = a + b_1X + b_2X^2[/math]) si adatterebbe molto meglio ai dati e fornirebbe stime più precise dell’impatto del consumo di caffè sulla produttività.

scatterplot_esercizio2

Nel mondo del business e del policy making, individuare la variabile confondente è il vero game-changer. Significa smettere di investire risorse per risolvere il problema sbagliato (vendere meno gelati) e iniziare a concentrarsi sulla vera causa (gestire meglio l’affollamento nelle piscine durante le ondate di caldo).

Gli esercizi proseguono alla pagina successiva:

(110)

PubblicitàPubblicità