I numeri non mentono, ma possono essere dei narratori incredibilmente persuasivi. Ci raccontano storie di connessioni e tendenze, ma a volte omettono dettagli cruciali. Saper leggere queste storie, distinguendo una coincidenza da una causa reale, non è più un’abilità riservata solo agli statistici. È una competenza fondamentale per chiunque voglia prendere decisioni informate, che si tratti di ottimizzare una strategia di business, condurre una ricerca o semplicemente non cadere in facili tranelli mediatici.
In questo articolo non ci perderemo in formule astratte.
Invece, affronteremo tre “casi studio” pratici, tre storie raccontate dai dati. Partiremo da una relazione semplice e quasi intuitiva, per poi scoprire come i modelli lineari possano ingannarci e, infine, smaschereremo un colpevole inaspettato che si nasconde dietro una correlazione apparentemente ovvia.
Sei pronto a diventare un interprete più critico del linguaggio dei dati?
Esercizio 1: Ore di Sonno e Livello di Concentrazione
Uno studente di psicologia sta conducendo una piccola ricerca per esplorare la relazione tra il numero di ore di sonno che gli studenti universitari dichiarano di avere la notte prima di un esame e il loro livello di concentrazione percepito durante l’esame (su una scala da 1 a 10, dove 10 è massima concentrazione). Ha raccolto i dati da 9 studenti:
Tabella Dati
| Studente | Ore di Sonno (X) | Concentrazione (Y) |
|---|---|---|
| 1 | 7 | 8 |
| 2 | 5 | 4 |
| 3 | 8 | 9 |
| 4 | 6 | 6 |
| 5 | 7.5 | 8.5 |
| 6 | 4 | 3 |
| 7 | 6.5 | 7 |
| 8 | 8.5 | 9.5 |
| 9 | 5.5 | 5 |
- Calcola il coefficiente di correlazione di Pearson (r) per questi dati.
- Determina l’equazione della retta di regressione lineare ([math]Y = a + bX[/math]).
- Interpreta il coefficiente angolare (b) e l’intercetta (a) nel contesto del problema.
- Calcola e interpreta il coefficiente di determinazione ([math]R^2[/math]).
- Identifica se ci sono outlier evidenti nel dataset e discuti il loro potenziale impatto sulla correlazione e sulla retta di regressione.
Soluzione passo-passo
1. Calcolo del coefficiente di correlazione di Pearson (r)
Iniziamo calcolando le medie di X e Y.
[math]\bar{X} = (7+5+8+6+7.5+4+6.5+8.5+5.5) / 9 = 58 / 9 \approx 6.44[/math]
[math]\bar{Y} = (8+4+9+6+8.5+3+7+9.5+5) / 9 = 60 / 9 \approx 6.67[/math]
Ora, costruiamo la tabella per i calcoli intermedi:
| Studente | X | Y | [math]X – \bar{X}[/math] | [math]Y – \bar{Y}[/math] | [math](X – \bar{X})(Y – \bar{Y})[/math] | [math](X – \bar{X})^2[/math] | [math](Y – \bar{Y})^2[/math] |
|---|---|---|---|---|---|---|---|
| 1 | 7 | 8 | 0.56 | 1.33 | 0.74 | 0.31 | 1.77 |
| 2 | 5 | 4 | -1.44 | -2.67 | 3.85 | 2.07 | 7.13 |
| 3 | 8 | 9 | 1.56 | 2.33 | 3.63 | 2.43 | 5.43 |
| 4 | 6 | 6 | -0.44 | -0.67 | 0.29 | 0.19 | 0.45 |
| 5 | 7.5 | 8.5 | 1.06 | 1.83 | 1.94 | 1.12 | 3.35 |
| 6 | 4 | 3 | -2.44 | -3.67 | 8.96 | 5.95 | 13.47 |
| 7 | 6.5 | 7 | 0.06 | 0.33 | 0.02 | 0.00 | 0.11 |
| 8 | 8.5 | 9.5 | 2.06 | 2.83 | 5.83 | 4.24 | 8.01 |
| 9 | 5.5 | 5 | -0.94 | -1.67 | 1.57 | 0.88 | 2.79 |
| Somma | 58 | 60 | 0 | 0 | 26.83 | 17.19 | 47.51 |
Applichiamo la formula per r:
[math]r = \frac{26.83}{\sqrt{17.19 \times 47.51}} = \frac{26.83}{\sqrt{816.70}} = \frac{26.83}{28.58} \approx \mathbf{0.9388}[/math]
Spiegazione didattica: Un valore di r di circa 0.9388 indica una correlazione lineare positiva molto forte. Questo suggerisce che, in generale, più ore di sonno sono associate a un livello di concentrazione più elevato.
2. Determinazione dell’equazione della retta di regressione lineare ([math]Y = a + bX[/math])
Calcoliamo i coefficienti ‘a’ e ‘b’:
[math]b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2} = \frac{26.83}{17.19} \approx \mathbf{1.5608}[/math]
[math]a = \bar{Y} – b\bar{X} = 6.67 – (1.5608 \times 6.44) = 6.67 – 10.05 \approx \mathbf{-3.38}[/math]
Quindi, l’equazione della retta di regressione è: [math]\mathbf{Y = -3.38 + 1.56X}[/math]
Spiegazione didattica: La retta di regressione ci permette di stimare il livello di concentrazione (Y) dato un certo numero di ore di sonno (X). È importante ricordare che questo è un modello basato sui dati osservati e non una legge universale.
3. Interpretazione del coefficiente angolare (b) e dell’intercetta (a)
- Coefficiente angolare (b ≈ 1.56): Per ogni ora di sonno aggiuntiva, il livello di concentrazione percepito aumenta in media di circa 1.56 punti sulla scala da 1 a 10.
- Intercetta (a ≈ -3.38): Questo valore rappresenta il livello di concentrazione previsto quando le ore di sonno sono zero. Un valore negativo per la concentrazione non ha un significato pratico in questo contesto, poiché non è possibile avere un livello di concentrazione negativo e zero ore di sonno non sono realistiche per un esame. Questo evidenzia che l’intercetta non sempre ha un’interpretazione significativa al di fuori del range dei dati osservati.
4. Calcolo e interpretazione del coefficiente di determinazione ([math]R^2[/math])
[math]R^2 = r^2 = (0.9388)^2 \approx \mathbf{0.8813}[/math]
Interpretazione: Un [math]R^2[/math] di circa 0.8813 (o 88.13%) significa che l’88.13% della variabilità nel livello di concentrazione può essere spiegato dalla variabilità nelle ore di sonno. Il restante 11.87% è dovuto ad altri fattori non inclusi nel modello (es. stress, dieta, difficoltà dell’esame, abitudini di studio) o a variabilità casuale.
Spiegazione didattica: Un [math]R^2[/math] elevato indica che le ore di sonno sono un buon predittore del livello di concentrazione, ma non l’unico. Ci sono altri fattori che influenzano la concentrazione, e il modello non li cattura.
5. Identificazione e impatto degli outlier
Per identificare gli outlier, è utile osservare il diagramma a dispersione. I punti che si discostano significativamente dalla tendenza generale o dalla retta di regressione sono potenziali outlier. Nel nostro dataset, lo studente 6 (4 ore di sonno, 3 di concentrazione) e lo studente 8 (8.5 ore di sonno, 9.5 di concentrazione) sono i valori più estremi, ma sembrano seguire la tendenza generale. Non ci sono outlier evidenti che si discostino drasticamente dalla linea di tendenza.
Impatto degli Outlier:
Gli outlier possono avere un impatto significativo sul coefficiente di correlazione e sulla retta di regressione. Un singolo outlier può:
- Distorcere il coefficiente di correlazione: Un outlier che si allontana dalla tendenza generale può ridurre la forza della correlazione (se si trova lontano dalla retta) o, al contrario, aumentarla artificialmente (se si trova in linea con la tendenza ma molto distante dagli altri punti, tirando la retta verso di sé).
- Influenzare la pendenza e l’intercetta della retta di regressione: La retta di regressione è sensibile agli outlier perché il metodo dei minimi quadrati cerca di minimizzare la somma dei quadrati degli errori. Un outlier con un errore grande avrà un peso maggiore in questa somma, tirando la retta verso di sé. Questo può portare a una stima distorta dei coefficienti.
Strategia per gli Outlier:
Prima di rimuovere un outlier, è fondamentale indagarne la causa. Potrebbe essere un errore di misurazione, un errore di inserimento dati, o un evento genuinamente insolito. Se è un errore, può essere corretto o rimosso. Se è un dato valido ma insolito, la sua rimozione dovrebbe essere giustificata e documentata, e l’analisi dovrebbe essere condotta sia con che senza l’outlier per valutarne l’impatto. In questo caso, non ci sono outlier che richiedano un’azione immediata, ma è un concetto importante da considerare nell’analisi dei dati.

Ecco la trappola in cui cadono in molti: si fidano ciecamente del coefficiente
rsenza aver prima ‘guardato in faccia’ i dati con un grafico. Un software ti darà sempre un numero, ma l’intuizione e il pensiero critico per capire se quel numero ha senso sono, per ora, ancora unicamente umani.
Esercizio 2: Consumo di Caffè e Produttività Lavorativa: Un Caso di Correlazione Non Lineare?
Un ricercatore in ambito organizzativo vuole studiare la relazione tra il consumo giornaliero di caffè (in tazze) e il livello di produttività percepita (su una scala da 1 a 100) tra i dipendenti di un’azienda tecnologica. Ha raccolto i dati da 12 dipendenti:
Tabella Dati
| Dipendente | Tazze di Caffè (X) | Produttività (Y) |
|---|---|---|
| 1 | 0 | 50 |
| 2 | 1 | 65 |
| 3 | 2 | 80 |
| 4 | 3 | 90 |
| 5 | 4 | 95 |
| 6 | 5 | 92 |
| 7 | 6 | 85 |
| 8 | 7 | 70 |
| 9 | 8 | 55 |
| 10 | 9 | 40 |
| 11 | 10 | 25 |
| 12 | 11 | 10 |
- Costruisci un diagramma a dispersione per visualizzare la relazione tra il consumo di caffè e la produttività.
- Calcola il coefficiente di correlazione di Pearson (r) per questi dati. Cosa suggerisce il suo valore?
- Basandoti sul diagramma e sul valore di r, discuti se la correlazione lineare è il modello più appropriato per descrivere questa relazione. Se no, quale tipo di relazione sembra esserci?
- Considerando la natura della relazione, quali potrebbero essere le implicazioni per l’azienda in termini di politiche sul consumo di caffè?
Soluzione passo-passo
1. Costruzione del diagramma a dispersione
Rappresentiamo ogni coppia (Tazze di Caffè, Produttività) come un punto su un grafico cartesiano. L’asse X sarà il numero di tazze di caffè e l’asse Y il livello di produttività.
Spiegazione didattica: Il diagramma a dispersione è cruciale per identificare relazioni non lineari. Un r basso non significa assenza di relazione, ma assenza di relazione lineare.
2. Calcolo del coefficiente di correlazione di Pearson (r)
Iniziamo calcolando le medie di X e Y.
[math]\bar{X} = (0+1+2+3+4+5+6+7+8+9+10+11) / 12 = 66 / 12 = 5.5[/math]
[math]\bar{Y} = (50+65+80+90+95+92+85+70+55+40+25+10) / 12 = 757 / 12 \approx 63.08[/math]
Ora, costruiamo la tabella per i calcoli intermedi:
| Dipendente | X | Y | [math]X – \bar{X}[/math] | [math]Y – \bar{Y}[/math] | [math](X – \bar{X})(Y – \bar{Y})[/math] | [math](X – \bar{X})^2[/math] | [math](Y – \bar{Y})^2[/math] |
|---|---|---|---|---|---|---|---|
| 1 | 0 | 50 | -5.5 | -13.08 | 71.94 | 30.25 | 171.09 |
| 2 | 1 | 65 | -4.5 | 1.92 | -8.64 | 20.25 | 3.69 |
| 3 | 2 | 80 | -3.5 | 16.92 | -59.22 | 12.25 | 286.29 |
| 4 | 3 | 90 | -2.5 | 26.92 | -67.30 | 6.25 | 724.69 |
| 5 | 4 | 95 | -1.5 | 31.92 | -47.88 | 2.25 | 1018.89 |
| 6 | 5 | 92 | -0.5 | 28.92 | -14.46 | 0.25 | 836.39 |
| 7 | 6 | 85 | 0.5 | 21.92 | 10.96 | 0.25 | 480.49 |
| 8 | 7 | 70 | 1.5 | 6.92 | 10.38 | 2.25 | 47.89 |
| 9 | 8 | 55 | 2.5 | -8.08 | -20.20 | 6.25 | 65.29 |
| 10 | 9 | 40 | 3.5 | -23.08 | -80.78 | 12.25 | 532.69 |
| 11 | 10 | 25 | 4.5 | -38.08 | -171.36 | 20.25 | 1450.09 |
| 12 | 11 | 10 | 5.5 | -53.08 | -291.94 | 30.25 | 2817.49 |
| Somma | 66 | 757 | 0 | 0 | -678.58 | 143.00 | 8335.98 |
Applichiamo la formula per r:
[math]r = \frac{-678.58}{\sqrt{143.00 \times 8335.98}} = \frac{-678.58}{\sqrt{1191547.14}} = \frac{-678.58}{1091.58} \approx \mathbf{-0.6216}[/math]
Spiegazione didattica: Un valore di r di circa -0.6216 indica una correlazione lineare negativa di forza moderata. Questo suggerirebbe che all’aumentare del consumo di caffè, la produttività tende a diminuire. Tuttavia, questa interpretazione potrebbe essere fuorviante, come vedremo nel prossimo punto.
3. Discussione sulla correlazione lineare e tipo di relazione
Osservando il diagramma a dispersione, si nota chiaramente che la relazione tra il consumo di caffè e la produttività non è lineare. I punti formano una curva a forma di U rovesciata (parabola). La produttività aumenta con il consumo di caffè fino a un certo punto (circa 4 tazze), dopodiché inizia a diminuire drasticamente. Questo è un classico esempio di relazione non lineare.
Il coefficiente di correlazione di Pearson (r) di -0.6216 è fuorviante perché cerca di adattare una linea retta a una relazione curva. La correlazione lineare non è il modello più appropriato per descrivere questa relazione. Il valore negativo di r è dovuto al fatto che la parte decrescente della curva è più pronunciata e copre un range più ampio di valori di X, quindi la tendenza generale negativa domina il calcolo.
Tipo di relazione: La relazione è quadratica o parabolica. Questo tipo di relazione è comune in molti contesti reali, dove un fattore ha un effetto positivo fino a un punto di saturazione o di rendimento decrescente, dopodiché diventa controproducente.
Spiegazione didattica:
- Correlazione Non Lineare: Si verifica quando la relazione tra due variabili non può essere descritta adeguatamente da una linea retta. Esempi comuni includono relazioni quadratiche, esponenziali o logaritmiche.
- Limiti del Coefficiente di Pearson: Il coefficiente di Pearson misura solo la forza della relazione lineare. Se la relazione è forte ma non lineare, r può essere vicino a 0 o dare un valore fuorviante. È per questo che è fondamentale visualizzare sempre i dati con un diagramma a dispersione prima di interpretare r.
4. Implicazioni per l’azienda
Le implicazioni per l’azienda sono significative e non potrebbero essere colte da una semplice analisi di correlazione lineare:
- Consumo Ottimale: Esiste un livello ottimale di consumo di caffè (circa 4 tazze al giorno) che massimizza la produttività. Incoraggiare un consumo moderato potrebbe essere benefico.
- Effetti Negativi dell’Eccesso: Un consumo eccessivo di caffè (oltre le 4-5 tazze) è controproducente e porta a una diminuzione della produttività, probabilmente a causa di effetti collaterali come ansia, nervosismo o difficoltà di concentrazione.
- Politiche Aziendali: Invece di limitare o incoraggiare il consumo di caffè in modo generico, l’azienda potrebbe educare i dipendenti sugli effetti del consumo moderato vs. eccessivo. Potrebbe anche considerare di offrire alternative al caffè, come tè o bevande decaffeinate, per chi ha superato la soglia ottimale.
Osservazione strategica: Oltre la Correlazione Lineare
Questo esercizio dimostra l’importanza di non fermarsi al calcolo del coefficiente di correlazione. L’analisi dei dati richiede un approccio critico e visivo. Quando si sospetta una relazione non lineare, si possono utilizzare modelli di regressione più complessi (es. regressione polinomiale) per descrivere la relazione in modo più accurato. In questo caso, un modello di regressione quadratica ([math]Y = a + b_1X + b_2X^2[/math]) si adatterebbe molto meglio ai dati e fornirebbe stime più precise dell’impatto del consumo di caffè sulla produttività.

Nel mondo del business e del policy making, individuare la variabile confondente è il vero game-changer. Significa smettere di investire risorse per risolvere il problema sbagliato (vendere meno gelati) e iniziare a concentrarsi sulla vera causa (gestire meglio l’affollamento nelle piscine durante le ondate di caldo).
Gli esercizi proseguono alla pagina successiva:
(110)
Altri articoli nella categoria "Esercizi svolti di Statistica"
- Indice di Laspeyres: formula, significato ed esercizi svolti
- Regressione lineare: esercizi progressivi dai minimi quadrati alla regressione multipla
- Statistica per il Marketing: Come Usare i Test d’Ipotesi (Z-Test) per A/B Test e ROI
- Analisi Statistica Avanzata: Indice di Gini, Asimmetria e Proprietà dei Residui nella Regressione
- Esercizi Svolti di Statistica Descrittiva: Mediana, Varianza, Box Plot e Correlazione (Con Spiegazioni)
- La Città dei Numeri Manipolati: Gioco Interattivo per Riconoscere le Fake News Statistiche
- Media, Mediana e Moda: 8 Esercizi Svolti dalla Base all’Analisi Avanzata
- Data Literacy: 5 Esercizi per non farsi ingannare dai Grafici (Statistica Pratica)
- Data Literacy: Guida Pratica per Interpretare Grafici Statistici (con Esercizi e Soluzioni)
- Come leggere le Tavole Statistiche (Z, t, Chi-quadrato): Guida Completa ed Esempi