Studiare statistica spesso si riduce a un’applicazione meccanica di formule, con il rischio di perdere di vista il significato reale dei dati che abbiamo davanti. Quando calcoliamo una mediana o analizziamo la dispersione di un grafico, stiamo in realtà cercando di far raccontare ai numeri una storia concreta: che si tratti dei tempi di attesa alla posta o delle differenze salariali tra due aziende. In questo articolo abbiamo raccolto cinque esercizi svolti di statistica descrittiva.
Non ci limiteremo a fornirti i calcoli nudi e crudi, ma analizzeremo ogni passaggio per capire il perché dietro le formule.
Troverai anche delle domande di riflessione pensate per testare il tuo intuito statistico prima ancora della tua abilità con la calcolatrice. Fogli alla mano, iniziamo.
La Bussola: Le 4 dimensioni della statistica descrittiva
Prima di tuffarci nei calcoli, c’è una cosa fondamentale da sapere. Ogni volta che analizziamo un set di dati, lo facciamo guardandolo attraverso quattro “lenti” o dimensioni specifiche. Se capisci in quale dimensione ti trovi, saprai sempre quale formula usare.
In questo articolo toccheremo tutte e quattro le dimensioni:
- 1. Posizione (Dove si concentra il fenomeno):Ci dice qual è il “baricentro” dei dati.Strumenti: Media ([math]\mu[/math]), Moda, Mediana.
- 2. Dispersione (Quanto variano i dati):Ci dice se i dati sono tutti vicini al baricentro o molto sparpagliati.Strumenti: Varianza ([math]\sigma^2[/math]), Scarto Quadratico Medio ([math]\sigma[/math]), Coefficiente di Variazione ([math]CV[/math]).
- 3. Forma (Che aspetto ha la distribuzione):Ci mostra se i dati sono simmetrici o se “pendono” verso un lato.Strumenti: Asimmetria, Box Plot.
- 4. Relazione (Come si muovono due fenomeni insieme):Ci dice se e come due variabili si influenzano a vicenda.Strumenti: Covarianza, Correlazione di Pearson ([math]r[/math]).
💡 Consiglio: Non limitarti mai a una sola dimensione. Una media senza la dispersione è come una bussola senza l’ago: ti dice dove sei, ma non dove stai andando.
Quesito 1 (Facile) – Mediana per dati in classi
Un sondaggio sui tempi di attesa (in minuti) di 50 clienti in una filiale postale ha prodotto la seguente distribuzione in classi di ampiezza 10. La classe mediana è 20-30 minuti. La frequenza cumulata precedente la classe mediana è 17, la frequenza della classe mediana è 12. Calcola la mediana approssimata.
- ☐ A) 24,2 min
- ☐ B) 25,0 min
- ☐ C) 26,7 min
- ☐ D) 28,3 min
Risposta corretta: C) 26,7 min
Soluzione
Formula della mediana per dati raggruppati:
[math]\displaystyle \begin{aligned}
Me = L_{inf} + \frac{\frac{N}{2} – F_{prec}}{f_{med}} \cdot a
\end{aligned}[/math]
dove:
[math]\displaystyle \begin{aligned}
& L_{inf} = 20 \\
& \text{(limite inferiore della classe mediana)} \\
& N = 50 \rightarrow \frac{N}{2} = 25 \\
& \text{(metà del totale delle osservazioni)} \\
& F_{prec} = 17 \\
& \text{(freq. cumulata prima della classe mediana)} \\
& f_{med} = 12 \\
& \text{(frequenza assoluta classe mediana)} \\
& a = 10 \\
& \text{(ampiezza classe)}
\end{aligned}[/math]
Sostituiamo i valori nella formula:
[math]\displaystyle \begin{aligned}
Me &= 20 + \frac{25 – 17}{12} \cdot 10 \\
&= 20 + \frac{8}{12} \cdot 10 \\
&= 20 + 0,6667 \cdot 10 \\
&= 20 + 6,667 = 26,667 \approx 26,7 \text{ min}
\end{aligned}[/math]
💡 Osservazione – La formula interpola linearmente all’interno della classe mediana. È valida se si assume che le osservazioni nella classe siano distribuite uniformemente.
Domanda di riflessione – Perché nella formula si usa [math]\frac{N}{2}[/math] e non la media aritmetica?
Quesito 2 (Facile/Medio) – Coefficiente di variazione
Due aziende, Alfa e Beta, presentano i seguenti salari medi mensili e scarti quadratici medi:
- Alfa: media = 1800 €, sqm = 360 €
- Beta: media = 2500 €, sqm = 400 €
Quale affermazione è corretta?
- ☐ A) La variabilità assoluta è maggiore in Beta, quella relativa è maggiore in Alfa
- ☐ B) La variabilità assoluta è maggiore in Alfa, quella relativa è maggiore in Beta
- ☐ C) Sia la variabilità assoluta che quella relativa sono maggiori in Beta
- ☐ D) La variabilità assoluta è maggiore in Beta, quella relativa è uguale
Risposta corretta: A
Soluzione
Variabilità assoluta → confronto diretto degli sqm:
[math]\displaystyle \begin{aligned}
& \text{Alfa: } \sigma = 360 \\
& \text{Beta: } \sigma = 400 \\
& \rightarrow \text{Beta è più variabile in assoluto.}
\end{aligned}[/math]
Variabilità relativa → coefficiente di variazione:
[math]\displaystyle \begin{aligned}
& CV = \frac{\sigma}{\mu} \\
& \text{(espresso in % o decimale)}
\end{aligned}[/math]
Calcolo per le due aziende:
[math]\displaystyle \begin{aligned}
& CV_{Alfa} = \frac{360}{1800} = 0,20 = 20\% \\
& CV_{Beta} = \frac{400}{2500} = 0,16 = 16\% \\
& \rightarrow \text{Alfa ha variabilità relativa maggiore.}
\end{aligned}[/math]
Quindi: assoluta maggiore in Beta, relativa maggiore in Alfa → opzione A.
💡 Osservazione – Il [math]CV[/math] è adimensionale e permette confronti tra fenomeni con unità di misura differenti o medie molto diverse.
Domanda di riflessione – Se le due medie fossero molto vicine, quale indice useresti per confrontare la variabilità e perché?
Quesito 3 (Medio) – Proprietà della varianza (traslazione)
Un insieme di dati ha media [math]\mu = 50[/math] e varianza [math]\sigma^2 = 36[/math]. Se si aggiunge una costante [math]k = 10[/math] a ogni dato, quali diventano la nuova media e la nuova varianza?
- ☐ A) Media = 60, varianza = 36
- ☐ B) Media = 60, varianza = 46
- ☐ C) Media = 50, varianza = 36
- ☐ D) Media = 60, varianza = 360
Risposta corretta: A
Soluzione
Proprietà della traslazione:
Aggiungere una costante [math]k[/math] a tutti i dati fa aumentare la media della stessa costante:
[math]\displaystyle \begin{aligned}
\mu’ = \mu + k = 50 + 10 = 60
\end{aligned}[/math]
La varianza (e quindi lo sqm) non cambia perché la dispersione relativa rimane identica:
[math]\displaystyle \begin{aligned}
\sigma’^2 = \sigma^2 = 36
\end{aligned}[/math]
Nessuna opzione alternativa è corretta.
💡 Osservazione – Se invece moltiplichiamo per una costante [math]c[/math], la varianza viene moltiplicata per [math]c^2[/math].
Domanda di riflessione – Cosa succede alla varianza se moltiplichiamo tutti i dati per una costante negativa, ad esempio -2?
Quesito 4 (Medio) – Lettura del box plot e asimmetria
Il seguente box plot (realizzato secondo Tukey) rappresenta una distribuzione di punteggi:
I baffi (whiskers) arrivano rispettivamente a 15 (sinistra) e a 65 (destra). Il primo quartile [math]Q_1 = 25[/math], la mediana [math]Q_2 = 35[/math], il terzo quartile [math]Q_3 = 45[/math]. Quale affermazione descrive meglio la forma?
- ☐ A) Simmetrica con possibili outlier a destra
- ☐ B) Asimmetrica negativa (coda a sinistra) senza outlier
- ☐ C) Asimmetrica positiva (coda a destra) senza outlier
- ☐ D) Asimmetrica positiva con outlier a destra
Risposta corretta: C
Soluzione
Calcoliamo l’intervallo interquartile (IQR):
[math]\displaystyle \begin{aligned}
IQR = Q_3 – Q_1 = 45 – 25 = 20
\end{aligned}[/math]
Limiti per outlier:
[math]\displaystyle \begin{aligned}
& \text{Limite inferiore} = Q_1 – 1,5 \cdot IQR = 25 – 30 = -5 \\
& \rightarrow \text{Nessun valore inferiore a -5, quindi nessun outlier a sinistra.} \\ \\
& \text{Limite superiore} = Q_3 + 1,5 \cdot IQR = 45 + 30 = 75 \\
& \rightarrow \text{Il valore massimo osservato è 65 ( < 75),} \\
& \quad \text{quindi nessun outlier a destra.}
\end{aligned}[/math]
Analisi della simmetria:
[math]\displaystyle \begin{aligned}
& \text{Parte centrale: } Q_2 – Q_1 = 10; \quad Q_3 – Q_2 = 10 \\
& \rightarrow \text{Simmetria nel box centrale.} \\ \\
& \text{Lunghezza dei baffi:} \\
& \text{Baffo sinistro} = 25 – 15 = 10 \\
& \text{Baffo destro} = 65 – 45 = 20
\end{aligned}[/math]
Il baffo destro è più lungo → la coda destra è più allungata, indicando asimmetria positiva (coda a destra). Non ci sono outlier, confermando l’opzione C.
💡 Osservazione – In un box plot, se la mediana è più vicina a [math]Q_1[/math] che a [math]Q_3[/math] o se il baffo destro è sensibilmente più lungo del sinistro, la distribuzione è asimmetrica positiva.
Domanda di riflessione – Come si individuano gli outlier in un box plot e perché si usa [math]1,5 \cdot IQR[/math]?
Quesito 5 (Medio/Avanzato) – Coefficiente di correlazione di Pearson
Date due variabili [math]X[/math] e [math]Y[/math], dopo averle centrate sulla propria media si ottengono le seguenti somme:
[math]\displaystyle \begin{aligned}
& \sum (x_i – \bar{x})(y_i – \bar{y}) = -48 \\
& \sum (x_i – \bar{x})^2 = 64 \\
& \sum (y_i – \bar{y})^2 = 100
\end{aligned}[/math]
Calcola il coefficiente di correlazione lineare [math]r[/math] e scegli l’interpretazione corretta.
- ☐ A) [math]r = -0,75[/math]; relazione lineare negativa forte
- ☐ B) [math]r = -0,6[/math]; relazione lineare negativa moderata
- ☐ C) [math]r = 0,6[/math]; relazione lineare positiva moderata
- ☐ D) [math]r = -0,48[/math]; relazione lineare negativa debole
Risposta corretta: B
Soluzione
Formula di Pearson:
[math]\displaystyle \begin{aligned}
r &= \frac{\sum (x_i – \bar{x})(y_i – \bar{y})}{\sqrt{\sum (x_i – \bar{x})^2 \cdot \sum (y_i – \bar{y})^2}} \\ \\
&= \frac{-48}{\sqrt{64 \cdot 100}} \\
&= \frac{-48}{\sqrt{6400}} \\
&= \frac{-48}{80} = -0,6
\end{aligned}[/math]
Interpretazione:
- Segno negativo → correlazione inversa (al crescere di una variabile, l’altra tende a diminuire).
- Modulo 0,6 → generalmente considerata una relazione moderata (compresa nell’intervallo 0,5–0,7).
Quindi la risposta corretta è l’opzione B.
💡 Osservazione – La covarianza al numeratore è [math]-48[/math], ma il suo valore assoluto non è interpretabile senza normalizzazione; [math]r[/math] è un indice adimensionale compreso tra [math]-1[/math] e [math]1[/math].
Domanda di riflessione – Se [math]r = 0[/math], significa che non esiste alcuna relazione tra [math]X[/math] e [math]Y[/math]? Perché?
Risposte alle domande di riflessione
Q1 – Nella formula della mediana per classi si usa [math]\frac{N}{2}[/math] perché la mediana è il valore che lascia alla propria sinistra il 50% delle osservazioni. Si cerca la posizione centrale (rango), non il valore medio calcolato come media aritmetica.
Q2 – Se le medie sono molto vicine, si può confrontare direttamente lo scarto quadratico medio (o la varianza), poiché la variabilità assoluta è confrontabile su scale simili. In questo caso, il [math]CV[/math] diventa superfluo poiché la normalizzazione rispetto alla media non aggiungerebbe informazioni significative per il confronto.
Q3 – Moltiplicando per –2, la varianza viene moltiplicata per [math](-2)^2 = 4[/math]. Il segno negativo non influenza la varianza perché gli scarti dalla media vengono elevati al quadrato, rendendo il fattore moltiplicativo sempre positivo:
[math]\displaystyle \begin{aligned}
Var(cX) = c^2 Var(X)
\end{aligned}[/math]
Q4 – Outlier: sono definiti come i punti che cadono al di fuori dell’intervallo:
[math]\displaystyle \begin{aligned}
[Q_1 – 1,5 \cdot IQR, \quad Q_3 + 1,5 \cdot IQR]
\end{aligned}[/math]
Il fattore 1,5 è una convenzione statistica che, per una distribuzione perfettamente normale, individua circa lo 0,7% dei dati come outlier potenziali (valori oltre le “recinzioni” del box plot).
Q5 – No, [math]r = 0[/math] indica solo l’assenza di una correlazione lineare. Possono esistere relazioni non lineari anche molto forti (paraboliche, periodiche, ecc.) che il coefficiente di Pearson non è in grado di catturare. Per questo motivo è sempre fondamentale analizzare il diagramma a dispersione (scatterplot).
⚠️ Red Flags: I 5 Errori Tipici (da non fare all’esame)
Conoscere le formule è solo metà del lavoro; l’altra metà è evitare le trappole classiche in cui cade il 90% degli studenti. Ecco gli scivoloni più comuni legati agli esercizi che abbiamo appena visto:
- Errore 1 (Sulla Mediana in classi): Usare la frequenza assoluta invece di quella cumulata.Quando cerchi la classe mediana (il posto dove cade il valore [math]\frac{N}{2}[/math]), devi guardare le frequenze cumulate. Se guardi solo la frequenza assoluta più alta, stai cercando la Moda, non la Mediana!
- Errore 2 (Sul Coefficiente di Variazione): Confrontare la varianza di pere e mele.Se devi confrontare la variabilità di due gruppi con medie molto diverse (es. lo stipendio di uno stagista e quello di un CEO), non guardare mai lo Scarto Quadratico Medio da solo. Ti porterà fuori strada. Usa sempre il [math]CV[/math].
- Errore 3 (Sulle proprietà della Varianza): Sommare la costante alla varianza.Se l’esercizio dice “aggiungiamo 10 a tutti i dati”, la media aumenta di 10. La varianza no. Se tutti diventano più ricchi di 10 euro, la distanza (dispersione) tra il più ricco e il più povero rimane identica. La varianza non si fa ingannare dalle traslazioni.
- Errore 4 (Sui Box Plot): Confondere il “baffo” con gli outlier.Il limite del baffo ([math]Q_1 – 1,5 \cdot IQR[/math] o [math]Q_3 + 1,5 \cdot IQR[/math]) è solo un “recinto”. I valori anomali (outlier) sono i punti che finiscono fuori dal recinto. Se l’esercizio ti chiede il valore massimo della distribuzione, controlla sempre se ci sono pallini o asterischi oltre il baffo destro.
- Errore 5 (Su Pearson): Pensare che [math]r = 0[/math] significhi “nessuna relazione assoluta”.Un coefficiente di correlazione [math]r = 0[/math] urla una cosa sola: “Non c’è una relazione lineare (a forma di retta)”. I dati potrebbero comunque formare una perfetta parabola o un cerchio nel grafico. Non confondere mai “assenza di linearità” con “totale indipendenza”.
📌 Ricorda: All’esame, giustifica sempre brevemente perché hai scelto un indice rispetto a un altro. Dimostrare di aver capito la “logica delle 4 dimensioni” vale spesso quanto il risultato numerico stesso.
Perché questi problemi non sono solo teorici
La statistica non è solo un esercizio di calcolo, ma uno strumento per interpretare la realtà. Ecco come i quesiti precedenti si applicano al mondo reale.
Quesito 1 (Mediana per dati in classi) – Il problema dell’informazione persa
Questo esercizio mostra una situazione estremamente realistica (le code alla posta). Nel mondo reale, spesso non abbiamo il database con i 50 tempi esatti di ogni persona, ma solo un report aggregato (es. “12 persone hanno aspettato tra i 20 e i 30 minuti”).
Applicazione: La formula dell’interpolazione lineare insegna un “trucco di sopravvivenza” statistica: come stimare un dato preciso quando l’informazione originale è stata raggruppata per comodità. Assume che gli arrivi siano costanti nel tempo, un principio alla base della teoria delle code.
Quesito 2 (Coefficiente di variazione) – L’illusione dei grandi numeri
Insegna a diffidare della dispersione assoluta. L’azienda Beta ha oscillazioni di stipendio di 400 €, mentre Alfa di 360 €. Un occhio non allenato direbbe che Beta è più “ingiusta” o caotica.
Applicazione: Fondamentale nelle Risorse Umane (HR Analytics) e in finanza. Una variazione di 400 € su uno stipendio da dirigente (2500 €) pesa molto meno della stessa variazione sullo stipendio di un impiegato junior (1800 €). Il [math]CV[/math] è il grande livellatore che permette confronti equi tra scale diverse.
Quesito 3 (Proprietà della varianza) – L’effetto dell’inflazione o dei bonus
L’esercizio dimostra matematicamente una regola sociale ed economica: dare un bonus “a pioggia” di importo fisso (es. 10 € a tutti) aumenta il benessere medio, ma lascia le disuguaglianze esattamente identiche (la varianza rimane 36).
Applicazione: È fondamentale quando si aggiustano i dati per l’inflazione (sommando o sottraendo costanti) o si traslano le scale di misurazione (ad esempio convertendo temperature o punteggi di test standardizzati).
Quesito 4 (Box plot e asimmetria) – Leggere l’anatomia di una popolazione
Molti sanno calcolare la media, ma l’analisi di un Box Plot permette di dedurre l’asimmetria senza visualizzare la curva “a campana”.
Applicazione: Nel controllo qualità o nell’analisi medica. Sapere che non ci sono outlier garantisce l’assenza di errori di misurazione clamorosi. Il fatto che la “coda” destra sia più lunga suggerisce che c’è un gruppo ristretto che “tira” la prestazione verso l’alto, un classico sintomo delle distribuzioni di reddito o dei test d’eccellenza.
Quesito 5 (Correlazione di Pearson) – Oltre la Covarianza
Questo calcolo mostra l’importanza del denominatore nella formula di Pearson per normalizzare la relazione tra due variabili.
Applicazione: Nel machine learning e nelle scienze sociali, la covarianza (qui -48) da sola è difficile da interpretare perché dipende dall’unità di misura. Standardizzando il dato otteniamo [math]r = -0,6[/math], un numero universale che comunica chiaramente una relazione inversa di forza moderata.
Articoli di approfondimento
👉 Data literacy: interpretare grafici statistici
👉 Statistica descrittiva: indici di posizione e dispersione
👉 Media, mediana e moda: guida pratica
👉 Varianza e scarto quadratico medio
👉 Proprietà della varianza e valore atteso
👉 Il boxplot: rappresentare e leggere i dati
👉 Pearson, Spearman o Kendall: quale correlazione scegliere?
(85)
Altri articoli nella categoria "Esercizi svolti di Statistica"
- Indice di Laspeyres: formula, significato ed esercizi svolti
- Regressione lineare: esercizi progressivi dai minimi quadrati alla regressione multipla
- Statistica per il Marketing: Come Usare i Test d’Ipotesi (Z-Test) per A/B Test e ROI
- Analisi Statistica Avanzata: Indice di Gini, Asimmetria e Proprietà dei Residui nella Regressione
- La Città dei Numeri Manipolati: Gioco Interattivo per Riconoscere le Fake News Statistiche
- Media, Mediana e Moda: 8 Esercizi Svolti dalla Base all’Analisi Avanzata
- Data Literacy: 5 Esercizi per non farsi ingannare dai Grafici (Statistica Pratica)
- Data Literacy: Guida Pratica per Interpretare Grafici Statistici (con Esercizi e Soluzioni)
- Come leggere le Tavole Statistiche (Z, t, Chi-quadrato): Guida Completa ed Esempi
- Come scegliere il test statistico giusto per decisioni aziendali: 3 esempi pratici nel Retail
