Avete presente quella sensazione di smarrimento davanti a una slide proiettata in sala riunioni?
C’è un grafico coloratissimo, il relatore parla veloce di “trend positivi”, ma a voi i conti non tornano.
Oppure, leggete un report dove la media sembra perfetta, ma nasconde un disastro sotto il tappeto.
Saper leggere i dati non significa solo fare i calcoli, significa capire cosa il grafico ci sta dicendo (e cosa sta provando a nasconderci).
In questi 5 esercizi andiamo a vedere come questi concetti si applicano nella vita reale, dal budget familiare al controllo qualità industriale, per trasformare i numeri in intuizioni.
Esercizio 5 – Leggere percentuali da un grafico a torta con dati esterni
Un grafico a torta mostra la ripartizione delle spese mensili di una famiglia in 5 categorie:
Affitto (35%), Alimentari (20%), Trasporti (15%), Risparmio (10%), Varie (20%). In un mese particolare, la spesa per “Varie” è stata di 600€.
Qual era la spesa totale mensile della famiglia?
- A. 2400 € □
- B. 3000 € □
- C. 3500 € □
- D. 5000 € □

Soluzione
Risposta corretta: B. 3000 €
Spiegazione: La categoria “Varie” rappresenta il 20% della spesa totale. Se 600€ corrispondono al 20%, allora l’1% corrisponde a:
[math]600 / 20 = 30 \text{ €}[/math]
La spesa totale (100%) sarà quindi:
[math]30 \cdot 100 = 3000 \text{ €}[/math]
In formula:
[math]\displaystyle \begin{aligned}
\text{Totale} &= \frac{\text{Valore Noto}}{\text{Percentuale}} \cdot 100 \
&= \frac{600}{20} \cdot 100 = 3000
\end{aligned}[/math]
Richiamo teorico: Un grafico a torta (o areogramma) rappresenta le proporzioni di un tutto. Per risalire al totale, si usa la proporzione:
[math]\text{Parte} : \text{Percentuale} = \text{Totale} : 100[/math]
💡 Osservazione: Questo esercizio combina la lettura del grafico con un semplice calcolo proporzionale.
Il grafico a torta inganna (spesso)
I grafici a torta sono spesso il rifugio di chi vuole comunicare in modo vago. La categoria “Varie” al 20% è un campanello d’allarme gestionale: stiamo buttando un quinto del budget in un “buco nero” non classificato. Se vedete una fetta “Altro” troppo grande in un report aziendale, lì si nascondono le inefficienze (o i costi che non si vogliono mostrare). E ricordate: se dovete confrontare dati precisi, usate un grafico a barre. Il nostro cervello fatica a confrontare gli angoli, ma è bravissimo con le lunghezze.
Esercizio 6 – Calcolo di una frequenza cumulata relativa da un istogramma
Dall’istogramma dell’Esercizio 1, qual è la percentuale approssimativa di consegne che hanno impiegato meno di 30 minuti?
- A. 25% □
- B. 50% □
- C. 70% □
- D. 90% □

Soluzione
Risposta corretta: C. 70%
Spiegazione: Le consegne che hanno impiegato meno di 30 minuti sono quelle nelle prime tre classi: 0-10 (5), 10-20 (12), 20-30 (18).
[math]\displaystyle \begin{aligned}
\text{Somma frequenze} &= 5 + 12 + 18 = 35 \\
&{} \quad \text{(Numero di consegne entro i 30 minuti)}
\end{aligned}[/math]
Il numero totale di osservazioni è 50 ([math]5+12+18+10+5[/math]). La frequenza relativa cumulata è:
[math]\displaystyle \begin{aligned}
\text{Frequenza relativa} &= \frac{35}{50} = 0.7 \\
&{} \quad \text{ovvero il 70%}
\end{aligned}[/math]
Richiamo teorico: La frequenza cumulata (assoluta o relativa) si ottiene sommando le frequenze di tutte le classi fino a quella di interesse.
💡 Osservazione: La somma delle frequenze relative di tutte le classi deve sempre essere 1 (o 100%).
L’occhio dell’Analista:
Questo è il pane quotidiano per chi si occupa di SLA (Service Level Agreements). Dire “la media delle consegne è 25 minuti” non basta. Se il contratto dice che il 90% deve arrivare entro mezz’ora e noi siamo al 70%, stiamo perdendo clienti, anche se la “media” sembra buona. Il grafico delle frequenze cumulate (l’ogiva) è lo strumento principe per rispondere alla domanda: “Quanti clienti ho soddisfatto fino a questo momento?”.
Esercizio 7 – Identificare outlier in un box-plot
Da un box-plot che rappresenta il consumo in km/l di 40 automobili, si ricava: [math]Q_1 = 12 \text{ km/l}[/math], Mediana = 14 km/l, [math]Q_3 = 16 \text{ km/l}[/math]. Il range interquartile ([math]IQR[/math]) è 4 km/l. Secondo la regola standard (soglia a [math]1.5 \cdot IQR[/math]), quale dei seguenti valori sarebbe considerato un outlier?
- A. 5 km/l □
- B. 10 km/l □
- C. 18 km/l □
- D. 19 km/l □

Soluzione
Risposta corretta: A. 5 km/l
Spiegazione:
[math]\displaystyle \begin{aligned}
IQR &= Q_3 – Q_1 = 16 – 12 = 4 \text{ km/l} \\
\text{Soglia per gli outlier inferiori} &= Q_1 – 1.5 \cdot IQR \\
&= 12 – (1.5 \cdot 4) = 12 – 6 = 6 \text{ km/l} \\
\text{Soglia per gli outlier superiori} &= Q_3 + 1.5 \cdot IQR \\
&= 16 + 6 = 22 \text{ km/l}
\end{aligned}[/math]
Un valore è un outlier se è inferiore a 6 o superiore a 22.
Identificazione degli Outlier
In statistica, l’identificazione dei valori anomali (outlier) avviene solitamente attraverso il calcolo di “recinti” (fences) basati sul Range Interquartile (IQR).
Ecco i diversi livelli di severità utilizzati nei software statistici:
| Tipo di Outlier | Soglia (Filtro) | Severità |
|---|---|---|
| Outlier Lievi (Mild) | [math]1.5 \cdot IQR[/math] | Identifica valori insoliti ma possibili. |
| Outlier Estremi (Extreme) | [math]3 \cdot IQR[/math] | Indica valori altamente improbabili (potenziali errori). |
Per determinare i limiti oltre i quali un dato [math]x[/math] è considerato outlier, si utilizzano le seguenti espressioni:
Limite Inferiore (Lower Fence):
[math]L_i = Q_1 – (k \cdot IQR)[/math]
Limite Superiore (Upper Fence):
[math]L_s = Q_3 + (k \cdot IQR)[/math]
[math]\displaystyle \begin{aligned}
\text{Dove } k = 1.5 &: \text{Outlier lievi} \\
\text{Dove } k = 3 &: \text{Outlier estremi}
\end{aligned}[/math]
Nota pratica:
Nel box-plot standard (diagramma a scatola e baffi), i baffi si estendono generalmente fino all’ultimo dato non-outlier entro il limite di [math]1.5 \cdot IQR[/math]. Qualsiasi punto oltre questa distanza viene disegnato individualmente (spesso con un cerchietto o un asterisco).
Richiamo teorico: Il box-plot visualizza gli outlier come punti isolati al di fuori dei “baffi”, che si estendono fino all’ultimo dato che non supera le soglie di [math]1.5 \cdot IQR[/math] dai quartili.
💡 Osservazione: La regola del [math]1.5 \cdot IQR[/math] è convenzionale ma arbitraria. Identifica punti “degni di approfondimento”, non necessariamente errori.
Attenzione:
Un’auto che fa 5 km/l in un gruppo che ne fa mediamente 14 non è solo un “dato da scartare”. Potrebbe essere una Ferrari in mezzo alle utilitarie (errore di campionamento), oppure un motore rotto (guasto da segnalare). Nel Machine Learning e nella Fraud Detection, gli outlier sono la parte più preziosa: sono la transazione fraudolenta in mezzo a mille lecite, o il macchinario che sta per rompersi. Mai cancellare un outlier senza avergli chiesto “perché sei qui?”.
Esercizio 8 – Effetto di una trasformazione lineare su media, mediana e deviazione standard
Un’azienda misura il tempo (in secondi) necessario a una macchina per completare un ciclo di produzione. I valori medi e di dispersione rilevati sono:
- Media: 12 secondi
- Mediana: 11.5 secondi
- Deviazione standard: 3 secondi
Per esigenze di reportistica, il responsabile decide di convertire i tempi in millisecondi, applicando la trasformazione:
[math]T_{ms} = 1000 \cdot T_s[/math]
Quali saranno i nuovi valori di media, mediana e deviazione standard?
- A. Media = 12, Mediana = 11.5, Dev. Std = 3
- B. Media = 12000, Mediana = 11500, Dev. Std = 3000
- C. Media = 12000, Mediana = 11500, Dev. Std = 3
- D. Media = 12, Mediana = 11.5, Dev. Std = 3000
Soluzione
Risposta corretta: B. Media = 12000, Mediana = 11500, Dev. Std = 3000
Spiegazione
La trasformazione applicata è lineare:
[math]T_{ms} = a \cdot T_s + b[/math]
Nel nostro caso: [math]a = 1000[/math] e [math]b = 0[/math].
Le trasformazioni lineari hanno effetti molto precisi sugli indici statistici:
1. Media
[math]\mu_{ms} = a \cdot \mu_s + b = 1000 \cdot 12 = 12000[/math]
2. Mediana
La mediana si trasforma esattamente come la media:
[math]\text{Mediana}_{ms} = 1000 \cdot 11.5 = 11500[/math]
3. Deviazione standard
La deviazione standard non è influenzata da traslazioni ([math]b[/math]), ma scala con il fattore moltiplicativo ([math]a[/math]):
[math]\sigma_{ms} = |a| \cdot \sigma_s = 1000 \cdot 3 = 3000[/math]
Richiamo teorico
Per una trasformazione lineare [math]Y = aX + b[/math]:
| Indice | Effetto |
|---|---|
| Media | [math]a\mu + b[/math] |
| Mediana | [math]a \cdot \text{Mediana} + b[/math] |
| Moda | [math]a \cdot \text{Moda} + b[/math] |
| Deviazione standard | [math]|a|\sigma[/math] |
| Varianza | [math]a^2\sigma^2[/math] |
| Asimmetria | invariata |
| Correlazione | invariata |
💡 La forma della distribuzione non cambia. Cambiano solo le unità di misura.

Osservazione critica
Questo esercizio è fondamentale perché smonta un errore comune: molti credono che cambiare unità di misura alteri la variabilità “reale” del processo.
In realtà:
- la macchina non è diventata più instabile
- non ha iniziato a produrre con maggiore dispersione
- non è cambiato nulla nel processo fisico
È cambiata solo la scala numerica. Eppure, nei report aziendali, una deviazione standard che passa da 3 a 3000 può spaventare chi non conosce la matematica delle trasformazioni.
👉 È un esempio perfetto di come i numeri possano ingannare senza mentire.
Domanda di riflessione
Se invece della trasformazione [math]T_{ms} = 1000T[/math] avessimo applicato:
[math]T’ = 1000T + 500[/math]
quale indice sarebbe rimasto invariato?
Risposta: La deviazione standard (e la varianza). Le traslazioni (il +500) non modificano la dispersione.
Esercizio 9 – Confronto di variabilità da box-plot affiancati
Due box-plot affiancati rappresentano i tempi di reazione (in millisecondi) di due gruppi di persone in due condizioni sperimentali diverse (X e Y).
- Gruppo X: box molto stretto ([math]Q_1[/math] e [math]Q_3[/math] vicini), baffi molto lunghi
- Gruppo Y: box più largo, baffi più corti
Quale affermazione è corretta?
- A. Il gruppo X ha una variabilità complessiva maggiore del gruppo Y.
- B. Il gruppo Y ha una variabilità complessiva maggiore del gruppo X.
- C. La variabilità è la stessa perché il range totale è simile in entrambi i gruppi.
- D. Il gruppo X ha una variabilità minore all’interno del 50% centrale dei dati.
✔ Soluzione
Risposta corretta: D. Il gruppo X ha una variabilità minore all’interno del 50% centrale dei dati.
Spiegazione
Il box-plot separa la dispersione in due livelli:
- Dispersione interna (IQR): la larghezza del box
- Dispersione esterna: lunghezza dei baffi e presenza di outlier
Nel gruppo X:
- il box è stretto [math]\rightarrow[/math] poca variabilità nel 50% centrale
- i baffi sono lunghi [math]\rightarrow[/math] grande dispersione nei valori estremi
Nel gruppo Y:
- il box è largo [math]\rightarrow[/math] più variabilità nel cuore della distribuzione
- i baffi sono corti [math]\rightarrow[/math] meno dispersione nelle code
L’unica affermazione che possiamo sostenere con certezza è quella sull’IQR: il gruppo X è più “stabile” al centro, ma più “rischioso” nelle code.

🔍 L’occhio dell’Analista
Immagina due processi produttivi:
- Gruppo X: una linea robotizzata
- estremamente precisa nella maggior parte dei cicli (box stretto)
- ma soggetta a rari malfunzionamenti gravi (baffi lunghi)
- Gruppo Y: un lavoro artigianale
- più variabile nel quotidiano (box largo)
- ma senza errori catastrofici (baffi corti)
Il box-plot ti dice dove si concentra il rischio: nel cuore del processo o nelle sue eccezioni.
📘 Richiamo teorico
Il box-plot visualizza:
- Mediana
- [math]Q_1[/math] e [math]Q_3[/math]
- [math]IQR = Q_3 – Q_1 \rightarrow[/math] dispersione robusta
- Baffi [math]\rightarrow[/math] estensione dei dati non-outlier
- Outlier [math]\rightarrow[/math] punti oltre [math]1.5 \times IQR[/math]
L’IQR è una misura robusta perché ignora gli estremi. Il range totale, invece, è fragile: basta un valore anomalo per farlo esplodere.
💡 Osservazione
Un box stretto con baffi lunghi suggerisce:
- forte concentrazione dei dati attorno alla mediana
- code pesanti
- possibile presenza di outlier significativi
È la firma delle distribuzioni “tranquille al centro, turbolente ai margini”.
Domanda di Riflessione
Quale indice statistico è rappresentato dalla lunghezza del box?
Risposta:
L’IQR (InterQuartile Range), calcolato come:
[math]IQR = Q_3 – Q_1[/math]
È una misura di dispersione robusta, insensibile agli outlier.
Perché questo esercizio è didatticamente prezioso
- Forma vs Sintesi: Mostra che la variabilità non è un singolo numero: esiste una variabilità “core” ([math]IQR[/math]) e una variabilità “di coda” (range).
- Rischio nascosto: Un processo può sembrare stabile “in media”, ma essere pericoloso nelle code. È il caso del gruppo X.
- Decision-making reale: Per un analista del rischio (assicurazioni, qualità, finanza), il Gruppo X è più preciso ma più rischioso, mentre il Gruppo Y è meno preciso ma più affidabile.
Perché questi esercizi sono interessanti?
L’inganno delle proporzioni (Esercizio 5):
Questo esercizio allena al “Reverse Engineering” dei dati. Spesso, nelle news finanziarie o politiche, ci viene dato solo il valore assoluto di una sottocategoria per impressionarci (“Spesi 600 milioni!”). Senza risalire al totale (il contesto), quel numero è privo di significato. L’esercizio costringe a cercare il denominatore mancante.
La soglia di dolore (Esercizio 6 – Istogramma):
Il calcolo della frequenza cumulata è la base per definire i KPI (Key Performance Indicators). Nel mondo reale, la media è una metrica di vanità. Sapere che il “70% degli utenti attende meno di 30 minuti” è un dato azionabile per il customer service, molto più della media aritmetica che potrebbe essere falsata da pochi utenti velocissimi.
La pulizia dei dati (Esercizio 7 – Outlier):
Questo è l’esercizio più “pericoloso”. Insegna una regola meccanica ([math]1.5 \times IQR[/math]), ma apre il dibattito sulla Data Quality. Nella Data Science moderna, la decisione automatica di tagliare gli outlier è spesso causa di modelli predittivi poveri che falliscono di fronte agli eventi rari (Cigni Neri). L’esercizio è utile per imparare a identificarli, non necessariamente per eliminarli.
Invarianza e Scala (Esercizio 8):
Fondamentale per chi si approccia al Machine Learning. Capire che la standard deviation “scala” con i dati aiuta a comprendere perché, ad esempio, non possiamo confrontare la variabilità del prezzo di un titolo azionario (in euro) con la variabilità dei tassi di interesse (in percentuale) senza prima normalizzarli.
Forma vs Sintesi (Esercizio 9):
Questo esercizio distrugge il mito che “meno variabilità” sia sempre meglio o facile da definire. Mostra che la varianza non è un numero unico: c’è una varianza “core” ([math]IQR[/math]) e una varianza “di coda” (Range). Per un analista del rischio (es. assicurazioni), il Gruppo X (baffi lunghi) è molto più rischioso del Gruppo Y, anche se “in media” è più stabile.
Data Visualization & Storytelling
📊 Rappresentazione dei dati: il boxplot
📊 Statistica: percentili e quartili – come si calcolano
📊 Media, mediana e moda – guida pratica con esempi reali
📊 Guida alla data visualization 2025: scegliere i grafici per BI
📊 Principi base di visualizzazione efficace & scegliere il grafico giusto
📊 Data storytelling: 6 esercizi pratici con Python
📊 Data storytelling: semiotica visiva e sociale per grafici efficaci
(134)
Altri articoli nella categoria "Esercizi svolti di Statistica"
- Indice di Laspeyres: formula, significato ed esercizi svolti
- Regressione lineare: esercizi progressivi dai minimi quadrati alla regressione multipla
- Statistica per il Marketing: Come Usare i Test d’Ipotesi (Z-Test) per A/B Test e ROI
- Analisi Statistica Avanzata: Indice di Gini, Asimmetria e Proprietà dei Residui nella Regressione
- Esercizi Svolti di Statistica Descrittiva: Mediana, Varianza, Box Plot e Correlazione (Con Spiegazioni)
- La Città dei Numeri Manipolati: Gioco Interattivo per Riconoscere le Fake News Statistiche
- Media, Mediana e Moda: 8 Esercizi Svolti dalla Base all’Analisi Avanzata
- Data Literacy: Guida Pratica per Interpretare Grafici Statistici (con Esercizi e Soluzioni)
- Come leggere le Tavole Statistiche (Z, t, Chi-quadrato): Guida Completa ed Esempi
- Come scegliere il test statistico giusto per decisioni aziendali: 3 esempi pratici nel Retail