Esercizi Svolti di Statistica Descrittiva: Mediana, Varianza, Box Plot e Correlazione (Con Spiegazioni)

Cerca nel sito

Altri risultati..

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors

Cerca nelle Categorie

esercizi statistica descrittiva

Studiare statistica spesso si riduce a un’applicazione meccanica di formule, con il rischio di perdere di vista il significato reale dei dati che abbiamo davanti. Quando calcoliamo una mediana o analizziamo la dispersione di un grafico, stiamo in realtà cercando di far raccontare ai numeri una storia concreta: che si tratti dei tempi di attesa alla posta o delle differenze salariali tra due aziende. In questo articolo abbiamo raccolto cinque esercizi svolti di statistica descrittiva.

Non ci limiteremo a fornirti i calcoli nudi e crudi, ma analizzeremo ogni passaggio per capire il perché dietro le formule.

Troverai anche delle domande di riflessione pensate per testare il tuo intuito statistico prima ancora della tua abilità con la calcolatrice. Fogli alla mano, iniziamo.

La Bussola: Le 4 dimensioni della statistica descrittiva

Prima di tuffarci nei calcoli, c’è una cosa fondamentale da sapere. Ogni volta che analizziamo un set di dati, lo facciamo guardandolo attraverso quattro “lenti” o dimensioni specifiche. Se capisci in quale dimensione ti trovi, saprai sempre quale formula usare.

In questo articolo toccheremo tutte e quattro le dimensioni:

  • 1. Posizione (Dove si concentra il fenomeno):Ci dice qual è il “baricentro” dei dati.Strumenti: Media ([math]\mu[/math]), Moda, Mediana.
  • 2. Dispersione (Quanto variano i dati):Ci dice se i dati sono tutti vicini al baricentro o molto sparpagliati.Strumenti: Varianza ([math]\sigma^2[/math]), Scarto Quadratico Medio ([math]\sigma[/math]), Coefficiente di Variazione ([math]CV[/math]).
  • 3. Forma (Che aspetto ha la distribuzione):Ci mostra se i dati sono simmetrici o se “pendono” verso un lato.Strumenti: Asimmetria, Box Plot.
  • 4. Relazione (Come si muovono due fenomeni insieme):Ci dice se e come due variabili si influenzano a vicenda.Strumenti: Covarianza, Correlazione di Pearson ([math]r[/math]).

💡 Consiglio: Non limitarti mai a una sola dimensione. Una media senza la dispersione è come una bussola senza l’ago: ti dice dove sei, ma non dove stai andando.

Quesito 1 (Facile) – Mediana per dati in classi

Un sondaggio sui tempi di attesa (in minuti) di 50 clienti in una filiale postale ha prodotto la seguente distribuzione in classi di ampiezza 10. La classe mediana è 20-30 minuti. La frequenza cumulata precedente la classe mediana è 17, la frequenza della classe mediana è 12. Calcola la mediana approssimata.

  • ☐ A) 24,2 min
  • ☐ B) 25,0 min
  • ☐ C) 26,7 min
  • ☐ D) 28,3 min

Risposta corretta: C) 26,7 min

Soluzione

Formula della mediana per dati raggruppati:

[math]\displaystyle \begin{aligned}
Me = L_{inf} + \frac{\frac{N}{2} – F_{prec}}{f_{med}} \cdot a
\end{aligned}[/math]

dove:

[math]\displaystyle \begin{aligned}
& L_{inf} = 20 \\
& \text{(limite inferiore della classe mediana)} \\
& N = 50 \rightarrow \frac{N}{2} = 25 \\
& \text{(metà del totale delle osservazioni)} \\
& F_{prec} = 17 \\
& \text{(freq. cumulata prima della classe mediana)} \\
& f_{med} = 12 \\
& \text{(frequenza assoluta classe mediana)} \\
& a = 10 \\
& \text{(ampiezza classe)}
\end{aligned}[/math]

Sostituiamo i valori nella formula:

[math]\displaystyle \begin{aligned}
Me &= 20 + \frac{25 – 17}{12} \cdot 10 \\
&= 20 + \frac{8}{12} \cdot 10 \\
&= 20 + 0,6667 \cdot 10 \\
&= 20 + 6,667 = 26,667 \approx 26,7 \text{ min}
\end{aligned}[/math]

💡 Osservazione – La formula interpola linearmente all’interno della classe mediana. È valida se si assume che le osservazioni nella classe siano distribuite uniformemente.

Domanda di riflessione – Perché nella formula si usa [math]\frac{N}{2}[/math] e non la media aritmetica?


 

Quesito 2 (Facile/Medio) – Coefficiente di variazione

Due aziende, Alfa e Beta, presentano i seguenti salari medi mensili e scarti quadratici medi:

  • Alfa: media = 1800 €, sqm = 360 €
  • Beta: media = 2500 €, sqm = 400 €

Quale affermazione è corretta?

  • ☐ A) La variabilità assoluta è maggiore in Beta, quella relativa è maggiore in Alfa
  • ☐ B) La variabilità assoluta è maggiore in Alfa, quella relativa è maggiore in Beta
  • ☐ C) Sia la variabilità assoluta che quella relativa sono maggiori in Beta
  • ☐ D) La variabilità assoluta è maggiore in Beta, quella relativa è uguale

Risposta corretta: A

Soluzione

Variabilità assoluta → confronto diretto degli sqm:

[math]\displaystyle \begin{aligned}
& \text{Alfa: } \sigma = 360 \\
& \text{Beta: } \sigma = 400 \\
& \rightarrow \text{Beta è più variabile in assoluto.}
\end{aligned}[/math]

Ti potrebbe interessare anche:  Statistica. Stimare l'attendibilità di un sondaggio e la numerosità minima del campione

Variabilità relativa → coefficiente di variazione:

[math]\displaystyle \begin{aligned}
& CV = \frac{\sigma}{\mu} \\
& \text{(espresso in % o decimale)}
\end{aligned}[/math]

Calcolo per le due aziende:

[math]\displaystyle \begin{aligned}
& CV_{Alfa} = \frac{360}{1800} = 0,20 = 20\% \\
& CV_{Beta} = \frac{400}{2500} = 0,16 = 16\% \\
& \rightarrow \text{Alfa ha variabilità relativa maggiore.}
\end{aligned}[/math]

Quindi: assoluta maggiore in Beta, relativa maggiore in Alfa → opzione A.

💡 Osservazione – Il [math]CV[/math] è adimensionale e permette confronti tra fenomeni con unità di misura differenti o medie molto diverse.

Domanda di riflessione – Se le due medie fossero molto vicine, quale indice useresti per confrontare la variabilità e perché?


 

Quesito 3 (Medio) – Proprietà della varianza (traslazione)

Un insieme di dati ha media [math]\mu = 50[/math] e varianza [math]\sigma^2 = 36[/math]. Se si aggiunge una costante [math]k = 10[/math] a ogni dato, quali diventano la nuova media e la nuova varianza?

  • ☐ A) Media = 60, varianza = 36
  • ☐ B) Media = 60, varianza = 46
  • ☐ C) Media = 50, varianza = 36
  • ☐ D) Media = 60, varianza = 360

Risposta corretta: A

Soluzione

Proprietà della traslazione:

Aggiungere una costante [math]k[/math] a tutti i dati fa aumentare la media della stessa costante:

[math]\displaystyle \begin{aligned}
\mu’ = \mu + k = 50 + 10 = 60
\end{aligned}[/math]

La varianza (e quindi lo sqm) non cambia perché la dispersione relativa rimane identica:

[math]\displaystyle \begin{aligned}
\sigma’^2 = \sigma^2 = 36
\end{aligned}[/math]

Nessuna opzione alternativa è corretta.

💡 Osservazione – Se invece moltiplichiamo per una costante [math]c[/math], la varianza viene moltiplicata per [math]c^2[/math].

Domanda di riflessione – Cosa succede alla varianza se moltiplichiamo tutti i dati per una costante negativa, ad esempio -2?


 

Quesito 4 (Medio) – Lettura del box plot e asimmetria

Il seguente box plot (realizzato secondo Tukey) rappresenta una distribuzione di punteggi:

box plot ex4

I baffi (whiskers) arrivano rispettivamente a 15 (sinistra) e a 65 (destra). Il primo quartile [math]Q_1 = 25[/math], la mediana [math]Q_2 = 35[/math], il terzo quartile [math]Q_3 = 45[/math]. Quale affermazione descrive meglio la forma?

  • ☐ A) Simmetrica con possibili outlier a destra
  • ☐ B) Asimmetrica negativa (coda a sinistra) senza outlier
  • ☐ C) Asimmetrica positiva (coda a destra) senza outlier
  • ☐ D) Asimmetrica positiva con outlier a destra

Risposta corretta: C

Soluzione

Calcoliamo l’intervallo interquartile (IQR):

[math]\displaystyle \begin{aligned}
IQR = Q_3 – Q_1 = 45 – 25 = 20
\end{aligned}[/math]

Limiti per outlier:

[math]\displaystyle \begin{aligned}
& \text{Limite inferiore} = Q_1 – 1,5 \cdot IQR = 25 – 30 = -5 \\
& \rightarrow \text{Nessun valore inferiore a -5, quindi nessun outlier a sinistra.} \\ \\
& \text{Limite superiore} = Q_3 + 1,5 \cdot IQR = 45 + 30 = 75 \\
& \rightarrow \text{Il valore massimo osservato è 65 ( < 75),} \\
& \quad \text{quindi nessun outlier a destra.}
\end{aligned}[/math]

Analisi della simmetria:

[math]\displaystyle \begin{aligned}
& \text{Parte centrale: } Q_2 – Q_1 = 10; \quad Q_3 – Q_2 = 10 \\
& \rightarrow \text{Simmetria nel box centrale.} \\ \\
& \text{Lunghezza dei baffi:} \\
& \text{Baffo sinistro} = 25 – 15 = 10 \\
& \text{Baffo destro} = 65 – 45 = 20
\end{aligned}[/math]

Il baffo destro è più lungo → la coda destra è più allungata, indicando asimmetria positiva (coda a destra). Non ci sono outlier, confermando l’opzione C.

💡 Osservazione – In un box plot, se la mediana è più vicina a [math]Q_1[/math] che a [math]Q_3[/math] o se il baffo destro è sensibilmente più lungo del sinistro, la distribuzione è asimmetrica positiva.

Domanda di riflessione – Come si individuano gli outlier in un box plot e perché si usa [math]1,5 \cdot IQR[/math]?


 

Quesito 5 (Medio/Avanzato) – Coefficiente di correlazione di Pearson

Date due variabili [math]X[/math] e [math]Y[/math], dopo averle centrate sulla propria media si ottengono le seguenti somme:

[math]\displaystyle \begin{aligned}
& \sum (x_i – \bar{x})(y_i – \bar{y}) = -48 \\
& \sum (x_i – \bar{x})^2 = 64 \\
& \sum (y_i – \bar{y})^2 = 100
\end{aligned}[/math]

Calcola il coefficiente di correlazione lineare [math]r[/math] e scegli l’interpretazione corretta.

  • ☐ A) [math]r = -0,75[/math]; relazione lineare negativa forte
  • ☐ B) [math]r = -0,6[/math]; relazione lineare negativa moderata
  • ☐ C) [math]r = 0,6[/math]; relazione lineare positiva moderata
  • ☐ D) [math]r = -0,48[/math]; relazione lineare negativa debole

Risposta corretta: B

Soluzione

Formula di Pearson:

[math]\displaystyle \begin{aligned}
r &= \frac{\sum (x_i – \bar{x})(y_i – \bar{y})}{\sqrt{\sum (x_i – \bar{x})^2 \cdot \sum (y_i – \bar{y})^2}} \\ \\
&= \frac{-48}{\sqrt{64 \cdot 100}} \\
&= \frac{-48}{\sqrt{6400}} \\
&= \frac{-48}{80} = -0,6
\end{aligned}[/math]

Ti potrebbe interessare anche:  Indici relativi di variabilità , asimmetria e curtosi in breve con esempi

Interpretazione:

  • Segno negativo → correlazione inversa (al crescere di una variabile, l’altra tende a diminuire).
  • Modulo 0,6 → generalmente considerata una relazione moderata (compresa nell’intervallo 0,5–0,7).

Quindi la risposta corretta è l’opzione B.

💡 Osservazione – La covarianza al numeratore è [math]-48[/math], ma il suo valore assoluto non è interpretabile senza normalizzazione; [math]r[/math] è un indice adimensionale compreso tra [math]-1[/math] e [math]1[/math].

Domanda di riflessione – Se [math]r = 0[/math], significa che non esiste alcuna relazione tra [math]X[/math] e [math]Y[/math]? Perché?


 

Risposte alle domande di riflessione

Q1 – Nella formula della mediana per classi si usa [math]\frac{N}{2}[/math] perché la mediana è il valore che lascia alla propria sinistra il 50% delle osservazioni. Si cerca la posizione centrale (rango), non il valore medio calcolato come media aritmetica.


Q2 – Se le medie sono molto vicine, si può confrontare direttamente lo scarto quadratico medio (o la varianza), poiché la variabilità assoluta è confrontabile su scale simili. In questo caso, il [math]CV[/math] diventa superfluo poiché la normalizzazione rispetto alla media non aggiungerebbe informazioni significative per il confronto.


Q3 – Moltiplicando per –2, la varianza viene moltiplicata per [math](-2)^2 = 4[/math]. Il segno negativo non influenza la varianza perché gli scarti dalla media vengono elevati al quadrato, rendendo il fattore moltiplicativo sempre positivo:

[math]\displaystyle \begin{aligned}
Var(cX) = c^2 Var(X)
\end{aligned}[/math]


Q4 – Outlier: sono definiti come i punti che cadono al di fuori dell’intervallo:

[math]\displaystyle \begin{aligned}
[Q_1 – 1,5 \cdot IQR, \quad Q_3 + 1,5 \cdot IQR]
\end{aligned}[/math]

Il fattore 1,5 è una convenzione statistica che, per una distribuzione perfettamente normale, individua circa lo 0,7% dei dati come outlier potenziali (valori oltre le “recinzioni” del box plot).


Q5 – No, [math]r = 0[/math] indica solo l’assenza di una correlazione lineare. Possono esistere relazioni non lineari anche molto forti (paraboliche, periodiche, ecc.) che il coefficiente di Pearson non è in grado di catturare. Per questo motivo è sempre fondamentale analizzare il diagramma a dispersione (scatterplot).


⚠️ Red Flags: I 5 Errori Tipici (da non fare all’esame)

Conoscere le formule è solo metà del lavoro; l’altra metà è evitare le trappole classiche in cui cade il 90% degli studenti. Ecco gli scivoloni più comuni legati agli esercizi che abbiamo appena visto:


  • Errore 1 (Sulla Mediana in classi): Usare la frequenza assoluta invece di quella cumulata.Quando cerchi la classe mediana (il posto dove cade il valore [math]\frac{N}{2}[/math]), devi guardare le frequenze cumulate. Se guardi solo la frequenza assoluta più alta, stai cercando la Moda, non la Mediana!
  • Errore 2 (Sul Coefficiente di Variazione): Confrontare la varianza di pere e mele.Se devi confrontare la variabilità di due gruppi con medie molto diverse (es. lo stipendio di uno stagista e quello di un CEO), non guardare mai lo Scarto Quadratico Medio da solo. Ti porterà fuori strada. Usa sempre il [math]CV[/math].
  • Errore 3 (Sulle proprietà della Varianza): Sommare la costante alla varianza.Se l’esercizio dice “aggiungiamo 10 a tutti i dati”, la media aumenta di 10. La varianza no. Se tutti diventano più ricchi di 10 euro, la distanza (dispersione) tra il più ricco e il più povero rimane identica. La varianza non si fa ingannare dalle traslazioni.
  • Errore 4 (Sui Box Plot): Confondere il “baffo” con gli outlier.Il limite del baffo ([math]Q_1 – 1,5 \cdot IQR[/math] o [math]Q_3 + 1,5 \cdot IQR[/math]) è solo un “recinto”. I valori anomali (outlier) sono i punti che finiscono fuori dal recinto. Se l’esercizio ti chiede il valore massimo della distribuzione, controlla sempre se ci sono pallini o asterischi oltre il baffo destro.
  • Errore 5 (Su Pearson): Pensare che [math]r = 0[/math] significhi “nessuna relazione assoluta”.Un coefficiente di correlazione [math]r = 0[/math] urla una cosa sola: “Non c’è una relazione lineare (a forma di retta)”. I dati potrebbero comunque formare una perfetta parabola o un cerchio nel grafico. Non confondere mai “assenza di linearità” con “totale indipendenza”.
Ti potrebbe interessare anche:  Distribuzione Esponenziale: Esercizi Pratici e Soluzioni Dettagliate per Comprendere Tempi di Attesa e Guasti

📌 Ricorda: All’esame, giustifica sempre brevemente perché hai scelto un indice rispetto a un altro. Dimostrare di aver capito la “logica delle 4 dimensioni” vale spesso quanto il risultato numerico stesso.

 Perché questi problemi non sono solo teorici

La statistica non è solo un esercizio di calcolo, ma uno strumento per interpretare la realtà. Ecco come i quesiti precedenti si applicano al mondo reale.

Quesito 1 (Mediana per dati in classi) – Il problema dell’informazione persa

Questo esercizio mostra una situazione estremamente realistica (le code alla posta). Nel mondo reale, spesso non abbiamo il database con i 50 tempi esatti di ogni persona, ma solo un report aggregato (es. “12 persone hanno aspettato tra i 20 e i 30 minuti”).

Applicazione: La formula dell’interpolazione lineare insegna un “trucco di sopravvivenza” statistica: come stimare un dato preciso quando l’informazione originale è stata raggruppata per comodità. Assume che gli arrivi siano costanti nel tempo, un principio alla base della teoria delle code.


Quesito 2 (Coefficiente di variazione) – L’illusione dei grandi numeri

Insegna a diffidare della dispersione assoluta. L’azienda Beta ha oscillazioni di stipendio di 400 €, mentre Alfa di 360 €. Un occhio non allenato direbbe che Beta è più “ingiusta” o caotica.

Applicazione: Fondamentale nelle Risorse Umane (HR Analytics) e in finanza. Una variazione di 400 € su uno stipendio da dirigente (2500 €) pesa molto meno della stessa variazione sullo stipendio di un impiegato junior (1800 €). Il [math]CV[/math] è il grande livellatore che permette confronti equi tra scale diverse.


Quesito 3 (Proprietà della varianza) – L’effetto dell’inflazione o dei bonus

L’esercizio dimostra matematicamente una regola sociale ed economica: dare un bonus “a pioggia” di importo fisso (es. 10 € a tutti) aumenta il benessere medio, ma lascia le disuguaglianze esattamente identiche (la varianza rimane 36).

Applicazione: È fondamentale quando si aggiustano i dati per l’inflazione (sommando o sottraendo costanti) o si traslano le scale di misurazione (ad esempio convertendo temperature o punteggi di test standardizzati).


Quesito 4 (Box plot e asimmetria) – Leggere l’anatomia di una popolazione

Molti sanno calcolare la media, ma l’analisi di un Box Plot permette di dedurre l’asimmetria senza visualizzare la curva “a campana”.

Applicazione: Nel controllo qualità o nell’analisi medica. Sapere che non ci sono outlier garantisce l’assenza di errori di misurazione clamorosi. Il fatto che la “coda” destra sia più lunga suggerisce che c’è un gruppo ristretto che “tira” la prestazione verso l’alto, un classico sintomo delle distribuzioni di reddito o dei test d’eccellenza.


Quesito 5 (Correlazione di Pearson) – Oltre la Covarianza

Questo calcolo mostra l’importanza del denominatore nella formula di Pearson per normalizzare la relazione tra due variabili.

Applicazione: Nel machine learning e nelle scienze sociali, la covarianza (qui -48) da sola è difficile da interpretare perché dipende dall’unità di misura. Standardizzando il dato otteniamo [math]r = -0,6[/math], un numero universale che comunica chiaramente una relazione inversa di forza moderata.

 

(85)

PubblicitàPubblicità