Teorema del Limite Centrale: spiegazione semplice, esempi reali ed esercizi svolti

Cerca nel sito

Altri risultati..

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors

Cerca nelle Categorie

Teorema del Limite Centrale

Percorso TLC: Dalla Teoria alla Realtà

A volte ci fidiamo dei numeri senza sapere davvero perché funzionano. Guardiamo una media, un sondaggio, un tempo di attesa e pensiamo: “Ok, sarà più o meno così”.

Eppure dietro questa sicurezza c’è un meccanismo sorprendente: anche quando i dati sono disordinati, irregolari o imprevedibili, le loro medie diventano incredibilmente stabili.

È uno di quei casi in cui la matematica sembra quasi fare un atto di magia.

E questa “magia” ha un nome: Teorema del Limite Centrale.

In questo percorso vediamo come funziona davvero, perché è così potente e come si applica a situazioni reali, dai pacchetti di patatine ai sondaggi politici, passando per i tempi di attesa e le visualizzazioni di un video virale.

Il Teorema del Limite Centrale spiegato semplice

Immagina di avere una popolazione con una certa caratteristica (l’altezza delle persone, il tempo di attesa al semaforo, il peso di un prodotto). Il TLC dice una cosa straordinaria:

Se prendi tanti campioni casuali da questa popolazione e per ogni campione calcoli la media, la distribuzione di tutte queste medie campionarie avrà sempre una forma a campana (normale), indipendentemente dalla forma della distribuzione originale.

E non solo: più grande è il campione, più questa distribuzione a campana sarà perfetta.

Perché è così importante?

Perché nel mondo reale:

  • Non conosciamo quasi mai la vera distribuzione dei fenomeni (sono spesso strane, asimmetriche, irregolari).
  • Grazie al TLC possiamo comunque fare previsioni e calcolare probabilità sulla media di un campione, usando le proprietà della curva normale.

Esempio 1: Il gioco dei dadi (distribuzione uniforme)

La situazione:

Prendiamo un dado classico a 6 facce. La distribuzione dei singoli lanci è uniforme: ogni numero da 1 a 6 ha la stessa probabilità [math]1/6[/math]. Non c’è nessuna “campana” qui.

Cosa dice il TLC?

  • Se lanciamo il dado una volta, il risultato è puramente casuale.
  • Se lanciamo il dado 2 volte e facciamo la media, i risultati possibili ([math]1.0, 1.5, 2.0, \dots , 6.0[/math]) iniziano ad addensarsi verso il centro ([math]3.5[/math]).
  • Se lanciamo il dado 30 volte e facciamo la media, questa media sarà quasi sempre molto vicina a [math]3.5[/math], e se ripetessimo questo processo molte volte, la distribuzione di queste medie sarebbe praticamente una curva normale.

In pratica:

Immagina di essere il gestore di un casinò e vuoi capire quanto vinci in media per partita. Anche se ogni singolo lancio è imprevedibile, il TLC ti dice che su molte partite la vincita media per lancio si comporterà come una variabile normale. Puoi quindi calcolare la probabilità di perdere soldi in una serata.

Esempio 2: Il tempo di attesa all’autobus (distribuzione esponenziale)

La situazione:

Gli autobus passano ogni 10 minuti in media, ma il tempo di attesa alla fermata segue una distribuzione esponenziale. Questo significa che:

  • È molto probabile aspettare poco (es. 1-2 minuti).
  • È raro, ma possibile, aspettare molto (es. 15-20 minuti).
  • La distribuzione è fortemente asimmetrica (coda lunga a destra).

Cosa dice il TLC?

  • Se osservi una singola persona, il suo tempo di attesa è imprevedibile e segue la distribuzione esponenziale.
  • Ma se osservi 40 persone e calcoli il loro tempo medio di attesa, questa media avrà una distribuzione normale.

In pratica:

Un’azienda di trasporti vuole valutare la soddisfazione dei clienti. Anche se i singoli tempi di attesa sono irregolari, il TLC permette di affermare che la media dei tempi di attesa di 40 clienti si distribuisce normalmente. Possono quindi calcolare la probabilità che il tempo medio superi una certa soglia di tolleranza.

Esempio 3: Il controllo qualità (distribuzione sconosciuta)

La situazione:

Una fabbrica produce sacchetti di caramelle. Il peso di ogni sacchetto varia per mille motivi (temperatura, umidità, macchinari). La distribuzione dei pesi è sconosciuta e probabilmente strana.

Cosa dice il TLC?

  • Un singolo sacchetto potrebbe pesare molto o poco.
  • Ma se prendi un campione di 50 sacchetti e ne calcoli il peso medio, questa media sarà molto affidabile e seguirà una distribuzione normale.

In pratica:

Il controllo qualità preleva 50 sacchetti ogni ora. La legge impone che il peso medio sia di almeno 100g. Grazie al TLC, sanno che la media campionaria è normale. Se la media del campione è 98g, possono calcolare la probabilità che sia successo per caso (e quindi il macchinario funzioni ancora bene) o se invece il macchinario si è davvero guastato.

Ti potrebbe interessare anche:  Le Disposizioni semplici

Esempio 4: Il sondaggio politico (distribuzione bernoulliana)

La situazione:

In un paese, il 40% degli elettori è favorevole a una certa legge. Ogni singolo elettore è un “sì” (1) o un “no” (0). La distribuzione originale è la più semplice possibile: solo due valori.

Cosa dice il TLC?

  • Chiedere a una persona è come lanciare una moneta truccata.
  • Ma intervistare 1000 persone e calcolare la proporzione di sì nel campione: questa proporzione seguirà una distribuzione normale, centrata attorno al vero 40%.

In pratica:

I sondaggisti possono dare un margine di errore. Diranno: “Il candidato è al 42%, con un margine di errore del 3%”. Questo margine deriva proprio dal TLC: sanno che la proporzione campionaria si distribuisce normalmente, e quindi possono calcolare un intervallo in cui cade il vero valore con una certa probabilità (es. 95%).

Punti chiave da ricordare

  • ✅ Non importa la forma originale (uniforme, esponenziale, a U, sconosciuta): la media di tanti dati tende a una normale.
  • ✅ Più grande è il campione, migliore è l’approssimazione. La regola:
    [math]\displaystyle \begin{aligned}
    n \ge 30
    \end{aligned}[/math]
    E’ spesso sufficiente, ma dipende da quanto è “strana” la distribuzione originale.
  • ✅ Il TLC non parla dei singoli dati, ma delle medie (o delle somme) di tanti dati.
  • ✅ È il motivo per cui la curva normale è così onnipresente in natura e in statistica: molti fenomeni sono il risultato della somma di tanti piccoli effetti casuali.

Esercizio 1: Il tempo di attesa al drive-through (Facile)

Testo del problema:
Un famoso fast-food promette che il 90% dei clienti viene servito al drive-through in meno di 5 minuti. Sebbene la distribuzione dei tempi di attesa sia chiaramente asimmetrica (non può essere negativa e ha una coda lunga a destra), il manager sa che la media effettiva è di 3 minuti con una deviazione standard di 1.5 minuti. Per verificare la qualità del servizio, un ispettore osserva un campione casuale di 36 automobili. Qual è la probabilità che il tempo medio di attesa del campione superi i 3.5 minuti?

💡 Osservazione Teorica: Il TLC ci viene in soccorso proprio quando la distribuzione originale non è normale. Esso afferma che, per un campione sufficientemente grande (solitamente [math]n \ge 30[/math]), la distribuzione della media campionaria [math]\bar{X}[/math] tende a una distribuzione normale, indipendentemente dalla forma della distribuzione della popolazione.

Risoluzione

1. Identificazione dei parametri

  • Media popolazione: [math]\mu = 3[/math]
  • Deviazione standard popolazione: [math]\sigma = 1.5[/math]
  • Numerosità campionaria: [math]n = 36[/math]
  • Valore soglia: [math]\bar{X} > 3.5[/math]

2. Parametri della distribuzione campionaria

La media della distribuzione campionaria è identica a quella della popolazione: [math]\mu_{\bar{X}} = \mu = 3[/math].
L’errore standard (la deviazione standard delle medie) è:

[math]\displaystyle \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} = \frac{1.5}{\sqrt{36}} = \frac{1.5}{6} = 0.25[/math]

Per il TLC, possiamo approssimare: [math]\bar{X} \sim N(3, 0.25)[/math].

3. Standardizzazione e Calcolo (Z-score)

Vogliamo trovare [math]P(\bar{X} > 3.5)[/math]. Calcoliamo quanto dista 3.5 dalla media in termini di errori standard:

[math]\displaystyle z = \frac{\bar{X} – \mu_{\bar{X}}}{\sigma_{\bar{X}}} = \frac{3.5 – 3}{0.25} = \frac{0.5}{0.25} = 2[/math]

4. Consultazione delle tavole e Risultato

Dalle tavole della normale standard (o tramite software), sappiamo che l’area a sinistra di [math]z = 2[/math] è circa [math]0.9772[/math].
Poiché cerchiamo la probabilità che il tempo superi la soglia:

[math]\displaystyle P(Z > 2) = 1 – P(Z < 2) = 1 – 0.9772 = 0.0228[/math]

Conclusione: C’è solo una probabilità del 2.28% di osservare un tempo medio così alto. Se l’ispettore riscontrasse davvero una media di 3.5 minuti, potrebbe sospettare che la media reale del fast-food sia peggiorata rispetto ai 3 minuti dichiarati.

Visualizzare la Probabilità: Il Grafico della Media Campionaria

Analisi degli elementi visivi:

  • La Curva Blu (Distribuzione Campionaria):
    Rappresenta la distribuzione normale della media campionaria [math]\bar{X}[/math].
    Sebbene la popolazione originale dei singoli clienti sia asimmetrica, il TLC “forza” le medie di 36 automobili a disporsi secondo questa perfetta campana di Gauss con media [math]3[/math] e errore standard [math]0.25[/math].
  • Area in Rosso (La Probabilità):
    Rappresenta graficamente la probabilità [math]P(\bar{X} > 3.5)[/math].
    Come puoi vedere, si trova nella “coda” estrema destra della curva. Questo spazio occupa solo il 2.28% dell’area totale sotto la curva.
  • Linea Verde Tratteggiata (Il Centro):
    Indica la media della distribuzione ([math]\mu = 3[/math] minuti). In una distribuzione normale, questo è anche il punto di massima densità.
  • Linea Rossa Tratteggiata (La Soglia):
    Indica il valore critico di [math]3.5[/math] minuti richiesto dall’ispettore.
  • Z-score (2.0):
    Noterai che il valore 3.5 si trova esattamente a due “salti” (deviazioni standard) di distanza dalla media
    [math]\displaystyle \begin{aligned} 3 + 0.25 + 0.25 = 3.5 \end{aligned}[/math].
    In statistica, superare le 2 deviazioni standard è spesso il confine che separa un evento “normale” da uno “statisticamente significativo” o raro.

Questo grafico aiuta a capire visivamente che, mentre un singolo cliente può facilmente aspettare più di 3.5 minuti (la variabilità individuale è alta), è estremamente difficile che la media di un intero gruppo di 36 persone sia così alta. La campana si stringe attorno al valore centrale man mano che il campione aumenta.

🤔 Domanda di riflessione

Ti potrebbe interessare anche:  Distribuzione Esponenziale: Formule, Proprietà, Applicazioni Pratiche ed Esercizi Risolti

In questo esercizio, la distribuzione originale dei tempi di attesa non era nota (e asimmetrica). Quale proprietà specifica del Teorema del Limite Centrale abbiamo sfruttato per poter applicare la curva normale?

Risposta: Abbiamo sfruttato l’universalità del TLC: al crescere di [math]n[/math], la distribuzione della media campionaria “dimentica” la forma della popolazione originale (anche se asimmetrica o con code lunghe) e si modella sulla campana di Gauss.


Ecco il secondo esercizio della serie, perfetto per mostrare come il Teorema del Limite Centrale (TLC) riesca a “normalizzare” anche una distribuzione piatta e spigolosa come quella uniforme.

Questa è pura magia statistica: partiamo da un rettangolo e finiamo con una campana.

Esercizio 2: Il peso delle patatine in un pacchetto (Facile)

Testo del problema:
Un’azienda produce pacchetti di patatine il cui peso, a causa del processo di confezionamento, segue una distribuzione uniforme tra 148g e 152g. Questo significa che ogni peso in questo intervallo è ugualmente probabile. Un controllore di qualità preleva un campione di 40 pacchetti. Qual è la probabilità che il peso medio di questo campione sia inferiore a 149.5g?

💡 Osservazione: Anche partendo da una distribuzione uniforme (che è l’opposto di una curva a campana), il TLC ci assicura che la media campionaria si distribuirà in modo approssimativamente normale dato che il campione ([math]n = 40[/math]) è sufficientemente grande.

Risoluzione

1. Calcolo dei parametri della popolazione uniforme

Per una distribuzione uniforme con minimo [math]a = 148[/math] e massimo [math]b = 152[/math], dobbiamo prima trovare la media e la deviazione standard teoriche:

  • Media ([math]\mu[/math]):
    [math]\mu = \frac{a + b}{2} = \frac{148 + 152}{2} = 150[/math] g
  • Deviazione standard ([math]\sigma[/math]):
    [math]\sigma = \sqrt{\frac{(b – a)^2}{12}} = \sqrt{\frac{4^2}{12}} = \sqrt{\frac{16}{12}} \approx 1.155[/math] g

2. Parametri della distribuzione campionaria

Ora applichiamo le regole del TLC per il nostro campione di [math]n = 40[/math]:

  • Media campionaria: [math]\mu_{\bar{X}} = \mu = 150[/math] g
  • Errore Standard ([math]\sigma_{\bar{X}}[/math]):
    [math]\sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}} = \frac{1.155}{\sqrt{40}} \approx \frac{1.155}{6.3246} \approx 0.183[/math] g

Quindi, la nostra media campionaria si comporta come: [math]\bar{X} \sim N(150, 0.183)[/math].

3. Standardizzazione (Z-score)

Vogliamo calcolare [math]P(\bar{X} < 149.5)[/math].

Trasformiamo il valore 149.5g in un punto sulla scala della normale standard:

[math]\displaystyle z = \frac{149.5 – 150}{0.183} = \frac{-0.5}{0.183} \approx -2.73[/math]

4. Calcolo della probabilità e interpretazione

Cerchiamo [math]P(Z < -2.73)[/math] sulle tavole statistiche o tramite calcolatore. Il valore è molto piccolo:

[math]P(Z < -2.73) \approx 0.0032[/math] (ovvero lo 0.32%)

Interpretazione: La probabilità che la media di 40 pacchetti sia così bassa (sotto i 149.5g) è solo dello 0.32%. Se il controllore trovasse davvero un risultato simile, sarebbe un segnale d’allarme quasi certo: le macchine non stanno distribuendo il peso correttamente o la media impostata non è più di 150g.

🤔 Domanda di riflessione

La deviazione standard della distribuzione campionaria (0.183) è molto più piccola di quella della popolazione (1.155). Cosa implica questo per la precisione della nostra stima della media?

Risposta: Questo fenomeno è noto come “legge dei grandi numeri” in azione. Più il campione è grande, più la media campionaria tende a concentrarsi strettamente attorno alla media reale della popolazione.

Ti potrebbe interessare anche:  Microeconomia e Derivate: Test di Autovalutazione con Esercizi Svolti

In termini pratici: i singoli pacchetti possono variare molto (tra 148 e 152), ma la media di tanti pacchetti è estremamente stabile e precisa.


Ecco il terzo esercizio del percorso, che introduce un concetto fondamentale: il TLC non si applica solo alle medie, ma anche alle somme totali. Questo lo rende uno strumento indispensabile per previsioni di business e analisi di dati su larga scala.

 

Esercizio 3: Le visualizzazioni di un video virale (Medio)

Testo del problema:
Un creatore di contenuti sa che il numero di visualizzazioni orarie di un suo video è una variabile casuale con media [math]\mu = 1200[/math] e deviazione standard [math]\sigma = 300[/math]. La forma della distribuzione è sconosciuta e asimmetrica. Considerando un periodo di 150 ore (circa una settimana), qual è la probabilità che il numero totale di visualizzazioni in questo periodo sia compreso tra 178,500 e 181,500?

💡 Osservazione Teorica: Il TLC ha una “versione per la somma”. Se sommiamo [math]n[/math] variabili indipendenti, la loro somma [math]S_n[/math] si distribuisce approssimativamente come una normale con:
• Media: [math]\mu_S = n \cdot \mu[/math]
• Deviazione Standard: [math]\sigma_S = \sqrt{n} \cdot \sigma[/math]


Risoluzione

1. Definizione dei parametri della somma

Abbiamo [math]n = 150[/math] osservazioni orarie. Calcoliamo i parametri della distribuzione normale che descrive il totale delle visualizzazioni ([math]S_{150}[/math]):

  • Media della somma ([math]\mu_S[/math]):
    [math]\mu_S = n \cdot \mu = 150 \times 1200 = 180,000[/math] visualizzazioni.
  • Deviazione standard della somma ([math]\sigma_S[/math]):
    [math]\sigma_S = \sqrt{n} \cdot \sigma = \sqrt{150} \times 300 \approx 12.247 \times 300 \approx 3,674.1[/math] visualizzazioni.

Per il TLC, la somma totale si comporta come: [math]S_{150} \sim N(180000, 3674.1)[/math].

2. Standardizzazione (Z-score)

Dobbiamo trovare [math]P(178,500 < S_{150} < 181,500)[/math]. Calcoliamo gli z-score per i due estremi dell’intervallo:

[math]\displaystyle z_1 = \frac{178,500 – 180,000}{3,674.1} = \frac{-1,500}{3,674.1} \approx -0.41[/math]
[math]\displaystyle z_2 = \frac{181,500 – 180,000}{3,674.1} = \frac{1,500}{3,674.1} \approx 0.41[/math]

3. Calcolo della probabilità

Cerchiamo l’area compresa tra [math]z = -0.41[/math] e [math]z = 0.41[/math] sulla curva normale standard:

  • [math]P(Z < 0.41) \approx 0.6591[/math]
  • [math]P(Z < -0.41) \approx 0.3409[/math]

[math]P(-0.41 < Z < 0.41) = 0.6591 – 0.3409 = 0.3182[/math]

Interpretazione: C’è circa il 31.82% di probabilità che il totale delle visualizzazioni settimanali cada in questo intervallo di [math]\pm 1,500[/math] rispetto alla media prevista. È un intervallo piuttosto stretto (meno dell’1% del totale), il che spiega perché la probabilità non sia altissima.

🤔 Domanda di riflessione

Se volessimo calcolare la probabilità che il numero medio di visualizzazioni orarie (invece della somma) fosse compreso tra 1190 e 1210, come cambierebbero i parametri della distribuzione normale da usare?

Risposta: Se passiamo dalla “Somma” alla “Media”, i parametri tornano quelli classici visti negli esercizi precedenti:
• La media resterebbe [math]\mu = 1200[/math].
• La deviazione standard sarebbe l’errore standard: [math]\sigma_{\bar{X}} = \frac{300}{\sqrt{150}} \approx 24.49[/math].
Gli z-score e la probabilità finale risulterebbero identici, poiché [math]1190[/math] e [math]1210[/math] distano dalla media esattamente quanto i valori della somma divisi per [math]n[/math].

(125)


PubblicitàPubblicità