Cos'è la statistica: dati, popolazione, metodo
In breve
La statistica è la scienza che si occupa di raccogliere, organizzare, analizzare e interpretare i dati per estrarne informazione e prendere decisioni in condizioni di incertezza. Viviamo in un mondo pieno di dati (sondaggi, mercati, esperimenti, produzione), ma i dati grezzi da soli non "parlano": servono metodi per farli parlare senza farsi ingannare. La statistica si divide in due grandi rami: la descrittiva (sintetizzare e descrivere i dati che abbiamo) e l'inferenziale (generalizzare da un campione a un'intera popolazione, misurando l'incertezza). Capire fin da subito questa distinzione, e il vocabolario di base (popolazione, campione, unità, variabile), è la chiave per orientarsi in tutto il corso. Questo capitolo introduce la statistica e il suo metodo.
🎯 Alla fine di questo capitolo saprai: cos'è la statistica e a cosa serve; la distinzione tra statistica descrittiva e inferenziale; il vocabolario di base (popolazione, campione, unità statistica, variabile, carattere/modalità); i tipi di dati (qualitativi/quantitativi).
Che cos'è la statistica e perché serve
Perché conta: capire cosa fa (e cosa non fa) la statistica è il presupposto per usarla senza illudersi né farsi ingannare.
La statistica è la scienza dei dati: raccoglie, organizza, analizza e interpreta insiemi di dati per trasformarli in informazione utile a conoscere un fenomeno e a decidere. È uno strumento trasversale: si usa in economia (mercati, consumi, disoccupazione), in medicina (efficacia dei farmaci), nelle scienze sociali (sondaggi), nell'industria (controllo qualità), ovunque ci siano dati e incertezza.
Il punto-chiave è proprio l'incertezza. La statistica non serve tanto quando le cose sono certe, ma quando dobbiamo trarre conclusioni da dati incompleti o variabili: non possiamo intervistare tutti gli elettori, ma da un campione vogliamo stimare come voterà l'intera popolazione; non possiamo provare un farmaco su tutti, ma da uno studio vogliamo capire se funziona in generale. La statistica fornisce i metodi per fare questi "salti" dal particolare al generale misurando quanto ci si può fidare (l'errore, la probabilità di sbagliare). È, in sostanza, la logica del ragionamento in condizioni di incertezza.
I dati "grezzi" da soli non bastano e possono anche ingannare: una media può nascondere enormi differenze, un grafico mal costruito può mentire, una correlazione può non significare causa (cap. 7). La statistica insegna sia a estrarre informazione dai dati, sia a difendersi dagli usi scorretti. Non è un formulario da applicare meccanicamente, ma un modo di ragionare rigorosamente sui dati.
🔗 Analogia. La statistica è come l'assaggio di una minestra. Per sapere se è salata al punto giusto non serve mangiare tutta la pentola (la popolazione): basta assaggiarne un cucchiaio (il campione) — a patto di aver mescolato bene (campione rappresentativo). Da quel poco si conclude qualcosa su tutta la minestra. Ma se il campione è preso male (solo dalla superficie, senza mescolare), la conclusione è sbagliata. Tutta l'inferenza statistica è, in fondo, l'arte di assaggiare bene e sapere quanto fidarsi dell'assaggio.
Descrittiva e inferenziale: i due rami
Perché conta: è la grande divisione del corso; sapere in quale ramo ci si trova orienta tutto il ragionamento.
La statistica si articola in due grandi rami, che corrispondono a due obiettivi diversi:
Statistica descrittiva. Ha lo scopo di sintetizzare, organizzare e descrivere un insieme di dati che abbiamo a disposizione, senza pretendere di andare oltre. Costruisce tabelle e grafici (cap. 2-3), calcola indici che riassumono i dati in pochi numeri: dove sono "centrati" (media, mediana, cap. 4), quanto sono "dispersi" (varianza, cap. 5), che forma hanno (cap. 6), come due variabili sono legate (correlazione, cap. 7). La descrittiva risponde alla domanda: "com'è fatto questo insieme di dati?". Rimane entro i dati osservati.
Statistica inferenziale. Ha lo scopo di generalizzare da un campione (un sottoinsieme osservato) a un'intera popolazione (che non possiamo osservare tutta), traendo conclusioni probabilistiche e misurando l'incertezza di tali conclusioni. Usa il calcolo delle probabilità (cap. 8-9) come ponte. Comprende la stima (indovinare un valore incognito della popolazione, cap. 11) e la verifica di ipotesi (decidere se un'affermazione sulla popolazione è plausibile, cap. 12). L'inferenza risponde alla domanda: "cosa posso dire dell'intera popolazione, avendo visto solo un campione, e quanto posso fidarmi?". Va oltre i dati osservati.
Le due parti sono sequenziali: prima si descrivono i dati (descrittiva), poi — se servono conclusioni generali — si generalizza (inferenza), passando per la probabilità. Sapere sempre "in quale ramo" ci si trova è fondamentale: la descrittiva è certa (descrive ciò che c'è); l'inferenza è probabilistica (conclude ciò che probabilmente c'è, con un margine d'errore).
Il vocabolario di base
Perché conta: questi termini si useranno in ogni capitolo; confonderli è la prima fonte di errori.
La statistica ha un vocabolario preciso, da fissare subito:
- Popolazione (o universo, o collettivo): l'insieme di tutte le unità oggetto di studio (es. tutti gli elettori italiani, tutti i pezzi prodotti da una fabbrica). È ciò che vorremmo conoscere.
- Unità statistica: il singolo elemento della popolazione (il singolo elettore, il singolo pezzo). È l'unità elementare su cui si rileva l'informazione.
- Campione: un sottoinsieme della popolazione, effettivamente osservato. Se è scelto bene (rappresentativo, spesso casuale), permette di inferire sulla popolazione.
- Carattere (o variabile): la caratteristica che si rileva su ogni unità (es. l'età, il sesso, il reddito, il voto).
- Modalità: i valori che il carattere può assumere (per il sesso: M/F; per l'età: 18, 19, 20…).
- Parametro vs statistica: un parametro è una quantità (di solito incognita) riferita alla popolazione (es. la media dei redditi di tutti gli italiani); una statistica è la corrispondente quantità calcolata sul campione (la media dei redditi degli intervistati). L'inferenza usa le statistiche (note) per stimare i parametri (incogniti).
Quando si rileva il carattere su tutta la popolazione si parla di censimento (raro e costoso); quando si rileva su un campione si parla di indagine campionaria (la norma). La statistica moderna è soprattutto campionaria: dal poco (campione) al tutto (popolazione).
🧩 Esempio. Un istituto vuole conoscere il reddito medio delle famiglie italiane. La popolazione sono tutte le famiglie italiane (~25 milioni); l'unità statistica è la singola famiglia; il carattere è il reddito annuo; le modalità sono i valori in euro. Intervistare tutte le famiglie (censimento) sarebbe costosissimo, quindi si intervista un campione rappresentativo di, poniamo, 20.000 famiglie (indagine campionaria). Il reddito medio calcolato sul campione (es. 32.000 €) è una statistica; il vero reddito medio di tutte le famiglie (incognito) è il parametro. L'inferenza (cap. 11) stima il parametro dalla statistica, dicendo anche quanto la stima è affidabile.
I tipi di dati
Perché conta: il tipo di dato determina quali indici e grafici si possono usare; sbagliare tipo porta ad analisi prive di senso.
Non tutti i caratteri sono uguali: il tipo di dato determina quali operazioni e analisi hanno senso. La classificazione fondamentale distingue:
Caratteri qualitativi (categorici). Le modalità sono categorie, non numeri: esprimono una qualità. Si suddividono in:
- sconnessi (nominali): categorie senza ordine naturale (sesso, colore, città di nascita, settore economico). Si può solo dire se due unità sono uguali o diverse.
- ordinati (ordinali): categorie con un ordine naturale (titolo di studio: elementare < medie < diploma < laurea; grado di soddisfazione: basso < medio < alto). Si può ordinare, ma non fare differenze o rapporti sensati.
Caratteri quantitativi (numerici). Le modalità sono numeri che esprimono una quantità, su cui hanno senso le operazioni aritmetiche. Si suddividono in:
- discreti: assumono valori isolati, tipicamente interi da conteggio (numero di figli, numero di dipendenti: 0, 1, 2, 3…). Tra due valori consecutivi non c'è nulla.
- continui: possono assumere (in teoria) qualsiasi valore in un intervallo, tipicamente da misurazione (altezza, peso, reddito, tempo). Tra due valori ce n'è sempre un altro.
Questa classificazione è operativa: su un carattere qualitativo sconnesso ha senso la moda ma non la media; su un quantitativo si può calcolare la media; certi grafici valgono solo per certi tipi. Riconoscere il tipo di dato è il primo passo di ogni analisi — perché determina cosa si può (e non si può) legittimamente calcolare.
⚠️ Attenzione. Un errore classico è trattare come "quantitativo" un carattere che è solo ordinale codificato con numeri. Se codifico la soddisfazione come 1=bassa, 2=media, 3=alta, i numeri ordinano ma non sono vere quantità: la "media" 2,3 non ha un significato pieno (la distanza tra 1 e 2 non è necessariamente uguale a quella tra 2 e 3). Attribuire proprietà quantitative a dati solo ordinali è una delle scorrettezze statistiche più diffuse.
🗺️ Come si collega il tutto
Questo capitolo apre il corso definendo la statistica come scienza dei dati e del ragionamento nell'incertezza, divisa in descrittiva (sintetizzare i dati posseduti, cap. 2-7) e inferenziale (generalizzare dal campione alla popolazione, cap. 10-12, passando per la probabilità, cap. 8-9). Fissa il vocabolario (popolazione, unità, campione, carattere, modalità, parametro vs statistica) usato in tutto il corso e i tipi di dati (qualitativi sconnessi/ordinati, quantitativi discreti/continui), che determinano quali indici (cap. 4-6) e grafici (cap. 3) sono leciti. Il prossimo passo (cap. 2) è organizzare i dati grezzi in distribuzioni di frequenza.
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Statistica descrittiva | Sintetizza e descrive i dati che abbiamo (resta entro i dati) | Inferenziale (generalizza alla popolazione) |
| Statistica inferenziale | Generalizza dal campione alla popolazione con l'incertezza | Descrittiva (descrive, non generalizza) |
| Popolazione | L'insieme di tutte le unità oggetto di studio | Campione (sottoinsieme osservato) |
| Unità statistica | Il singolo elemento su cui si rileva il carattere | Popolazione (l'insieme di tutte le unità) |
| Carattere / modalità | La caratteristica rilevata / i valori che assume | (carattere = variabile; modalità = valori) |
| Parametro vs statistica | Quantità della popolazione (incognita) vs del campione (nota) | (l'inferenza stima il parametro dalla statistica) |
| Qualitativo vs quantitativo | Categorie (qualità) vs numeri (quantità) | Ordinale ≠ quantitativo (ordina ma non misura) |
📝 Riepilogo
- La statistica è la scienza dei dati: raccoglie, organizza, analizza e interpreta dati per estrarre informazione e decidere nell'incertezza. Non un formulario, ma la logica del ragionamento sui dati — utile sia per estrarre informazione sia per non farsi ingannare (medie ingannevoli, grafici falsi, correlazione ≠ causa).
- Due rami: descrittiva (sintetizza/descrive i dati posseduti — tabelle, grafici, indici; resta entro i dati, è certa) e inferenziale (generalizza dal campione alla popolazione con conclusioni probabilistiche; va oltre i dati, misura l'incertezza). Sequenziali, collegate dalla probabilità.
- Vocabolario: popolazione (tutte le unità), unità statistica (il singolo elemento), campione (sottoinsieme osservato), carattere/variabile (caratteristica rilevata), modalità (valori), parametro (quantità incognita della popolazione) vs statistica (calcolata sul campione). Censimento (tutta la popolazione) vs indagine campionaria (campione, la norma).
- Tipi di dati: qualitativi (sconnessi/nominali senza ordine; ordinati/ordinali con ordine) e quantitativi (discreti da conteggio; continui da misurazione). Il tipo determina quali indici e grafici sono leciti — riconoscerlo è il primo passo di ogni analisi. Attenzione a non trattare gli ordinali come quantità.
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Variabili e distribuzioni di frequenza
In breve
Una volta raccolti, i dati grezzi sono una massa disordinata di numeri o categorie: un elenco di 1.000 età dice poco. Il primo compito della statistica descrittiva è ordinarli, e lo strumento è la distribuzione di frequenza: una tabella che, per ogni modalità (o classe) del carattere, dice quante volte compare (frequenza). Da qui nascono i concetti-cardine di frequenza assoluta, relativa e cumulata, che permettono di leggere subito la struttura dei dati. Quando le modalità sono troppe (variabili continue), si raggruppano in classi. La distribuzione di frequenza è la "materia prima" da cui derivano tutti i grafici (cap. 3) e gli indici (cap. 4-6). Questo capitolo studia come organizzare i dati in distribuzioni.
🎯 Alla fine di questo capitolo saprai: costruire una distribuzione di frequenza; distinguere frequenza assoluta, relativa e cumulata; raggruppare in classi i dati continui; e leggere una tabella di frequenza.
Dalla matrice dei dati alla distribuzione di frequenza
Perché conta: organizzare i dati grezzi in una distribuzione è il primo, indispensabile passo di ogni analisi descrittiva.
I dati, appena raccolti, si presentano come una matrice dei dati: una tabella con le unità statistiche in riga e i caratteri in colonna (es. 1.000 righe = persone, colonne = età, sesso, reddito). Ma questa matrice grezza è illeggibile: mille età in fila non dicono nulla. Occorre sintetizzarla.
Il primo strumento di sintesi è la distribuzione di frequenza: si prende un carattere e si costruisce una tabella che associa a ciascuna modalità (valore) il numero di volte che compare. Questa "conta" è la frequenza. Il procedimento:
- si elencano le modalità distinte del carattere (i valori che effettivamente compaiono);
- per ciascuna, si contano le unità che la presentano;
- si ottiene una tabella modalità → frequenza, molto più compatta e leggibile della matrice grezza.
Esempio: da 20 famiglie di cui si rileva il "numero di figli", invece di elencare 20 numeri, si costruisce la tabella: 0 figli → 3 famiglie, 1 figlio → 7, 2 figli → 6, 3 figli → 3, 4 figli → 1. In cinque righe si vede subito la struttura: la maggioranza ha 1-2 figli, pochi ne hanno 4. La distribuzione di frequenza ha "dato ordine" ai dati. È da questa tabella che partiranno tutte le rappresentazioni grafiche (cap. 3) e il calcolo degli indici (cap. 4-6): è la materia prima dell'analisi descrittiva.
Frequenze assolute, relative e cumulate
Perché conta: i diversi tipi di frequenza rispondono a domande diverse; padroneggiarli è la base per leggere qualunque distribuzione.
La "conta" può essere espressa in modi diversi, ciascuno utile per una domanda diversa. Indichiamo con il numero totale di unità.
Frequenza assoluta (): il numero di unità che presentano la modalità -esima. È la conta "grezza". La somma di tutte le frequenze assolute dà il totale: . Risponde a "quante unità?".
Frequenza relativa (): la quota (proporzione) di unità con la modalità , cioè la frequenza assoluta divisa per il totale:
È un numero tra 0 e 1 (spesso espresso in percentuale, moltiplicando per 100). La somma di tutte le frequenze relative è (il 100%). Risponde a "quale proporzione?". La frequenza relativa è fondamentale perché rende confrontabili distribuzioni con totali diversi: dire "300 famiglie" non si confronta con un'altra città, ma dire "il 30%" sì.
Frequenza cumulata (assoluta o relativa ): la somma delle frequenze fino alla modalità -esima compresa (ha senso solo per caratteri ordinabili). La cumulata relativa risponde a "quale proporzione di unità ha un valore minore o uguale a quello?". Esempio: se il 30% ha ≤ 1 figlio e il 65% ha ≤ 2 figli, la cumulata dice a colpo d'occhio come i dati si "accumulano". È essenziale per calcolare mediana e percentili (cap. 4).
Queste quattro grandezze (assoluta, relativa, cumulata assoluta e relativa) sono le colonne tipiche di una tabella di frequenza completa. Saperle leggere e ricavare l'una dall'altra è la competenza-base della statistica descrittiva.
🧩 Esempio. Voti di un esame (30 studenti): la distribuzione ha modalità 18-30. Supponiamo: voto 24 → frequenza assoluta studenti. Con , la frequenza relativa è . Se gli studenti con voto ≤ 24 sono in tutto 18, la frequenza cumulata assoluta è e la cumulata relativa : il 60% degli studenti ha preso al massimo 24. Ogni frequenza risponde a una domanda: "quanti hanno 24?" (assoluta), "che quota?" (relativa), "quanti fino a 24?" (cumulata).
Il raggruppamento in classi
Perché conta: per le variabili continue è indispensabile raggruppare in classi; farlo bene (o male) cambia la leggibilità dei dati.
Con caratteri quantitativi continui (reddito, altezza) o discreti con moltissime modalità, elencare ogni singolo valore è inutile: se 1.000 persone hanno 1.000 redditi tutti diversi, la tabella modalità→frequenza avrebbe 1.000 righe con frequenza 1 ciascuna — inutile come i dati grezzi. La soluzione è raggruppare i valori in classi (intervalli): invece di ogni singolo valore, si contano le unità che cadono in ciascun intervallo.
Esempio: il reddito si raggruppa in classi come [0–15.000), [15.000–30.000), [30.000–50.000), [50.000 e oltre), e per ciascuna si conta quante unità vi cadono. Questo rende la distribuzione leggibile.
Nel costruire le classi valgono alcune regole:
- le classi devono essere esaustive (coprire tutti i valori) e mutuamente esclusive (ogni valore in una sola classe): per questo si usa la convenzione degli estremi, es. [15.000–30.000) chiuso a sinistra e aperto a destra, così 30.000 va nella classe successiva senza ambiguità;
- il numero di classi è un compromesso: troppe classi → poca sintesi (si torna al disordine); troppo poche → si perde dettaglio (tutto appiattito). Regole pratiche suggeriscono all'incirca classi;
- ogni classe ha un'ampiezza (differenza tra estremo superiore e inferiore) e un valore centrale (punto medio), che si userà come "rappresentante" della classe nel calcolo degli indici (cap. 4).
⚠️ Attenzione. Il raggruppamento in classi comporta una perdita di informazione: una volta raggruppati, non sappiamo più dove esattamente dentro la classe cadono i valori (assumiamo, per i calcoli, che si concentrino nel valore centrale). Inoltre, la scelta delle classi (numero e ampiezza) influenza l'aspetto della distribuzione: classi diverse possono far sembrare gli stessi dati più o meno concentrati. Non esiste una scelta "unica giusta" — va fatta con criterio e dichiarata, perché condiziona la lettura.
🗺️ Come si collega il tutto
Questo capitolo trasforma la matrice dei dati grezzi (cap. 1) in distribuzioni di frequenza, la "materia prima" della statistica descrittiva. Introduce le frequenze — assoluta (, la conta), relativa (, la quota, rende confrontabili distribuzioni diverse), cumulata (, ha senso per caratteri ordinabili, base di mediana e percentili, cap. 4) — e il raggruppamento in classi per i caratteri continui (con estremi, ampiezza, valore centrale). Da queste distribuzioni derivano le rappresentazioni grafiche (cap. 3) e tutti gli indici di posizione (cap. 4), variabilità (cap. 5) e forma (cap. 6). Il tipo di carattere (cap. 1) determina quali frequenze e classi hanno senso.
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Distribuzione di frequenza | Tabella modalità → quante volte compare | Matrice dei dati (grezza, unità × caratteri) |
| Frequenza assoluta | Il numero di unità con quella modalità | Frequenza relativa (la quota sul totale) |
| Frequenza relativa | : la quota (tra 0 e 1, o %); rende confrontabili | Assoluta (dipende dal totale, non confrontabile) |
| Frequenza cumulata | Quota di unità con valore ≤ a quello (solo caratteri ordinabili) | Relativa (la quota della singola modalità) |
| Classe | Intervallo che raggruppa più valori (per i continui) | Modalità singola (un solo valore) |
| Valore centrale | Punto medio di una classe, la "rappresenta" nei calcoli | Ampiezza (larghezza dell'intervallo) |
📝 Riepilogo
- I dati grezzi (matrice dei dati: unità × caratteri) sono illeggibili: il primo passo è organizzarli in una distribuzione di frequenza, tabella che associa a ogni modalità la sua frequenza (la conta). È la materia prima di grafici e indici.
- Frequenza assoluta = numero di unità con quella modalità (). Frequenza relativa = quota tra 0 e 1 (o %), con : fondamentale perché rende confrontabili distribuzioni di totale diverso. Frequenza cumulata = quota di unità con valore ≤ (solo per caratteri ordinabili): base di mediana e percentili (cap. 4).
- Per i caratteri continui (o con troppe modalità) si raggruppa in classi (intervalli): esaustive, mutuamente esclusive (convenzione estremi [a–b)), numero ~. Ogni classe ha ampiezza e valore centrale (usato come rappresentante nei calcoli).
- Il raggruppamento comporta perdita di informazione (non si sa più dove nella classe cadono i valori) e la scelta delle classi influenza l'aspetto della distribuzione: va fatta con criterio. Da qui si passa alle rappresentazioni grafiche (cap. 3) e agli indici (cap. 4-6).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Rappresentazioni grafiche
In breve
Un grafico ben fatto vale più di una tabella: l'occhio coglie in un istante una forma, una tendenza, un'anomalia che tra i numeri sfuggirebbe. La rappresentazione grafica traduce una distribuzione di frequenza (cap. 2) in un'immagine, rendendo immediata la percezione della struttura dei dati. Ma non tutti i grafici vanno bene per tutti i dati: il tipo di carattere (cap. 1) determina il grafico corretto — diagramma a barre e a torta per i qualitativi, istogramma per i quantitativi in classi, e così via. E un grafico può anche mentire: assi manipolati, aree ingannevoli. Saper scegliere il grafico giusto e leggerlo criticamente è una competenza-chiave. Questo capitolo studia le rappresentazioni grafiche.
🎯 Alla fine di questo capitolo saprai: scegliere il grafico giusto per ogni tipo di dato; costruire e leggere diagramma a barre, a torta, istogramma, e la curva delle frequenze cumulate; e riconoscere i grafici ingannevoli.
Perché rappresentare graficamente
Perché conta: capire cosa aggiunge un grafico (e cosa può nascondere) è il presupposto per usarlo bene.
Una distribuzione di frequenza (cap. 2) è già una sintesi, ma resta una tabella di numeri. La rappresentazione grafica fa un passo ulteriore: traduce quei numeri in un'immagine, sfruttando la straordinaria capacità dell'occhio umano di cogliere forme, proporzioni e tendenze in un istante. Guardando un grafico percepiamo subito dove si concentrano i dati, se sono simmetrici o sbilanciati, se c'è un valore anomalo — cose che tra i numeri richiederebbero calcolo e attenzione.
Il grafico ha quindi una funzione comunicativa ed esplorativa potentissima. Ma proprio perché agisce sulla percezione immediata, è anche pericoloso: un grafico mal costruito (di proposito o per errore) può suggerire conclusioni false senza che il lettore se ne accorga. Un asse verticale che non parte da zero può trasformare una differenza minima in un dirupo; aree disegnate male possono esagerare o nascondere. Perciò il grafico va scelto con criterio (in base al tipo di dato) e letto criticamente. In statistica, saper fare e smontare un grafico sono due facce della stessa competenza.
🔗 Analogia. Il grafico è come una fotografia dei dati. Una buona foto coglie l'essenziale di una scena in un colpo d'occhio, meglio di mille parole. Ma una foto può anche mentire: cambiando inquadratura, angolo o luce si può far sembrare enorme una cosa piccola, o nascondere ciò che non conviene mostrare. Così il grafico: onesto se ben inquadrato (assi corretti, proporzioni giuste), ingannevole se "l'inquadratura" è manipolata. Il lettore accorto guarda sempre anche gli assi, non solo la forma.
I grafici per dati qualitativi
Perché conta: per i caratteri qualitativi servono grafici specifici; usarne altri (es. istogramma) è un errore concettuale.
Per i caratteri qualitativi (categorici, cap. 1), in cui le modalità sono categorie, i grafici tipici sono:
Diagramma a barre (a nastri). A ogni modalità si associa una barra la cui altezza (o lunghezza) è proporzionale alla frequenza (assoluta o relativa). Le barre sono separate (staccate) — perché le categorie sono distinte e non c'è continuità tra loro. È il grafico più versatile per i qualitativi: permette di confrontare a colpo d'occhio le frequenze delle diverse categorie. Per i caratteri ordinali si rispetta l'ordine naturale delle modalità sull'asse.
Diagramma a torta (a settori circolari). Il cerchio (il "tutto", 100%) è diviso in settori, ciascuno con un'ampiezza angolare proporzionale alla frequenza relativa della modalità: il settore della modalità ha un angolo di . È efficace per mostrare la composizione (come il totale si ripartisce tra le categorie), soprattutto con poche modalità. Diventa illeggibile con molte categorie o quote simili.
⚠️ Attenzione. Il diagramma a torta è adatto solo quando le categorie sono poche e le loro quote ben distinte; con molte fette o fette di dimensioni simili, l'occhio non distingue le proporzioni e il grafico diventa inutile (o fuorviante). In quei casi il diagramma a barre è quasi sempre preferibile. Inoltre la torta ha senso solo per rappresentare una composizione (parti di un tutto che somma a 100%), non per confrontare grandezze indipendenti.
I grafici per dati quantitativi: l'istogramma
Perché conta: l'istogramma è il grafico-principe dei dati quantitativi in classi, e ha una regola cruciale (l'area, non l'altezza).
Per i caratteri quantitativi raggruppati in classi (cap. 2), il grafico d'elezione è l'istogramma. A prima vista somiglia a un diagramma a barre, ma ha due differenze cruciali:
- le barre (rettangoli) sono contigue (attaccate), senza spazi, perché il carattere è continuo (i valori scorrono senza interruzioni da una classe all'altra);
- soprattutto, ciò che rappresenta la frequenza è l'area del rettangolo, non la sua altezza.
Questo secondo punto è fondamentale e spesso frainteso. Quando le classi hanno ampiezze diverse, usare l'altezza sarebbe ingannevole: una classe larga il doppio "sembrerebbe" avere frequenza doppia anche a parità di dati. Per evitarlo, l'altezza del rettangolo non è la frequenza ma la densità di frequenza:
Così l'area (densità × ampiezza) torna a essere proprio la frequenza, e i rettangoli sono confrontabili anche con classi disuguali. Se invece tutte le classi hanno la stessa ampiezza, altezza e area sono proporzionali e la distinzione non si nota — ma il principio (conta l'area) resta la chiave concettuale dell'istogramma.
L'istogramma mostra a colpo d'occhio la forma della distribuzione: dove si concentrano i dati (la "gobba"), se è simmetrica o asimmetrica, se ha una o più "cime" (cap. 6). È lo strumento visivo di riferimento per i dati quantitativi.
🧩 Esempio. Reddito di 100 persone in due classi: [20.000–30.000) con 40 persone (ampiezza 10.000) e [30.000–50.000) con 60 persone (ampiezza 20.000). Se disegnassi le altezze pari a 40 e 60, la seconda classe sembrerebbe "più alta". Ma le densità sono: prima classe ; seconda . La seconda classe, pur avendo più persone, ha densità minore: i redditi sono più "diradati". L'istogramma corretto (per densità) mostra la prima classe più alta — cioè dove i dati sono più fitti — rivelando la vera concentrazione, che l'altezza grezza avrebbe nascosto.
Le frequenze cumulate e i grafici ingannevoli
Perché conta: la curva cumulata serve per mediana e percentili; riconoscere i grafici falsi difende da manipolazioni comuni.
La funzione di ripartizione (curva cumulata). Riportando in ascissa i valori del carattere e in ordinata la frequenza cumulata relativa (cap. 2), si ottiene una curva (per dati raggruppati, spezzata; per dati continui, la "cumulata") non decrescente, che va da 0 a 1. È molto utile perché permette di leggere graficamente quale quota di unità sta sotto un certo valore — e quindi di individuare la mediana (il valore in corrispondenza di ) e i percentili (cap. 4). È il complemento naturale dell'istogramma.
Altri grafici. Per serie nel tempo (una variabile misurata in istanti successivi: PIL, prezzi) si usa il diagramma cartesiano / a linea, che evidenzia l'andamento (trend). Per relazioni tra due variabili quantitative si usa il diagramma di dispersione (scatter plot, cap. 7).
Grafici ingannevoli. Poiché il grafico agisce sulla percezione, è terreno fertile per manipolazioni. I trucchi più comuni:
- asse verticale che non parte da zero: amplifica visivamente differenze minime (una crescita dell'1% sembra un'impennata);
- assi con scale non lineari o irregolari senza avvertirlo;
- grafici ad area/pittogrammi in cui si scala sia la larghezza sia l'altezza di un'immagine: raddoppiando una quantità, l'area quadruplica, esagerando l'effetto;
- classi di ampiezza diversa rappresentate con le altezze anziché con le densità (vedi istogramma).
Difendersi è semplice ma richiede disciplina: guardare sempre gli assi (dove partono, che scala hanno) prima della forma. Un grafico onesto non teme questo controllo; uno ingannevole sì.
🗺️ Come si collega il tutto
Questo capitolo traduce le distribuzioni di frequenza (cap. 2) in immagini, sfruttando la percezione visiva. Il tipo di carattere (cap. 1) sceglie il grafico: qualitativi → barre (staccate) e torta (composizione, poche categorie); quantitativi in classi → istogramma (barre contigue, dove conta l'area = densità × ampiezza, non l'altezza); serie temporali → linea; due variabili → scatter (cap. 7). La curva delle frequenze cumulate (cap. 2) serve a leggere mediana e percentili (cap. 4). I grafici sono potenti ma ingannevoli se manipolati (assi non da zero, aree, densità): vanno letti criticamente. Dai grafici si passa alla sintesi numerica: gli indici di posizione (cap. 4).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Diagramma a barre | Barre staccate, altezza = frequenza; per dati qualitativi | Istogramma (barre contigue, per quantitativi) |
| Diagramma a torta | Cerchio diviso in settori (angolo ∝ frequenza relativa); composizione | (solo poche categorie ben distinte) |
| Istogramma | Rettangoli contigui dove l'area = frequenza; per quantitativi in classi | Barre (dove conta l'altezza; categorie separate) |
| Densità di frequenza | Frequenza / ampiezza della classe = altezza corretta dell'istogramma | Frequenza (l'area, non l'altezza) |
| Curva cumulata | Grafico di , non decrescente da 0 a 1; dà mediana e percentili | Istogramma (mostra la forma, non le cumulate) |
| Grafico ingannevole | Manipola la percezione (asse non da zero, aree, densità) | (difesa: guardare sempre gli assi) |
📝 Riepilogo
- La rappresentazione grafica traduce una distribuzione (cap. 2) in un'immagine, sfruttando la capacità dell'occhio di cogliere forma, proporzioni e anomalie in un istante. Potente per comunicare/esplorare, ma pericolosa: può ingannare la percezione. Il tipo di carattere (cap. 1) impone il grafico corretto.
- Qualitativi: diagramma a barre (barre staccate, altezza = frequenza; rispetta l'ordine se ordinale) e diagramma a torta (settori con angolo ; mostra la composizione, solo con poche categorie distinte).
- Quantitativi in classi: istogramma (rettangoli contigui). Regola cruciale: conta l'area, non l'altezza → con classi di ampiezza diversa l'altezza è la densità = frequenza/ampiezza (così l'area = frequenza). Mostra la forma della distribuzione (cap. 6). La curva cumulata (, da 0 a 1) dà mediana e percentili (cap. 4). Serie nel tempo → linea; due variabili → scatter (cap. 7).
- Grafici ingannevoli: asse verticale non da zero (amplifica differenze), grafici ad area/pittogrammi (raddoppio → area quadrupla), classi disuguali con le altezze. Difesa: guardare sempre gli assi prima della forma. Poi si passa agli indici di posizione (cap. 4).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Indici di posizione: media, mediana, moda
In breve
Descritta la distribuzione con tabelle e grafici (cap. 2-3), il passo successivo è sintetizzarla in pochi numeri. Gli indici di posizione (o di tendenza centrale) rispondono alla domanda: "attorno a quale valore si concentrano i dati?". I tre fondamentali sono la media aritmetica (il baricentro), la mediana (il valore centrale che divide a metà) e la moda (il valore più frequente). Non sono intercambiabili: ciascuno ha proprietà, pregi e difetti diversi, ed è più o meno adatto a seconda del tipo di dato e della forma della distribuzione. Sapere quale usare, e come ciascuno può ingannare, è una competenza statistica essenziale. Questo capitolo studia gli indici di posizione.
🎯 Alla fine di questo capitolo saprai: calcolare e interpretare media, mediana e moda; conoscere le proprietà della media (e la sua sensibilità agli outlier); usare quartili e percentili; e scegliere l'indice giusto secondo dati e forma.
La media aritmetica
Perché conta: la media è l'indice più usato (e più abusato) della statistica; conoscerne proprietà e limiti è indispensabile.
La media aritmetica è l'indice di posizione più noto: la somma di tutti i valori diviso il loro numero. Per osservazioni :
Se i dati sono in una distribuzione di frequenza (cap. 2), si usa la media ponderata con le frequenze: (ogni valore "pesa" per la sua frequenza). Per dati in classi, si usa il valore centrale di ciascuna classe come .
La media ha due proprietà importanti che la caratterizzano:
- è il baricentro dei dati: la somma degli scarti dalla media è zero (). Gli scarti positivi e negativi si compensano esattamente — la media è il punto di "equilibrio".
- minimizza la somma dei quadrati degli scarti: nessun altro valore rende più piccolo della media. È il valore "più vicino" a tutti nel senso dei minimi quadrati (proprietà-base della regressione, cap. 7).
Ma la media ha un difetto cruciale: è sensibile ai valori estremi (outlier). Poiché usa tutti i valori sommandoli, un singolo valore anomalo molto grande (o piccolo) la "trascina" verso di sé, rendendola poco rappresentativa. È il motivo per cui, in presenza di dati sbilanciati (redditi, patrimoni), la media può dare un'immagine fuorviante — e serve affiancarle la mediana.
⚠️ Attenzione. La media ha senso pieno solo per caratteri quantitativi. Su un carattere qualitativo (anche ordinale) la media non si calcola: che significa la "media" tra "diploma" e "laurea"? Anche codificando con numeri, la media di dati solo ordinali è priva di significato rigoroso (cap. 1). Per i qualitativi si usano moda (sconnessi) o mediana (ordinali).
La mediana e i quantili
Perché conta: la mediana è l'alternativa robusta alla media; quartili e percentili descrivono la distribuzione oltre il centro.
La mediana () è il valore che occupa la posizione centrale quando i dati sono ordinati in modo crescente: divide la distribuzione in due metà uguali (50% dei dati sotto, 50% sopra). Il calcolo:
- si ordinano i dati;
- se è dispari, la mediana è il valore in posizione ;
- se è pari, è la media dei due valori centrali (posizioni e ).
Per dati raggruppati, la mediana si individua tramite la frequenza cumulata (cap. 2): è il valore in corrispondenza del quale raggiunge 0,50.
Il grande pregio della mediana è la robustezza: non è influenzata dai valori estremi. Poiché guarda solo la posizione centrale (non i valori sommati), un outlier gigantesco non la sposta. Per questo, con distribuzioni asimmetriche (redditi: pochi ricchissimi alzano la media ma non la mediana), la mediana è spesso più rappresentativa della media. Confrontare media e mediana è anzi un modo per diagnosticare l'asimmetria (cap. 6): se media > mediana, la distribuzione ha una coda a destra.
La mediana è un caso particolare dei quantili, valori che dividono la distribuzione ordinata in parti uguali:
- quartili (): dividono in quattro parti (25% ciascuna). = mediana; (primo quartile) lascia sotto il 25%, il 75%.
- percentili: dividono in cento parti (il percentile lascia sotto il %). I decili in dieci parti.
I quantili sono preziosi perché descrivono la distribuzione oltre il centro: la distanza (differenza interquartile) misura la dispersione della metà centrale dei dati (cap. 5), e i percentili collocano un valore rispetto agli altri ("sei nel 90° percentile" = meglio del 90%).
🧩 Esempio. Stipendi (in migliaia) di 5 dipendenti di un piccolo ufficio: 20, 22, 24, 26, 28. Media = (20+22+24+26+28)/5 = 24. Mediana (valore centrale, posizione 3) = 24. Media e mediana coincidono: dati simmetrici. Ora arriva il titolare con stipendio 200: dati 20, 22, 24, 26, 28, 200. Nuova media = 320/6 ≈ 53,3 (più alta di quasi tutti gli stipendi!); nuova mediana = (24+26)/2 = 25. La media, "trascinata" dall'outlier, dà un'immagine falsa ("guadagnano in media 53"); la mediana (25) resta rappresentativa della realtà dei dipendenti. Ecco perché sui redditi si usa la mediana.
La moda e la scelta dell'indice
Perché conta: la moda è l'unico indice per i dati sconnessi; scegliere l'indice giusto secondo il caso è la vera competenza.
La moda () è il valore (o la modalità) che presenta la frequenza massima: il più "frequente", quello che si osserva più spesso. È l'unico indice di posizione calcolabile anche per i caratteri qualitativi sconnessi (nominali): la "modalità modale" del colore preferito, del settore economico, ecc. — dove media e mediana non hanno senso.
Una distribuzione può essere unimodale (una sola moda), bimodale o plurimodale (più mode, più "gobbe"): la plurimodalità spesso segnala che i dati mescolano gruppi eterogenei (es. le altezze di uomini e donne insieme danno due gobbe). Per dati in classi si parla di classe modale (quella con densità massima, cap. 3).
Come scegliere l'indice? Non ce n'è uno "migliore" in assoluto: dipende dal tipo di dato e dalla forma:
- carattere qualitativo sconnesso: solo la moda;
- carattere qualitativo ordinale: moda o mediana (che sfrutta l'ordine);
- carattere quantitativo simmetrico senza outlier: la media (usa tutta l'informazione, ha ottime proprietà);
- carattere quantitativo asimmetrico o con outlier: la mediana (robusta, più rappresentativa);
- spesso è utile confrontare media, mediana e moda: la loro relazione rivela la forma della distribuzione (cap. 6). In una distribuzione simmetrica unimodale, i tre coincidono; se differiscono, c'è asimmetria.
La lezione è: gli indici di posizione non sono intercambiabili. Riportare "la media" di dati fortemente asimmetrici è tecnicamente corretto ma fuorviante; scegliere l'indice giusto (e spesso mostrarne più di uno) è ciò che distingue l'uso onesto della statistica.
🗺️ Come si collega il tutto
Questo capitolo sintetizza la distribuzione (cap. 2-3) con gli indici di posizione (tendenza centrale). La media è il baricentro (scarti a somma zero, minimizza gli scarti quadratici — base della regressione, cap. 7) ma è sensibile agli outlier; vale solo per i quantitativi. La mediana (valore centrale, 50%-50%) è robusta e si legge dalla cumulata (cap. 2); si estende a quartili e percentili (che misurano anche la dispersione, cap. 5). La moda (valore più frequente) è l'unico indice per i qualitativi sconnessi. La scelta dipende da tipo di dato (cap. 1) e forma: il confronto media-mediana-moda diagnostica l'asimmetria (cap. 6). Ma la posizione da sola non basta: serve sapere quanto i dati sono dispersi (cap. 5).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Media aritmetica | Somma dei valori / numero: il baricentro (scarti a somma 0) | Mediana (posizione centrale, robusta) |
| Sensibilità agli outlier | La media è trascinata dai valori estremi | Mediana (non ne è influenzata) |
| Mediana | Valore centrale dei dati ordinati: 50% sotto, 50% sopra | Media (usa tutti i valori, non robusta) |
| Quartili / percentili | Dividono la distribuzione ordinata in 4 / 100 parti | Mediana (, un caso particolare) |
| Moda | Il valore più frequente; unico indice per i sconnessi | Media/mediana (richiedono ordine/quantità) |
| Relazione media-mediana-moda | Se coincidono → simmetria; se differiscono → asimmetria | (strumento diagnostico della forma, cap. 6) |
📝 Riepilogo
- Gli indici di posizione (tendenza centrale) rispondono a "attorno a quale valore si concentrano i dati?". Tre fondamentali: media, mediana, moda — non intercambiabili.
- Media aritmetica (ponderata con le frequenze: ): è il baricentro (somma degli scarti = 0; minimizza gli scarti quadratici). Solo per quantitativi. Difetto: sensibile agli outlier (un valore estremo la trascina → fuorviante su dati asimmetrici).
- Mediana: valore centrale dei dati ordinati (50%-50%); si trova con la posizione o dalla cumulata. Pregio: robusta (immune agli outlier) → più rappresentativa su distribuzioni asimmetriche (redditi). Si generalizza in quartili () e percentili.
- Moda: il valore più frequente; unico indice per i qualitativi sconnessi; può esserci plurimodalità (gruppi eterogenei). Scelta: sconnessi → moda; ordinali → moda/mediana; quantitativi simmetrici → media; asimmetrici/outlier → mediana. Il confronto media-mediana-moda rivela la forma (cap. 6): se coincidono, simmetria. Poi serve la variabilità (cap. 5).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Indici di variabilità
In breve
Sapere dove si concentrano i dati (la posizione, cap. 4) non basta: due distribuzioni possono avere la stessa media ma essere completamente diverse — una con dati tutti vicini, l'altra con dati sparsi ovunque. Serve misurare la variabilità (o dispersione): quanto i dati si "allontanano" dal centro. Gli indici di variabilità — campo di variazione, varianza, scarto quadratico medio, coefficiente di variazione — quantificano questa dispersione. Sono fondamentali quanto gli indici di posizione: in economia e finanza, la variabilità è spesso sinonimo di rischio. Una media senza una misura di dispersione è un'informazione monca. Questo capitolo studia gli indici di variabilità.
🎯 Alla fine di questo capitolo saprai: perché la variabilità è essenziale accanto alla media; calcolare campo di variazione, differenza interquartile, varianza e scarto quadratico medio; usare il coefficiente di variazione per confrontare; e capire il legame variabilità-rischio.
Perché la posizione non basta
Perché conta: capire che due distribuzioni con la stessa media possono essere opposte è la ragione d'essere degli indici di variabilità.
Gli indici di posizione (cap. 4) dicono dove sono centrati i dati, ma non come sono distribuiti attorno a quel centro. Due insiemi di dati possono avere la stessa identica media ed essere profondamente diversi. Esempio: due gruppi di studenti con media dei voti 25.
- Gruppo A: voti 24, 25, 25, 26 → tutti vicini a 25, gruppo omogeneo.
- Gruppo B: voti 18, 22, 28, 32 → sparsi, gruppo eterogeneo (nonostante media 25... anche se 32 non è un voto reale, serve l'idea).
La media (25) è identica, ma le due situazioni sono opposte: nel primo caso la media è molto rappresentativa (descrive bene tutti); nel secondo è quasi ingannevole (nessuno ha davvero "25"). Ciò che le distingue è la variabilità (o dispersione): quanto i dati si allontanano dal valore centrale.
Misurare la variabilità è quindi essenziale per due motivi: (1) dice quanto è affidabile l'indice di posizione (poca variabilità → la media rappresenta bene; molta → male); (2) è un'informazione di per sé cruciale, perché in molti contesti la dispersione è il fenomeno che interessa — in finanza, la variabilità di un rendimento è la misura del rischio. Una media riportata senza una misura di variabilità è un'informazione incompleta. Posizione e variabilità sono le due coordinate fondamentali di ogni distribuzione.
🔗 Analogia. Immagina due fiumi con la stessa profondità media di 1 metro. Nel primo, la profondità è ovunque circa 1 metro: lo attraversi tranquillo. Nel secondo, alterna zone da 10 cm a buche da 3 metri: la media è sempre 1 metro, ma puoi annegare. La media da sola inganna; è la variabilità che ti dice se puoi fidarti. "Non attraversare mai un fiume perché in media è profondo un metro" è il monito statistico perfetto: guarda sempre anche la dispersione.
Campo di variazione e differenza interquartile
Perché conta: sono le misure di dispersione più semplici e intuitive, utili ma con limiti che motivano indici migliori.
Le misure di variabilità più immediate si basano sulla distanza tra valori:
Campo di variazione (range). È la differenza tra il valore massimo e il valore minimo:
Semplicissimo e intuitivo (l'"ampiezza" totale dei dati), ma ha un grave limite: dipende solo dai due valori estremi, ignorando tutti gli altri, ed è quindi fortemente sensibile agli outlier. Un solo valore anomalo dilata il range dando un'immagine falsa della dispersione tipica.
Differenza interquartile (IQR). Per ovviare, si usa la differenza tra il terzo e il primo quartile (cap. 4):
Misura l'ampiezza della metà centrale dei dati (dove sta il 50% "di mezzo"), escludendo il 25% più basso e il 25% più alto. È perciò robusta agli outlier (come la mediana): non risente dei valori estremi. È la misura di dispersione che accompagna naturalmente la mediana ed è alla base del grafico box-plot (che rappresenta mediana, quartili e valori anomali).
Queste due misure sono utili per una prima idea, ma condividono un limite: usano pochi valori (gli estremi o i quartili), non tutti. Per una misura che tenga conto di ogni dato, serve un approccio diverso: misurare quanto ciascun valore si discosta dalla media. È l'idea della varianza.
Varianza e scarto quadratico medio
Perché conta: varianza e scarto quadratico medio sono le misure di variabilità più importanti e usate in tutta la statistica.
L'idea è misurare la dispersione a partire dagli scarti dalla media: , cioè quanto ogni valore si allontana dal baricentro. Ma non si possono semplicemente sommare gli scarti: la loro somma è sempre zero (proprietà della media, cap. 4), perché positivi e negativi si annullano. Per evitare la compensazione, si elevano al quadrato (così diventano tutti positivi) e se ne fa la media. Si ottiene la varianza:
La varianza è la media dei quadrati degli scarti dalla media. È grande quando i dati sono dispersi, piccola (tende a 0) quando sono concentrati. Ha però un difetto pratico: essendo basata sui quadrati, è espressa in unità di misura al quadrato (se i dati sono in euro, la varianza è in "euro²", che non ha senso intuitivo).
Per tornare all'unità originaria si estrae la radice quadrata, ottenendo lo scarto quadratico medio (o deviazione standard):
Lo scarto quadratico medio è la misura di variabilità più usata in assoluto: esprime, nell'unità originaria dei dati, quanto "in media" i valori si discostano dalla media. Uno piccolo = dati concentrati attorno alla media (media rappresentativa); grande = dati dispersi. A differenza di range e IQR, usa tutti i valori. Comparirà ovunque nel corso: nella distribuzione normale (cap. 9), nell'errore standard delle stime (cap. 10-11), come misura di rischio in finanza.
⚠️ Attenzione. Nell'inferenza (cap. 10-11) si incontra la varianza campionaria con denominatore invece di : . Non è un errore: dividere per (i "gradi di libertà") rende uno stimatore corretto (non distorto) della varianza della popolazione. Per la statistica descrittiva si usa ; per stimare la varianza di una popolazione da un campione si usa . La distinzione diventerà chiara nel capitolo sulla stima.
🧩 Esempio. Gruppo A: 24, 25, 25, 26 (media 25). Scarti: −1, 0, 0, +1; quadrati: 1, 0, 0, 1; varianza = (1+0+0+1)/4 = 0,5; scarto quadratico medio . Gruppo B: 18, 22, 28, 32 (media 25). Scarti: −7, −3, +3, +7; quadrati: 49, 9, 9, 49; varianza = 116/4 = 29; . Stessa media (25), ma del gruppo B è 8 volte maggiore: i dati confermano numericamente ciò che l'intuizione vedeva — B è molto più eterogeneo. La media 25 rappresenta bene A, male B.
Confrontare variabilità diverse: il coefficiente di variazione
Perché conta: per confrontare la dispersione di fenomeni diversi serve una misura relativa; il coefficiente di variazione è lo strumento giusto.
Lo scarto quadratico medio è una misura assoluta: espressa nell'unità dei dati. Questo crea un problema quando si vogliono confrontare le variabilità di fenomeni diversi (unità diverse, o ordini di grandezza diversi). È più variabile il peso delle persone (σ = 8 kg su media 70 kg) o il loro reddito (σ = 5.000 € su media 30.000 €)? Non si possono confrontare kg ed euro direttamente, né uno σ riferito a una media grande con uno riferito a una media piccola.
La soluzione è il coefficiente di variazione (CV), una misura di variabilità relativa (adimensionale): il rapporto tra scarto quadratico medio e media:
(spesso espresso in percentuale, ). Il CV esprime la variabilità in proporzione al livello medio del fenomeno, eliminando l'unità di misura. Così diventa lecito confrontare la dispersione di grandezze eterogenee: quello con CV maggiore è relativamente più variabile. Nell'esempio: peso CV = 8/70 ≈ 0,11 (11%); reddito CV = 5.000/30.000 ≈ 0,17 (17%) → il reddito è relativamente più variabile del peso, pur avendo numeri assoluti non confrontabili.
Il CV è essenziale ogni volta che si confrontano variabilità di serie con medie o unità diverse (è molto usato in finanza per confrontare il rischio relativo di investimenti con rendimenti attesi diversi). Attenzione: ha senso solo per caratteri quantitativi con media positiva (e diventa instabile se la media è prossima a zero).
🗺️ Come si collega il tutto
Questo capitolo affianca alla posizione (cap. 4) la variabilità: due distribuzioni con la stessa media possono essere opposte (omogenea vs eterogenea), e la dispersione dice quanto la media è rappresentativa — ed è essa stessa cruciale (in finanza = rischio). Misure semplici: campo di variazione (, sensibile agli outlier) e differenza interquartile (, robusta, cap. 4, base del box-plot). Misure che usano tutti i dati: varianza (media dei quadrati degli scarti — si quadra perché la somma degli scarti è 0, cap. 4) e scarto quadratico medio (radice, nell'unità originaria — la misura-regina). Per confrontare fenomeni diversi: il coefficiente di variazione (relativo). Lo tornerà ovunque: forma (cap. 6), normale (cap. 9), errore standard (cap. 10-11). Il denominatore anticipa la stima (cap. 11).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Variabilità (dispersione) | Quanto i dati si allontanano dal centro | Posizione (dove sono centrati, cap. 4) |
| Campo di variazione | : l'ampiezza totale | IQR (usa i quartili, robusto) |
| Differenza interquartile | : ampiezza del 50% centrale, robusta | Range (usa gli estremi, sensibile agli outlier) |
| Varianza | Media dei quadrati degli scarti dalla media | Scarto quadr. medio (la sua radice, unità originaria) |
| Scarto quadratico medio | : dispersione media nell'unità dei dati (la più usata) | Varianza (in unità al quadrato) |
| Coefficiente di variazione | : variabilità relativa, adimensionale | (assoluto, non confronta fenomeni diversi) |
📝 Riepilogo
- La posizione (cap. 4) non basta: due distribuzioni con la stessa media possono essere opposte (omogenea vs eterogenea). La variabilità (dispersione) misura quanto i dati si allontanano dal centro: dice quanto la media è rappresentativa ed è cruciale di per sé (in finanza = rischio). "Non attraversare un fiume profondo in media un metro."
- Misure semplici: campo di variazione (intuitivo ma sensibile agli outlier, usa solo 2 valori); differenza interquartile (ampiezza del 50% centrale, robusta, base del box-plot).
- Misure su tutti i dati: varianza (media dei quadrati degli scarti — si quadra perché la somma degli scarti è 0; ma è in unità²); scarto quadratico medio (nell'unità originaria, la misura più usata: piccolo = dati concentrati, grande = dispersi).
- Per confrontare fenomeni diversi (unità/medie diverse): coefficiente di variazione (relativo, adimensionale, %). Nota: in inferenza la varianza campionaria usa (stimatore corretto, cap. 11). Lo ritorna in forma (cap. 6), normale (cap. 9), errore standard (cap. 10-11).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Forma, asimmetria e concentrazione
In breve
Posizione (cap. 4) e variabilità (cap. 5) sintetizzano dove sono i dati e quanto sono dispersi, ma non ne descrivono la forma: una distribuzione può essere simmetrica o sbilanciata da un lato, più o meno "appuntita", più o meno concentrata in poche unità. Gli indici di forma completano il quadro: l'asimmetria (skewness) misura lo sbilanciamento, la curtosi l'appuntimento. E per fenomeni come reddito e ricchezza c'è un concetto specifico e molto importante in economia: la concentrazione — quanto un carattere "trasferibile" è distribuito in modo equo o iniquo tra le unità — misurata dalla curva di Lorenz e dall'indice di Gini. Questo capitolo completa la descrizione di una distribuzione studiandone la forma.
🎯 Alla fine di questo capitolo saprai: capire e riconoscere l'asimmetria (e usarla via media-mediana-moda); cenni di curtosi; e soprattutto la concentrazione con la curva di Lorenz e l'indice di Gini, centrale in economia (disuguaglianza).
L'asimmetria
Perché conta: l'asimmetria dice se la distribuzione è sbilanciata, informazione che media e varianza da sole non danno.
Una distribuzione è simmetrica se le due metà, a sinistra e a destra del centro, sono l'una l'immagine speculare dell'altra. In una distribuzione simmetrica unimodale, media, mediana e moda coincidono (cap. 4). Ma molte distribuzioni reali sono asimmetriche (sbilanciate): hanno una "coda" più lunga da un lato. L'asimmetria (skewness) misura questo sbilanciamento.
- Asimmetria positiva (coda a destra): la maggior parte dei dati è concentrata sui valori bassi, con pochi valori molto alti che allungano la coda a destra. Tipico di reddito e ricchezza. In questo caso: moda < mediana < media (la media è "tirata" a destra dai valori alti, cap. 4).
- Asimmetria negativa (coda a sinistra): pochi valori molto bassi allungano la coda a sinistra; l'ordine si inverte: media < mediana < moda.
- Simmetria: media = mediana = moda.
Da qui una diagnostica pratica e potente: confrontare media e mediana rivela l'asimmetria senza calcoli complessi. Se media > mediana, la distribuzione è asimmetrica positiva (coda a destra); se media < mediana, negativa. È il modo più rapido per "capire la forma" e per decidere quale indice di posizione sia più rappresentativo (con forte asimmetria, la mediana, cap. 4).
Esistono indici numerici di asimmetria (basati sul momento terzo degli scarti, o l'indice di Pearson ): sono nulli per una distribuzione simmetrica, positivi/negativi secondo il verso. Ma l'idea-chiave da portare a casa è concettuale: riconoscere che una distribuzione è sbilanciata cambia il modo di leggerla e l'indice di sintesi da preferire.
🔗 Analogia. L'asimmetria è come la distribuzione dei voti in un esame facile vs difficile. Esame facile: quasi tutti prendono voti alti, pochi sfortunati voti bassi → coda a sinistra (asimmetria negativa): la moda è alta, ma qualche voto basso abbassa la media sotto la mediana. Esame difficile: la maggioranza prende voti bassi, pochi bravi voti alti → coda a destra (asimmetria positiva). Guardando solo la media non lo capiresti; guardando la forma (o media vs mediana) sì. La forma racconta una storia che gli indici singoli nascondono.
La curtosi
Perché conta: la curtosi completa la descrizione della forma; è importante soprattutto in finanza (code e valori estremi).
La curtosi misura quanto una distribuzione è "appuntita" e quanto sono "pesanti" le sue code, rispetto a una distribuzione normale (la classica campana di Gauss, cap. 9) presa come riferimento. Descrive un aspetto della forma diverso dall'asimmetria: non lo sbilanciamento, ma la concentrazione attorno al centro e il peso degli estremi.
- distribuzione leptocurtica: più appuntita della normale, con un picco alto e code pesanti (più valori estremi del previsto);
- distribuzione platicurtica: più piatta della normale, con code leggere;
- distribuzione normale (mesocurtica): il riferimento.
La curtosi si misura con indici basati sul momento quarto degli scarti (confrontati con il valore 3 della normale, o l'"eccesso di curtosi" = indice − 3, che vale 0 per la normale).
Perché conta? Soprattutto in finanza e gestione del rischio. I rendimenti finanziari sono spesso leptocurtici ("code grasse", fat tails): gli eventi estremi (crolli, boom) accadono più spesso di quanto una distribuzione normale prevederebbe. Ignorare la curtosi — assumere che tutto sia "normale" — porta a sottostimare il rischio di eventi estremi, un errore che ha contribuito a grandi crisi finanziarie. La curtosi ricorda che due distribuzioni con la stessa media e la stessa varianza possono comunque differire nel peso delle code — cioè nella frequenza dell'eccezionale.
La concentrazione: Lorenz e Gini
Perché conta: la concentrazione misura la disuguaglianza, uno dei concetti economici più importanti e dibattuti.
Per certi caratteri quantitativi trasferibili (reddito, ricchezza, fatturato, quote di mercato), interessa una domanda specifica: quanto il "totale" del carattere è distribuito in modo equo o concentrato tra le unità? Se il reddito totale di un paese fosse diviso in parti uguali tra tutti, la concentrazione sarebbe nulla (equidistribuzione); se lo possedesse un'unica persona, sarebbe massima. La concentrazione misura la disuguaglianza nella distribuzione di un carattere — uno dei concetti più importanti dell'economia.
La curva di Lorenz. È lo strumento grafico. Si ordinano le unità dalla più "povera" alla più "ricca" e si costruisce una curva che mette in relazione:
- in ascissa: la quota cumulata di unità (es. il 20% più povero, il 40%…);
- in ordinata: la quota cumulata del carattere posseduta da quelle unità (es. quanta parte del reddito totale detiene il 20% più povero).
Se ci fosse equidistribuzione perfetta, il 20% delle unità avrebbe il 20% del reddito, il 50% ne avrebbe il 50%, ecc.: la curva coinciderebbe con la diagonale (la "retta di equidistribuzione"). Nella realtà, poiché i più poveri hanno una quota di reddito inferiore alla loro quota di popolazione, la curva sta sotto la diagonale e si incurva: più è "gonfia" e lontana dalla diagonale, maggiore è la concentrazione (disuguaglianza).
L'indice di Gini. Sintetizza la curva di Lorenz in un numero. Concettualmente misura l'area compresa tra la diagonale di equidistribuzione e la curva di Lorenz, rapportata all'area totale sotto la diagonale. L'indice di Gini varia tra:
- 0 = equidistribuzione perfetta (la curva coincide con la diagonale: tutti hanno la stessa quota);
- 1 (o 100%) = concentrazione massima (una sola unità possiede tutto).
Più è vicino a 1, maggiore è la disuguaglianza. È l'indice standard con cui si misura e si confronta la disuguaglianza dei redditi tra paesi e nel tempo (i paesi hanno tipicamente Gini tra ~0,25 e ~0,60). Lorenz e Gini sono, in sostanza, il modo in cui la statistica dà una misura rigorosa a un concetto centrale del dibattito economico e politico: quanto è disuguale una società.
🧩 Esempio. Due paesi con lo stesso reddito medio pro capite. Paese X: il reddito è distribuito abbastanza uniformemente → curva di Lorenz vicina alla diagonale, Gini ≈ 0,25. Paese Y: pochi ricchissimi detengono gran parte del reddito, molti hanno poco → curva di Lorenz molto incurvata, Gini ≈ 0,55. Stesso reddito medio, ma società profondamente diverse: X relativamente egualitario, Y molto diseguale. Come sempre in statistica, la media (uguale) nasconde ciò che la forma/concentrazione (diversa) rivela. È per questo che, per misurare il benessere, non basta il PIL medio: serve anche il Gini.
🗺️ Come si collega il tutto
Questo capitolo completa la descrizione della distribuzione con la forma, dopo posizione (cap. 4) e variabilità (cap. 5). L'asimmetria (skewness) misura lo sbilanciamento: positiva (coda a destra, moda<mediana<media, tipica dei redditi) o negativa; si diagnostica confrontando media e mediana (cap. 4) e determina quale indice preferire. La curtosi misura l'appuntimento e il peso delle code (rispetto alla normale, cap. 9), cruciale in finanza (fat tails = rischio estremo sottostimato). La concentrazione (curva di Lorenz + indice di Gini ∈ [0,1]) misura la disuguaglianza di caratteri trasferibili (reddito), usando le frequenze cumulate (cap. 2). Insieme, i tre blocchi (posizione, variabilità, forma) descrivono completamente una distribuzione a una variabile; il passo successivo è studiare due variabili insieme (cap. 7).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Asimmetria (skewness) | Sbilanciamento della distribuzione (coda a dx = positiva) | Curtosi (appuntimento/code, non lo sbilanciamento) |
| Asimmetria positiva | Coda a destra, moda<mediana<media (tipica dei redditi) | Negativa (coda a sinistra, media<mediana<moda) |
| Curtosi | Quanto è appuntita e quanto pesano le code vs la normale | Asimmetria (lo sbilanciamento laterale) |
| Concentrazione | Quanto un carattere trasferibile è distribuito (dis)ugualmente | Variabilità (dispersione attorno alla media, cap. 5) |
| Curva di Lorenz | Quota cumulata del carattere vs quota cumulata di unità | (equidistribuzione = diagonale; più gonfia = più concentrata) |
| Indice di Gini | 0 (equidistribuzione) → 1 (concentrazione massima): la disuguaglianza | (sintetizza l'area sotto Lorenz) |
📝 Riepilogo
- Dopo posizione (cap. 4) e variabilità (cap. 5), la forma completa la descrizione. L'asimmetria (skewness) misura lo sbilanciamento: positiva = coda a destra, moda < mediana < media (tipica di reddito/ricchezza); negativa = coda a sinistra, ordine inverso; simmetria = i tre indici coincidono. Diagnostica rapida: media vs mediana (media > mediana → coda a destra) — e guida la scelta dell'indice (asimmetria forte → mediana).
- La curtosi misura quanto la distribuzione è appuntita e quanto pesano le code, rispetto alla normale (cap. 9): leptocurtica (appuntita, code pesanti), platicurtica (piatta). Cruciale in finanza: i rendimenti hanno code grasse (fat tails) → gli eventi estremi sono più frequenti del previsto; ignorarlo sottostima il rischio.
- La concentrazione misura la disuguaglianza di caratteri trasferibili (reddito, ricchezza). Curva di Lorenz: quota cumulata del carattere vs quota cumulata di unità; l'equidistribuzione è la diagonale, più la curva è incurvata sotto, più c'è concentrazione. Indice di Gini ∈ [0, 1]: 0 = equidistribuzione perfetta, 1 = concentrazione massima; è lo standard per misurare la disuguaglianza dei redditi. La media (uguale) può nascondere concentrazioni (diverse). Poi: due variabili insieme (cap. 7).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Analisi bivariata: correlazione e regressione
In breve
Finora abbiamo studiato una variabile per volta (analisi univariata). Ma le domande più interessanti riguardano relazioni tra variabili: il reddito dipende dagli anni di studio? Le vendite dalla spesa in pubblicità? L'analisi bivariata studia due caratteri congiuntamente. Per variabili quantitative, due strumenti sono centrali: la correlazione (misura quanto due variabili "vanno insieme", con il coefficiente di Pearson) e la regressione (costruisce un modello — la retta — per prevedere una variabile dall'altra). Un avvertimento domina tutto il capitolo, forse il più importante di tutta la statistica: correlazione non implica causa. Questo capitolo studia l'analisi bivariata.
🎯 Alla fine di questo capitolo saprai: costruire e leggere una tabella a doppia entrata e un diagramma di dispersione; interpretare la covarianza e il coefficiente di correlazione di Pearson; capire la regressione lineare (retta dei minimi quadrati, ); e perché correlazione ≠ causa.
Studiare due variabili insieme
Perché conta: molte domande reali riguardano relazioni tra variabili; l'analisi bivariata è la porta verso i modelli statistici.
L'analisi univariata (cap. 1-6) descrive una variabile alla volta. Ma spesso ciò che interessa è la relazione tra due variabili: esiste un legame tra istruzione e reddito? Tra prezzo e quantità venduta? Tra pubblicità e fatturato? L'analisi bivariata studia due caratteri congiuntamente, sulle stesse unità, per capire se e come variano insieme.
Gli strumenti dipendono dal tipo di dati:
- due caratteri qualitativi: si usa la tabella di contingenza (a doppia entrata) e indici di associazione (come il chi-quadrato);
- due caratteri quantitativi: si usano la covarianza, la correlazione e la regressione — il cuore di questo capitolo.
Per due variabili quantitative, il primo strumento è visivo: il diagramma di dispersione (scatter plot, cap. 3). Ogni unità è un punto nel piano cartesiano, con coordinate = i suoi valori sulle due variabili. La nube di punti rivela a colpo d'occhio se c'è una relazione e di che tipo:
- se i punti tendono a salire da sinistra a destra → relazione positiva (al crescere di cresce );
- se tendono a scendere → relazione negativa (al crescere di , cala);
- se sono sparsi senza direzione → nessuna relazione (lineare);
- se seguono una curva → relazione non lineare.
Lo scatter plot è sempre il primo passo: prima di calcolare qualsiasi indice, si guarda la nube. Da questa esplorazione visiva nascono le due domande che guidano il capitolo: quanto forte è la relazione (correlazione) e come modellarla/prevederla (regressione).
Covarianza e coefficiente di correlazione
Perché conta: il coefficiente di correlazione è la misura standard della forza di una relazione lineare; va saputo interpretare con precisione.
Per quantificare quanto due variabili variano insieme, si parte dalla covarianza. L'idea: per ogni unità si guardano gli scarti dalle rispettive medie, e , e si considera il loro prodotto. Se le due variabili tendono a stare entrambe sopra (o entrambe sotto) la media insieme, i prodotti sono positivi; se una sta sopra quando l'altra sta sotto, sono negativi. La covarianza è la media di questi prodotti:
Il segno della covarianza indica il verso della relazione lineare: positivo (relazione diretta), negativo (inversa), circa zero (nessuna relazione lineare). Ma la covarianza ha un limite: la sua grandezza dipende dalle unità di misura (cambia se misuri in euro o migliaia di euro), quindi non dice quanto forte è la relazione in termini confrontabili.
Per ottenere una misura standardizzata si divide la covarianza per il prodotto degli scarti quadratici medi (cap. 5), ottenendo il coefficiente di correlazione lineare di Pearson:
Il coefficiente è adimensionale e varia sempre tra −1 e +1, con un'interpretazione precisa:
- : correlazione lineare positiva perfetta (i punti stanno esattamente su una retta crescente);
- : correlazione lineare negativa perfetta (retta decrescente);
- : nessuna correlazione lineare;
- valori intermedi: tanto più è vicino a 1, tanto più forte è la relazione lineare; il segno ne dà il verso.
è la misura standard della forza di un legame lineare. Attenzione a due sfumature: misura solo la relazione lineare (una relazione forte ma curva può dare : per questo si guarda sempre prima lo scatter); ed è sensibile agli outlier.
🧩 Esempio. Su 6 studenti si rilevano ore di studio settimanali () e voto all'esame (). Lo scatter mostra punti che salgono da sinistra a destra: chi studia di più tende a prendere voti più alti. Si calcola : correlazione positiva forte. Interpretazione corretta: "esiste una forte associazione lineare positiva tra ore di studio e voto". Interpretazione scorretta (ma tentatrice): "studiare causa voti più alti di 0,85". Il coefficiente misura quanto le due variabili si muovono insieme, non che una causi l'altra — anche se qui la causa è plausibile, da solo non la dimostra (vedi ultima sezione).
La regressione lineare
Perché conta: la regressione è il modello statistico più usato: costruisce una relazione per prevedere e spiegare.
Se la correlazione misura la forza del legame, la regressione fa un passo oltre: costruisce un modello della relazione, per prevedere una variabile a partire dall'altra e quantificare l'effetto. Nella regressione le due variabili hanno ruoli asimmetrici:
- = variabile dipendente (o risposta): quella che si vuole spiegare/prevedere;
- = variabile indipendente (o esplicativa): quella usata per spiegare.
La regressione lineare semplice ipotizza che il legame sia lineare e cerca la retta che meglio approssima la nube di punti:
dove è l'intercetta (il valore di quando ) e è il coefficiente angolare (di quanto varia in media per ogni unità in più di : la "pendenza", l'effetto stimato). Il "meglio" si definisce col metodo dei minimi quadrati: si sceglie la retta che rende minima la somma dei quadrati degli scarti verticali tra i punti osservati e la retta (i residui, ). È lo stesso principio che rende la media il minimo degli scarti quadratici (cap. 4), esteso a due dimensioni. Il coefficiente è legato alla covarianza: .
Quanto è buono il modello? Lo misura il coefficiente di determinazione (che per la regressione semplice è proprio , il quadrato della correlazione). varia tra 0 e 1 e si interpreta come la quota di variabilità di spiegata dal modello (da ):
- vicino a 1: la retta spiega quasi tutta la variabilità di (ottimo adattamento, punti vicini alla retta);
- vicino a 0: il modello spiega poco (punti sparsi, non aiuta a prevedere ).
La regressione è lo strumento-base per prevedere (dato un , stimare ) e quantificare relazioni; è il fondamento dell'econometria e di gran parte della statistica applicata. Estesa a più variabili esplicative diventa la regressione multipla.
⚠️ Attenzione. Prevedere con la retta fuori dall'intervallo dei dati osservati (estrapolazione) è rischioso: la relazione lineare stimata vale dove ci sono dati, ma nulla garantisce che continui uguale oltre. E un alto indica buon adattamento, non che il modello sia "vero" o che la relazione sia causale (sotto).
Correlazione non è causa
Perché conta: è probabilmente l'avvertimento più importante di tutta la statistica; ignorarlo è la fonte di infiniti errori e manipolazioni.
Ecco il punto cruciale, da incidere nella mente: la correlazione (o la regressione) misura un'associazione statistica, NON dimostra un rapporto di causa-effetto. Che due variabili siano fortemente correlate ( alto) significa che si muovono insieme, non che una causi l'altra. Le spiegazioni possibili di una correlazione tra e sono almeno quattro:
- causa (la relazione causale ipotizzata);
- causa (causazione inversa);
- una terza variabile (variabile confondente) causa entrambe, creando una correlazione tra e che non sono legate direttamente;
- caso (correlazione spuria): con tante variabili, alcune risultano correlate per pura coincidenza.
L'esempio classico del confondente: nelle città c'è una forte correlazione positiva tra il numero di gelati venduti e il numero di annegamenti. Il gelato causa gli annegamenti? Ovviamente no. La terza variabile è il caldo estivo: quando fa caldo si mangiano più gelati e si fanno più bagni (quindi più annegamenti). Caldo → entrambi. La correlazione gelati-annegamenti è reale ma non causale.
Per stabilire la causa non basta la correlazione: servono esperimenti controllati (con gruppi di controllo e assegnazione casuale, che "spengono" i confondenti) o sofisticate tecniche econometriche. La statistica descrittiva bivariata trova associazioni; spiegarle causalmente è tutt'altra impresa. Dimenticare questo principio è la radice di innumerevoli conclusioni sbagliate, pubblicità ingannevoli e cattive decisioni ("i paesi con più cioccolato hanno più premi Nobel, quindi il cioccolato rende geni"). Correlazione ≠ causa: è forse la singola frase più importante che la statistica insegna.
🗺️ Come si collega il tutto
Questo capitolo passa dall'analisi univariata (cap. 1-6) alla bivariata: due variabili studiate insieme. Primo passo sempre visivo, il diagramma di dispersione (cap. 3). Per due quantitative: la covarianza (segno del legame, ma dipende dalle unità) si standardizza nel coefficiente di correlazione di Pearson (forza e verso del legame lineare; usa , cap. 5). La regressione lineare (, retta dei minimi quadrati — stesso principio della media, cap. 4) costruisce un modello per prevedere da ; l' misura la quota di variabilità spiegata. Avvertimento cardine: correlazione ≠ causa (causazione inversa, confondenti, spuria). Questo chiude la statistica descrittiva; ora serve il linguaggio dell'incertezza, la probabilità (cap. 8), per passare dal campione alla popolazione (inferenza, cap. 10-12) — dove la regressione diventa econometria.
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Diagramma di dispersione | Nube di punti : mostra se/come due variabili si legano | (sempre il primo passo, prima degli indici) |
| Covarianza | Media dei prodotti degli scarti: segno del legame lineare | Correlazione (standardizzata, in [−1,1]) |
| Coefficiente di correlazione | In [−1,+1]: forza e verso del legame lineare | Covarianza (dipende dalle unità) |
| Regressione lineare | Retta (minimi quadrati) per prevedere da | Correlazione (misura, non modella/prevede) |
| Coefficiente angolare | Di quanto varia per un'unità in più di | Intercetta ( quando ) |
| Quota di variabilità di spiegata dal modello (0–1) | (correlazione; qui ) | |
| Correlazione ≠ causa | L'associazione non prova un rapporto causa-effetto | (confondenti, causazione inversa, spuria) |
📝 Riepilogo
- L'analisi bivariata studia due caratteri insieme. Primo passo: il diagramma di dispersione (nube di punti), che rivela relazione positiva/negativa/assente/non lineare. Per due qualitativi → tabella di contingenza; per due quantitativi → covarianza, correlazione, regressione.
- Covarianza : il segno dà il verso del legame lineare, ma la grandezza dipende dalle unità. Coefficiente di correlazione di Pearson : misura standard di forza e verso del legame lineare ( = perfetto, 0 = assente). Misura solo relazioni lineari (una curva forte può dare ) ed è sensibile agli outlier.
- Regressione lineare : modello per prevedere/spiegare (dipendente) da (indipendente), con la retta dei minimi quadrati (minimizza i quadrati dei residui). = effetto (variazione di per unità di ); = intercetta. L' (= ) ∈ [0,1] = quota di variabilità di spiegata. Attenzione all'estrapolazione.
- Correlazione ≠ causa (l'avvertimento più importante): un'associazione può derivare da →, →, una confondente che causa entrambe (gelati-annegamenti → caldo), o dal caso (spuria). Per la causa servono esperimenti controllati. Chiude la descrittiva; segue la probabilità (cap. 8).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Il calcolo delle probabilità
In breve
La statistica descrittiva (cap. 1-7) descrive dati che abbiamo. Ma per generalizzare dal campione alla popolazione (l'inferenza, cap. 10-12) serve un linguaggio per ragionare sull'incertezza: il calcolo delle probabilità. La probabilità misura, con un numero tra 0 e 1, quanto è "credibile" o "atteso" un evento incerto. È il ponte tra descrittiva e inferenza: permette di dire quanto possiamo fidarci di una conclusione tratta da un campione. Questo capitolo introduce i concetti fondamentali — esperimento, evento, le regole per combinare probabilità, la probabilità condizionata e l'indipendenza, fino al celebre teorema di Bayes. Sono le fondamenta logiche di tutta l'inferenza. Questo capitolo studia la probabilità.
🎯 Alla fine di questo capitolo saprai: le definizioni di probabilità (classica, frequentista, soggettiva); il linguaggio di eventi e i postulati; le regole della somma e del prodotto; la probabilità condizionata e l'indipendenza; e il teorema di Bayes.
Che cos'è la probabilità
Perché conta: capire cosa misura la probabilità (e i diversi modi di definirla) è il presupposto per usarla nell'inferenza.
La probabilità è una misura numerica, compresa tra 0 e 1, dell'incertezza di un evento: quanto è "atteso" o "credibile" che si verifichi. Probabilità 0 = evento impossibile; probabilità 1 = evento certo; valori intermedi = gradi di incertezza (0,5 = "come il lancio di una moneta equa"). È il linguaggio con cui la matematica tratta il caso.
Storicamente ci sono tre modi di definire/interpretare la probabilità, complementari:
Definizione classica (a priori). La probabilità di un evento è il rapporto tra i casi favorevoli e i casi possibili, purché siano tutti egualmente possibili:
Es. la probabilità di ottenere un numero pari lanciando un dado è 3/6 = 0,5. Funziona nei giochi d'azzardo (dadi, carte, monete) dove la simmetria garantisce l'equiprobabilità; ma richiede di poter contare casi egualmente possibili, cosa non sempre possibile.
Definizione frequentista (a posteriori). La probabilità è la frequenza relativa con cui l'evento si verifica in un numero grande di prove ripetute nelle stesse condizioni: per grande. Es. per sapere la probabilità che un pezzo prodotto sia difettoso, si osserva la frequenza dei difettosi su molte produzioni. È il ponte con la statistica descrittiva (la frequenza relativa, cap. 2) e si fonda sulla legge dei grandi numeri (la frequenza relativa "si stabilizza" sulla probabilità al crescere delle prove).
Definizione soggettiva. La probabilità è il grado di fiducia che un individuo razionale ripone nel verificarsi dell'evento, misurabile dalla "scommessa" che è disposto ad accettare. Utile per eventi non ripetibili ("che probabilità c'è che questa azienda fallisca entro un anno?"), dove classica e frequentista non si applicano. È alla base dell'approccio bayesiano.
Le tre definizioni non sono in conflitto: sono modi diversi di assegnare i numeri, ma una volta assegnati, tutti obbediscono alle stesse regole (i postulati, sotto).
Eventi e postulati
Perché conta: il linguaggio degli eventi e i postulati sono la grammatica formale su cui poggiano tutte le regole di calcolo.
Il calcolo delle probabilità ha un vocabolario preciso. Un esperimento casuale è una prova il cui esito è incerto (lancio di un dado, estrazione di una carta). Lo spazio campionario () è l'insieme di tutti gli esiti possibili (per un dado: {1,2,3,4,5,6}). Un evento è un sottoinsieme dello spazio campionario, cioè un insieme di esiti che ci interessano (l'evento "numero pari" = {2,4,6}).
Poiché gli eventi sono insiemi, si combinano con le operazioni insiemistiche, ciascuna con un significato logico:
- unione (" o "): si verifica almeno uno dei due;
- intersezione (" e "): si verificano entrambi;
- complementare ("non "): non si verifica;
- due eventi sono incompatibili (o disgiunti) se non possono verificarsi insieme (): es. "esce pari" e "esce 3".
La probabilità obbedisce a tre postulati (assiomi di Kolmogorov), da cui si deduce tutto il resto:
- la probabilità di ogni evento è non negativa: ;
- la probabilità dell'evento certo è 1: ;
- per eventi incompatibili, la probabilità dell'unione è la somma: .
Da questi discendono conseguenze utilissime, tra cui la regola del complementare: (la probabilità che non accada è 1 meno quella che accada). Quest'ultima è spesso la via più rapida per calcolare probabilità "almeno un…": conviene calcolare la probabilità dell'evento contrario ("nessuno") e sottrarla da 1.
Le regole: somma e prodotto
Perché conta: le regole della somma e del prodotto sono gli strumenti operativi per calcolare la probabilità di eventi combinati.
Dai postulati derivano le due regole fondamentali per combinare probabilità.
Regola della somma (probabilità dell'unione, " o "). Nel caso generale:
Si sommano le due probabilità, ma si sottrae l'intersezione, per non contare due volte la parte in comune (gli esiti che stanno in entrambi). Se gli eventi sono incompatibili (), l'intersezione è 0 e la regola si riduce a (il postulato 3).
Regola del prodotto (probabilità dell'intersezione, " e "). Richiede la probabilità condizionata (sotto):
La probabilità che si verifichino entrambi è la probabilità del primo per la probabilità del secondo dato il primo. Se i due eventi sono indipendenti (sotto), si semplifica in .
🧩 Esempio. Da un mazzo di 40 carte estraggo una carta. Evento = "esce una figura" (12 figure: fanti, cavalli, re → ); evento = "esce a denari" (10 carte → ); l'intersezione "figura e denari" sono 3 carte → . Probabilità di "figura o denari": . Se non sottraessi l'intersezione otterrei 0,55, contando due volte le 3 figure di denari. La sottrazione dell'intersezione è ciò che rende corretta la regola della somma.
Probabilità condizionata, indipendenza e Bayes
Perché conta: la probabilità condizionata e il teorema di Bayes sono il cuore del ragionamento probabilistico e dell'inferenza moderna.
Probabilità condizionata. È la probabilità che si verifichi sapendo che si è verificato ; si scrive ("probabilità di dato ") e si definisce:
L'idea: l'informazione " è accaduto" restringe lo spazio dei casi possibili ad , e ricalcoliamo la probabilità di dentro questo spazio ridotto. La probabilità condizionata è il modo formale in cui l'informazione aggiorna le probabilità: sapere qualcosa cambia quanto ci aspettiamo il resto.
Indipendenza. Due eventi sono indipendenti se il verificarsi dell'uno non cambia la probabilità dell'altro: . In tal caso (e solo allora) vale la forma semplice del prodotto: . L'indipendenza è un concetto centrale: es. lanci successivi di una moneta sono indipendenti (la moneta "non ha memoria"). Attenzione a non confondere indipendenti (il verificarsi di uno non informa sull'altro) con incompatibili (non possono verificarsi insieme): sono concetti diversi, anzi due eventi incompatibili con probabilità positiva sono necessariamente dipendenti (se so che è uscito , so che è impossibile).
Teorema di Bayes. Collega le due probabilità condizionate "inverse" e :
Il teorema di Bayes permette di "invertire" il condizionamento: se conosco la probabilità di un effetto data una causa, posso calcolare la probabilità della causa dato l'effetto. È lo strumento con cui si aggiornano le probabilità alla luce di nuove evidenze: si parte da una probabilità a priori , si osserva un'evidenza , e si ottiene la probabilità a posteriori aggiornata. È il fondamento della statistica bayesiana e ha applicazioni enormi (test diagnostici, filtri antispam, machine learning).
⚠️ Attenzione. Il teorema di Bayes rivela un'insidia comune: e non sono la stessa cosa. Esempio classico (test medici): la probabilità di risultare positivi al test dato che si è malati è alta (test sensibile), ma la probabilità di essere malati dato che si è positivi può essere bassa se la malattia è rara — perché tra i tanti sani, anche pochi falsi positivi superano i veri malati. Confondere le due probabilità condizionate inverse ("errore del procuratore") porta a conclusioni gravemente sbagliate in medicina, giustizia e valutazione del rischio.
🗺️ Come si collega il tutto
Questo capitolo introduce il calcolo delle probabilità, il linguaggio dell'incertezza che fa da ponte tra descrittiva (cap. 1-7) e inferenza (cap. 10-12). La probabilità (numero in [0,1]) si definisce in modo classico (casi favorevoli/possibili), frequentista (frequenza relativa su molte prove, collega la frequenza del cap. 2 via legge dei grandi numeri) o soggettivo. Il linguaggio degli eventi (unione/intersezione/complementare) e i postulati generano le regole della somma () e del prodotto (). La probabilità condizionata formalizza come l'informazione aggiorna le probabilità; l'indipendenza (≠ incompatibilità) semplifica il prodotto; il teorema di Bayes inverte il condizionamento e aggiorna a priori → a posteriori. Il prossimo passo: le variabili casuali e le distribuzioni notevoli (cap. 9), che portano la probabilità nel continuo e conducono alla normale.
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Probabilità | Misura in [0,1] dell'incertezza di un evento (0 impossibile, 1 certo) | (classica/frequentista/soggettiva: modi di assegnarla) |
| Definizione classica | Casi favorevoli / casi possibili (equiprobabili) | Frequentista (frequenza relativa su molte prove) |
| Evento incompatibile | Due eventi che non possono verificarsi insieme () | Indipendente (uno non informa sull'altro) |
| Regola della somma | (sottrai l'intersezione) | Prodotto (intersezione "e", non unione "o") |
| Probabilità condizionata | : probabilità di sapendo che è accaduto | (l'informazione restringe lo spazio) |
| Indipendenza | : uno non cambia la probabilità dell'altro | Incompatibilità (concetto diverso, anzi opposto) |
| Teorema di Bayes | Inverte il condizionamento; aggiorna a priori → a posteriori | (!) |
📝 Riepilogo
- La probabilità (numero in [0,1]: 0 impossibile, 1 certo) misura l'incertezza di un evento ed è il linguaggio che collega descrittiva e inferenza. Tre definizioni: classica (casi favorevoli/possibili equiprobabili), frequentista (frequenza relativa su molte prove — legge dei grandi numeri), soggettiva (grado di fiducia, per eventi non ripetibili). Assegnano i numeri in modo diverso, ma seguono le stesse regole.
- Linguaggio degli eventi (sottoinsiemi di ): unione ("o"), intersezione ("e"), complementare ("non"), incompatibili (disgiunti). Postulati di Kolmogorov (, , additività per incompatibili) → regola del complementare .
- Regola della somma: (si sottrae l'intersezione per non contarla due volte). Regola del prodotto: ; se indipendenti, .
- Probabilità condizionata : come l'informazione aggiorna le probabilità. Indipendenza () ≠ incompatibilità. Teorema di Bayes : inverte il condizionamento, aggiorna a priori → a posteriori (test diagnostici, spam, ML). Insidia: . Poi: variabili casuali (cap. 9).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Variabili casuali e distribuzioni notevoli
In breve
La probabilità (cap. 8) ragiona su eventi; ma spesso ciò che interessa è una quantità numerica il cui valore dipende dal caso: quante teste su 10 lanci, quanti clienti in un'ora, il rendimento di un titolo. Questa è una variabile casuale (o aleatoria): un numero il cui valore è incerto, governato da una distribuzione di probabilità. Le variabili casuali hanno un "valore atteso" (media) e una varianza, esattamente come i dati (cap. 4-5), ma calcolati sulle probabilità anziché sulle frequenze. Alcune distribuzioni ricorrono così spesso da meritare un nome: la binomiale (per i conteggi di successi) e soprattutto la normale (la campana di Gauss), la regina della statistica. Questo capitolo studia le variabili casuali e le distribuzioni notevoli.
🎯 Alla fine di questo capitolo saprai: cos'è una variabile casuale (discreta/continua); valore atteso e varianza; la distribuzione binomiale; la distribuzione normale e le sue proprietà; la standardizzazione e la normale standard .
Che cos'è una variabile casuale
Perché conta: la variabile casuale è il concetto che collega la probabilità ai numeri e apre la strada all'inferenza.
Una variabile casuale (o aleatoria), che indichiamo con una lettera maiuscola , è una grandezza numerica il cui valore dipende dall'esito di un esperimento casuale (cap. 8). Prima dell'esperimento non sappiamo quale valore assumerà; sappiamo però, per ciascun valore possibile, con quale probabilità si presenterà. In sostanza, una variabile casuale associa un numero a ogni esito dello spazio campionario. Esempi: il numero di teste in 10 lanci di moneta; il punteggio ottenuto lanciando due dadi; il rendimento (incerto) di un investimento.
Come i caratteri statistici (cap. 1), le variabili casuali sono di due tipi:
- discrete: assumono valori isolati (tipicamente interi da conteggio: 0, 1, 2, …). La loro legge è la funzione di probabilità, che assegna a ciascun valore la sua probabilità (con somma 1 su tutti i valori).
- continue: assumono valori in un intervallo continuo (misure: tempo, lunghezza, rendimento). Qui la probabilità di un singolo valore esatto è 0; si descrivono con una funzione di densità , e la probabilità si legge come area sotto la densità in un intervallo: = area tra e .
La distribuzione di probabilità di una variabile casuale è l'analogo "teorico" della distribuzione di frequenza (cap. 2): là si osservavano le frequenze realizzate nei dati; qui si specificano le probabilità attese dei valori. Questo parallelismo è il cuore del ponte descrittiva → inferenza: la distribuzione di probabilità è il modello della popolazione da cui i dati (il campione) provengono.
🔗 Analogia. La distribuzione di frequenza (cap. 2) è come la cronaca di una partita già giocata (cosa è successo davvero: quante volte è uscito ogni risultato). La distribuzione di probabilità è come le previsioni prima della partita (con che probabilità ciascun risultato accadrà). Giocando tantissime partite, le frequenze osservate si avvicinano alle probabilità previste (legge dei grandi numeri, cap. 8). La variabile casuale vive nel mondo delle previsioni; i dati, nel mondo della cronaca. L'inferenza (cap. 10-12) userà la cronaca (campione) per indovinare le previsioni (popolazione).
Valore atteso e varianza
Perché conta: valore atteso e varianza sintetizzano una variabile casuale come media e varianza sintetizzano i dati; sono onnipresenti.
Come una distribuzione di dati si sintetizza con posizione e variabilità (cap. 4-5), una variabile casuale si sintetizza con due grandezze analoghe, calcolate però sulle probabilità.
Valore atteso (o speranza matematica, o media della v.c.), indicato o : è la "media" dei valori possibili, ponderata con le loro probabilità. Per una variabile discreta:
Rappresenta il valore che ci si aspetta "in media" ripetendo l'esperimento infinite volte. Non è necessariamente un valore possibile (il valore atteso del lancio di un dado è 3,5, che non esce mai): è il baricentro della distribuzione di probabilità, l'analogo della media (cap. 4) con le probabilità al posto delle frequenze.
Varianza della variabile casuale, o : misura la dispersione dei valori attorno al valore atteso, sempre pesando con le probabilità:
e la sua radice è lo scarto quadratico medio della variabile casuale (cap. 5). Interpretazione identica a prima: grande = valori molto incerti/dispersi; piccolo = valori concentrati attorno all'atteso.
In finanza questo ha un'interpretazione diretta e importante: se è il rendimento di un investimento, è il rendimento atteso e è il rischio (l'incertezza attorno ad esso). La scelta di un investimento è, in quest'ottica, un bilanciamento tra (quanto rende in media) e (quanto è rischioso) — il fondamento della teoria di portafoglio.
La distribuzione binomiale
Perché conta: la binomiale è il modello di riferimento per i conteggi di successi; ricorre in innumerevoli problemi pratici.
Alcune situazioni si ripetono così spesso da avere una distribuzione "con nome". La più importante tra le discrete è la binomiale. Descrive il numero di successi in prove ripetute, quando:
- ogni prova ha solo due esiti ("successo" / "insuccesso") — è una prova di Bernoulli;
- la probabilità di successo è costante in ogni prova;
- le prove sono indipendenti (cap. 8).
La variabile casuale = "numero di successi in prove" segue allora una distribuzione binomiale di parametri e . Esempi tipici: numero di teste in lanci di moneta; numero di pezzi difettosi in un lotto di ; numero di clienti che comprano su contattati. Il valore atteso e la varianza hanno formule semplici:
Il valore atteso è intuitivo: se lancio 10 monete (, ), mi aspetto teste. La binomiale è il modello-base per tutti i fenomeni di conteggio di successi/insuccessi su prove ripetute indipendenti — situazione frequentissima in controllo qualità, marketing, medicina (numero di guariti su trattati), sondaggi.
🧩 Esempio. Un'azienda sa che il 20% dei clienti contattati al telefono accetta un'offerta (). Un operatore contatta 10 clienti (), in modo indipendente. Il numero di accettazioni è binomiale con , . Quante accettazioni ci si aspetta? . Con che dispersione? , quindi . Il modello permette anche di calcolare, ad esempio, la probabilità di esattamente 3 accettazioni, o di almeno 1 (via complementare, cap. 8). È lo strumento per pianificare e valutare campagne, controlli, esperimenti.
La distribuzione normale
Perché conta: la normale è la distribuzione più importante della statistica; è il cuore di gran parte dell'inferenza.
Tra le variabili casuali continue, una domina tutte: la distribuzione normale (o gaussiana, dal matematico Gauss), la celebre curva a campana. È la distribuzione più importante della statistica per la sua ubiquità e per il ruolo centrale nell'inferenza. Le sue caratteristiche:
- ha la forma di una campana simmetrica attorno al valore atteso : i valori vicini alla media sono i più probabili, quelli lontani sempre meno;
- è completamente individuata da due parametri: la media (dove è centrata la campana) e lo scarto quadratico medio (quanto è larga/schiacciata);
- essendo simmetrica, media, mediana e moda coincidono (asimmetria nulla, cap. 6).
La normale descrive (almeno approssimativamente) moltissimi fenomeni naturali e sociali: altezze, errori di misura, molti fenomeni biologici ed economici. Il motivo profondo della sua importanza è il teorema del limite centrale (cap. 10): la somma (o la media) di molte cause casuali indipendenti tende a distribuirsi normalmente, qualunque sia la distribuzione delle singole cause. Questo rende la normale il modello "emergente" ovunque si sommino molti effetti — ed è la ragione per cui l'inferenza (medie campionarie, cap. 10-12) ruota attorno ad essa.
Una proprietà pratica fondamentale è la regola empirica (o 68–95–99,7): in una distribuzione normale,
- circa il 68% dei valori cade entro 1 dalla media ();
- circa il 95% entro 2 ();
- circa il 99,7% entro 3 ().
Questa regola dà un senso immediato allo scarto quadratico medio e sarà la base per costruire gli intervalli di confidenza (cap. 11) e le regioni dei test (cap. 12).
La standardizzazione e la normale standard
Perché conta: la standardizzazione permette di usare un'unica tavola per tutte le normali ed è una tecnica onnipresente nell'inferenza.
Esistono infinite distribuzioni normali (una per ogni coppia ). Per non dover ricalcolare tutto ogni volta, si ricorre alla standardizzazione: si trasforma una qualsiasi variabile normale (con media e scarto ) in una variabile che misura di quanti scarti quadratici medi un valore dista dalla media:
La variabile così ottenuta segue la normale standard: una normale con media 0 e scarto quadratico medio 1. Il valore (detto punteggio standard o z-score) dice quanto un dato è "distante", in unità di , dalla media: significa "due scarti sopra la media" (un valore piuttosto alto, dato che il 95% sta entro ±2). La standardizzazione ha due grandi vantaggi:
- rende confrontabili valori provenienti da distribuzioni diverse: un voto e un'altezza, una volta trasformati in z-score, sono confrontabili ("chi è più eccezionale rispetto al proprio gruppo?");
- permette di calcolare qualsiasi probabilità normale usando un'unica tavola (o funzione), quella della normale standard: si standardizza il valore e si legge la probabilità corrispondente.
La standardizzazione è una delle tecniche più usate in tutta la statistica: comparirà costantemente nella costruzione degli intervalli di confidenza (cap. 11) e nei test d'ipotesi (cap. 12), dove le statistiche campionarie vengono standardizzate per essere confrontate con soglie critiche sulla normale (o su distribuzioni derivate, come la di Student).
🗺️ Come si collega il tutto
Questo capitolo porta la probabilità (cap. 8) sui numeri: una variabile casuale è un numero il cui valore è incerto, governato da una distribuzione di probabilità (discreta → funzione di probabilità; continua → densità, probabilità = area), l'analogo teorico della distribuzione di frequenza (cap. 2). Si sintetizza con valore atteso (media pesata sulle probabilità, analogo del cap. 4) e varianza (dispersione, cap. 5; in finanza = rendimento atteso, = rischio). Distribuzioni notevoli: la binomiale (conteggi di successi su prove indipendenti, ) e soprattutto la normale (campana simmetrica, definita da ; regola 68-95-99,7; media=mediana=moda). La standardizzazione dà la normale standard (), che rende tutto confrontabile e calcolabile. La normale domina perché la media campionaria vi tende (teorema del limite centrale): è il ponte diretto all'inferenza (cap. 10-12).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Variabile casuale | Numero il cui valore dipende dal caso, con una distribuzione di probabilità | Carattere statistico (dati osservati, cap. 1) |
| Valore atteso | Media dei valori pesata sulle probabilità; il baricentro atteso | Media dei dati (pesata sulle frequenze, cap. 4) |
| Varianza | Dispersione dei valori attorno al valore atteso | (in finanza: il rischio) |
| Binomiale | Numero di successi in prove indipendenti ( costante); | Normale (continua, campana) |
| Normale (gaussiana) | Campana simmetrica definita da e ; media=mediana=moda | Binomiale (discreta, conteggi) |
| Regola 68-95-99,7 | ~68%/95%/99,7% dei valori entro 1/2/3 dalla media | (vale per la normale) |
| Standardizzazione | : distanza dalla media in unità di ; normale standard () | (rende confrontabile e calcolabile) |
📝 Riepilogo
- Una variabile casuale è un numero il cui valore dipende dal caso, descritto da una distribuzione di probabilità: discreta (funzione di probabilità , valori isolati) o continua (densità ; la probabilità è l'area, e singolo valore). È l'analogo teorico della distribuzione di frequenza (cap. 2) — il modello della popolazione.
- Si sintetizza con il valore atteso (media pesata sulle probabilità, il baricentro atteso — può non essere un valore possibile, es. 3,5 per il dado) e la varianza (dispersione attorno all'atteso). In finanza: = rendimento atteso, = rischio.
- Binomiale: numero di successi in prove indipendenti con costante (prove di Bernoulli); , . Modello dei conteggi (difettosi, accettazioni, guariti). Normale (gaussiana): campana simmetrica definita da (centro) e (larghezza); media=mediana=moda; regola 68-95-99,7 (% entro 1/2/3 ). È la distribuzione più importante (teorema del limite centrale, cap. 10).
- Standardizzazione: trasforma qualsiasi normale nella normale standard (, ); lo z-score dice a quanti dalla media sta un valore. Rende confrontabili distribuzioni diverse e permette di calcolare ogni probabilità con un'unica tavola. Onnipresente in intervalli di confidenza (cap. 11) e test (cap. 12). Ponte diretto all'inferenza.
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
Campionamento e distribuzioni campionarie
In breve
Siamo al cuore del passaggio dalla descrittiva all'inferenza: come si fa a dire qualcosa sull'intera popolazione avendo osservato solo un campione? La risposta poggia su due pilastri. Primo: il campione deve essere rappresentativo, e il modo per garantirlo è la casualità (campionamento casuale). Secondo, l'idea più profonda del corso: una statistica calcolata sul campione (es. la media campionaria) è essa stessa una variabile casuale — cambierebbe se estraessi un altro campione — e ha una propria distribuzione, la distribuzione campionaria. Capire come si comporta questa distribuzione (grazie al teorema del limite centrale) è ciò che permette di misurare l'incertezza delle stime. Questo capitolo studia il campionamento e le distribuzioni campionarie.
🎯 Alla fine di questo capitolo saprai: perché serve un campione casuale e rappresentativo; cos'è una distribuzione campionaria; l'errore standard; e il teorema del limite centrale, il risultato che rende possibile l'inferenza.
Perché campionare, e come farlo bene
Perché conta: la qualità di ogni inferenza dipende dalla qualità del campione; un campione mal scelto rende inutile ogni calcolo successivo.
Studiare l'intera popolazione (censimento, cap. 1) è quasi sempre impossibile o antieconomico: troppo costoso, troppo lento, a volte distruttivo (per testare la durata delle lampadine non posso accenderle tutte fino a fine vita). Perciò si osserva un campione e da esso si inferisce sulla popolazione. Ma questo "salto" funziona solo se il campione è rappresentativo: se cioè "assomiglia" alla popolazione nelle caratteristiche rilevanti. Un campione distorto porta a conclusioni sbagliate per quanto raffinati siano i calcoli successivi.
Come si garantisce la rappresentatività? Non con l'intuito o la comodità (i campioni "a scelta" sono i più insidiosi), ma con la casualità. Il campionamento casuale (probabilistico) è quello in cui ogni unità della popolazione ha una probabilità nota e non nulla di essere estratta. La forma base è il campione casuale semplice, in cui ogni unità ha la stessa probabilità di essere scelta (come un'estrazione a sorte). La casualità è ciò che:
- elimina le distorsioni sistematiche (non scelgo, consciamente o no, unità di un certo tipo);
- soprattutto, permette di quantificare l'incertezza: solo con un campione casuale possiamo usare il calcolo delle probabilità (cap. 8-9) per dire quanto è affidabile la stima.
Esistono altri disegni campionari (stratificato, a grappoli, sistematico) più efficienti in certe situazioni, ma tutti si fondano sul principio della casualità. Il messaggio è netto: l'inferenza vale quanto vale il campionamento. Un campione grande ma distorto è peggio di un campione piccolo ma casuale.
⚠️ Attenzione. Il campionamento distorto (sampling bias) è l'errore più grave e più comune, e nessuna analisi successiva può correggerlo. L'esempio storico: nel 1936 un sondaggio su milioni di persone (enorme!) predisse la vittoria di Landon su Roosevelt — e sbagliò clamorosamente, perché il campione (estratto da elenchi telefonici e liste di automobilisti) sovrarappresentava i benestanti. Grande ma distorto perde contro piccolo ma casuale. La numerosità non salva dalla distorsione.
La distribuzione campionaria
Perché conta: è l'idea concettualmente più importante dell'inferenza; senza di essa non si può misurare l'incertezza di una stima.
Ecco l'idea che sta al centro di tutta l'inferenza, e che spesso all'inizio disorienta. Quando calcoliamo una statistica sul campione — poniamo la media campionaria — otteniamo un numero. Ma quel numero dipende da quale campione ci è capitato: se estraessimo un altro campione dalla stessa popolazione, otterremmo una media leggermente diversa. La media campionaria, quindi, non è un numero fisso: è essa stessa una variabile casuale (cap. 9), che assume valori diversi da campione a campione.
Se immaginiamo di estrarre tutti i possibili campioni di una data numerosità e di calcolare la media di ciascuno, questi valori formano una loro distribuzione: la distribuzione campionaria della media. È la distribuzione di probabilità della statistica, e conoscerla è ciò che ci permette di dire quanto la nostra singola stima può essere lontana dal vero valore della popolazione.
La distribuzione campionaria della media ha proprietà notevoli e "buone". Se la popolazione ha media e scarto quadratico medio , e il campione ha numerosità :
- il valore atteso della media campionaria è proprio : . In media, la media campionaria "azzecca" la media della popolazione — è uno stimatore corretto (non distorto, cap. 11);
- il suo scarto quadratico medio — detto errore standard — è:
L'errore standard misura quanto "tipicamente" la media campionaria si discosta da : è la misura dell'incertezza della stima. La formula racchiude un'intuizione fondamentale: l'errore standard diminuisce all'aumentare di (c'è al denominatore). Cioè: più grande è il campione, più precisa (meno variabile) è la stima. Ma diminuisce come , non come : per dimezzare l'errore serve un campione quattro volte più grande. È la ragione matematica per cui la precisione costa sempre di più.
Il teorema del limite centrale
Perché conta: è il teorema che rende possibile tutta l'inferenza classica; giustifica l'uso della normale ovunque.
Resta una domanda: che forma ha la distribuzione campionaria della media? La risposta è uno dei risultati più belli e potenti di tutta la matematica: il teorema del limite centrale (TLC). Esso afferma che, qualunque sia la forma della distribuzione della popolazione di partenza, la distribuzione della media campionaria tende a diventare una normale (cap. 9) al crescere della numerosità del campione.
In altre parole: anche se la popolazione ha una distribuzione strana, asimmetrica, bimodale — non importa — le medie di campioni sufficientemente grandi si distribuiscono (approssimativamente) come una campana normale, centrata su e con errore standard . In pratica, si considera l'approssimazione "buona" già per campioni con (la soglia esatta dipende da quanto la popolazione è asimmetrica).
Perché è così importante? Perché spiega perché la normale è ovunque e, soprattutto, fonda tutta l'inferenza classica:
- non serve conoscere la distribuzione della popolazione per fare inferenza sulla media: sappiamo comunque che è (circa) normale;
- possiamo quindi usare tutte le proprietà della normale — la regola 68-95-99,7, la standardizzazione (cap. 9) — per calcolare quanto probabilmente la media campionaria è vicina a ;
- questo permette di costruire intervalli di confidenza (cap. 11) e test d'ipotesi (cap. 12), che sono applicazioni dirette di questo fatto.
Il TLC è, in un certo senso, il "motore nascosto" della statistica inferenziale: la ragione per cui, pur ignorando quasi tutto della popolazione, possiamo comunque fare affermazioni probabilistiche affidabili su di essa a partire da un campione.
🧩 Esempio. Il reddito nella popolazione è fortemente asimmetrico (coda a destra, cap. 6): non è affatto normale. Vogliamo stimare il reddito medio . Estraiamo un campione di famiglie e calcoliamo €. Grazie al TLC, sappiamo che la media campionaria è (circa) normale con centro (incognito) ed errore standard — nonostante i redditi individuali siano asimmetrici. Se lo scarto della popolazione fosse , l'errore standard sarebbe 1.200 €: la nostra media campionaria "tipicamente" dista ~1.200 € dal vero . Da qui (cap. 11) costruiremo un intervallo del tipo " è, con il 95% di confidenza, tra ~28.600 e ~33.400". Il TLC è ciò che rende lecito questo ragionamento anche partendo da una popolazione non normale.
🗺️ Come si collega il tutto
Questo capitolo apre l'inferenza: dal campione alla popolazione. Serve un campione rappresentativo, garantito dalla casualità (campionamento casuale) — senza cui nessun calcolo salva dalla distorsione (sampling bias). Idea centrale: una statistica (es. la media campionaria ) è una variabile casuale (cap. 9) con una distribuzione campionaria, di cui conosciamo il centro (, stimatore corretto) e la dispersione, l'errore standard (l'incertezza; cala come → più dati, più precisione). Il teorema del limite centrale garantisce che è (circa) normale per grande, qualunque sia la popolazione: questo, con la standardizzazione (cap. 9), fonda tutta l'inferenza. I due strumenti che ne derivano: la stima (cap. 11) e la verifica di ipotesi (cap. 12).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Campione rappresentativo | Assomiglia alla popolazione; garantito dalla casualità | Campione distorto (grande ma inaffidabile) |
| Campionamento casuale | Ogni unità ha probabilità nota e non nulla di essere estratta | Campione "a scelta"/di comodo (distorto) |
| Distribuzione campionaria | La distribuzione di probabilità di una statistica (es. ) | Distribuzione dei dati (un singolo campione) |
| Errore standard | : scarto della media campionaria = incertezza della stima | Scarto della popolazione (dei singoli dati) |
| Stimatore corretto | In media azzecca il parametro: | (distorto: sistematicamente sopra/sotto) |
| Teorema del limite centrale | è ~normale per grande, qualunque sia la popolazione | (vale per la media, non per i singoli dati) |
📝 Riepilogo
- L'inferenza generalizza dal campione alla popolazione. Condizione irrinunciabile: il campione deve essere rappresentativo, garantito dalla casualità (campionamento casuale: ogni unità ha probabilità nota e non nulla; il caso base è il casuale semplice, stessa probabilità per tutti). La casualità elimina le distorsioni e permette di quantificare l'incertezza. Il sampling bias è l'errore più grave: grande ma distorto perde contro piccolo ma casuale (Landon vs Roosevelt 1936).
- Idea centrale: una statistica (es. la media campionaria ) cambia da campione a campione → è una variabile casuale con una distribuzione campionaria. Per la media: (stimatore corretto) e errore standard (misura dell'incertezza). L'errore cala come : più dati → più precisione, ma per dimezzarlo serve quadruplo.
- Teorema del limite centrale (TLC): la media campionaria tende a una distribuzione normale al crescere di (in pratica ), qualunque sia la forma della popolazione. È il "motore nascosto" dell'inferenza: spiega l'ubiquità della normale e permette — con la standardizzazione (cap. 9) — di fare affermazioni probabilistiche sulla popolazione anche ignorandone la distribuzione. Fonda intervalli di confidenza (cap. 11) e test (cap. 12).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
La stima: puntuale e per intervalli
In breve
Ora possiamo usare la macchina dell'inferenza (cap. 10) per il primo grande obiettivo: stimare un parametro incognito della popolazione (la media, una proporzione) a partire dal campione. Ci sono due modi. La stima puntuale fornisce un singolo numero (la media campionaria come stima della media della popolazione): semplice, ma non dice quanto è affidabile e quasi certamente non è esatta. La stima per intervallo fornisce invece un intervallo di valori — l'intervallo di confidenza — accompagnato da un livello di confidenza (es. 95%) che ne esprime l'affidabilità. L'intervallo di confidenza è uno dei concetti più usati (e più fraintesi) della statistica. Questo capitolo studia la stima.
🎯 Alla fine di questo capitolo saprai: distinguere stima puntuale e per intervallo; le proprietà di un buon stimatore (correttezza, efficienza); costruire e interpretare un intervallo di confidenza; e il ruolo del livello di confidenza e della numerosità.
La stima puntuale
Perché conta: è il modo più diretto di stimare un parametro, ma i suoi limiti motivano l'intera teoria degli intervalli.
La stima puntuale consiste nell'usare una statistica calcolata sul campione (uno stimatore) per fornire un singolo valore come "miglior indovinello" del parametro incognito della popolazione. Gli stimatori naturali:
- la media campionaria stima la media della popolazione ;
- la proporzione campionaria (frazione di "successi" nel campione) stima la proporzione della popolazione ;
- la varianza campionaria (con denominatore , cap. 5) stima la varianza della popolazione .
La stima puntuale è semplice e intuitiva, ma ha un limite decisivo: fornisce un numero senza dire quanto è affidabile, e — trattandosi di una variabile casuale (cap. 10) — è quasi certamente diversa dal vero parametro. Dire "il reddito medio stimato è 31.000 €" non dice se il vero valore è verosimilmente 30.900 o potrebbe essere 25.000. Manca la misura dell'incertezza. Da qui la necessità della stima per intervallo.
Prima, però, una domanda: cosa rende uno stimatore "buono"? Due proprietà principali:
- correttezza (non distorsione): in media, lo stimatore "azzecca" il parametro; il suo valore atteso è proprio il parametro (, cap. 10). Non ha errori sistematici. È il motivo per cui la varianza campionaria usa e non : con sarebbe distorta (sottostimerebbe sistematicamente ); con diventa corretta.
- efficienza: a parità di correttezza, è preferibile lo stimatore con varianza minore (errore standard più piccolo), perché fornisce stime più precise (meno "ballerine" da campione a campione).
Un buon stimatore è corretto ed efficiente. La media campionaria gode di entrambe le proprietà, ed è per questo lo stimatore d'elezione della media della popolazione.
L'intervallo di confidenza
Perché conta: l'intervallo di confidenza è lo strumento standard per esprimere una stima con la sua incertezza; va costruito e interpretato con precisione.
La stima per intervallo supera il limite della puntuale: invece di un singolo numero, fornisce un intervallo di valori — l'intervallo di confidenza (IC) — entro cui si ritiene "ragionevolmente" collocato il parametro incognito, insieme a un livello di confidenza che ne quantifica l'affidabilità. La logica poggia interamente sul cap. 10: sappiamo che la media campionaria è (circa) normale, centrata su , con errore standard (TLC). Possiamo quindi "rovesciare" il ragionamento e costruire attorno alla nostra un intervallo che, con probabilità nota, contiene .
La struttura di un intervallo di confidenza per la media è:
dove: è la stima puntuale (il centro); è l'errore standard (cap. 10); è il coefficiente che dipende dal livello di confidenza scelto (dalla normale standard, cap. 9). Il prodotto è il margine di errore (semi-ampiezza dell'intervallo). I valori tipici di :
- 90% di confidenza → ;
- 95% di confidenza → (il più usato);
- 99% di confidenza → .
Così, per una confidenza del 95%, l'intervallo è : sfrutta il fatto (regola 68-95-99,7, cap. 9) che il 95% della distribuzione normale sta entro ~1,96 scarti dalla media.
⚠️ Attenzione. Quando della popolazione è incognito (quasi sempre) e lo si stima con campionario, per campioni piccoli non si usa la normale ma la distribuzione di Student (simile alla normale ma con code più pesanti, che tiene conto dell'incertezza in più dovuta allo stimare anche ). Per grande, la tende alla normale e la differenza svanisce. Analogamente, per stimare una proporzione l'errore standard è . La struttura (stima ± margine) resta comunque la stessa.
🧩 Esempio. Riprendiamo il reddito (cap. 10): campione di famiglie, media €, con errore standard €. Intervallo di confidenza al 95%: , cioè [28.648 ; 33.352]. Interpretazione: con il metodo usato, siamo "confidenti al 95%" che il vero reddito medio della popolazione stia in questo intervallo. Se volessimo più sicurezza (99%): → [27.909 ; 34.091], intervallo più largo. Più confidenza vuoi, più ampio (meno preciso) è l'intervallo: è il trade-off centrale della stima.
Interpretare la confidenza e il ruolo di n
Perché conta: il livello di confidenza è il concetto più frainteso della statistica; capirlo bene evita errori interpretativi gravissimi.
Che cosa significa esattamente "intervallo di confidenza al 95%"? Qui si annida il fraintendimento più comune di tutta la statistica. L'interpretazione corretta è frequentista:
Se ripetessimo il campionamento moltissime volte, costruendo ogni volta un intervallo con questo metodo, circa il 95% di quegli intervalli conterrebbe il vero parametro .
La confidenza è una proprietà del metodo (della procedura), non del singolo intervallo. L'interpretazione scorretta (ma diffusissima) è: "c'è il 95% di probabilità che stia in questo intervallo". Perché è sbagliata? Perché una volta calcolato, il nostro intervallo [28.648; 33.352] è fisso, e il vero è un numero fisso (anche se incognito): o ci sta o non ci sta — non c'è più "probabilità" in gioco per il singolo intervallo. La probabilità del 95% riguarda la frequenza di successo del metodo sul lungo periodo, non il caso singolo. È una distinzione sottile ma essenziale, e distingue chi ha capito l'inferenza da chi ripete formule.
Il ruolo della numerosità e della confidenza. L'ampiezza dell'intervallo (la precisione della stima) dipende da tre fattori, tramite il margine di errore :
- livello di confidenza: più lo si alza (95% → 99%), più cresce, più l'intervallo si allarga. Maggiore sicurezza = minore precisione. Non si può avere tutto: è un trade-off;
- variabilità : più la popolazione è variabile, più largo l'intervallo (a parità di resto);
- numerosità : più grande è il campione, più stretto l'intervallo (c'è al denominatore) → stime più precise. Ma, di nuovo, la precisione migliora come : per dimezzare l'ampiezza serve quadruplicare il campione.
Questa relazione è la base pratica per progettare un'indagine: fissato il margine di errore e la confidenza che si desiderano, si ricava la numerosità campionaria necessaria. È il calcolo che sta dietro ogni sondaggio serio ("stima ±3%, con confidenza del 95%").
🗺️ Come si collega il tutto
Questo capitolo applica la macchina dell'inferenza (cap. 10) alla stima di un parametro. La stima puntuale usa uno stimatore ( per , per , per ): un buon stimatore è corretto (non distorto: ; da cui nella varianza, cap. 5) ed efficiente (varianza minima). Limite: un numero senza incertezza. La stima per intervallo dà l'intervallo di confidenza : centro = stima, margine = (dalla normale, cap. 9) × errore standard (cap. 10). Se è ignoto e piccolo → di Student. La confidenza è una proprietà del metodo (frequentista), non del singolo intervallo. L'ampiezza dipende da confidenza, e (trade-off precisione/sicurezza; ): base per dimensionare le indagini. Lo stesso apparato (statistica standardizzata, soglie sulla normale) fonda il secondo strumento dell'inferenza: la verifica di ipotesi (cap. 12).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Stima puntuale | Un singolo valore come stima del parametro (es. per ) | Stima per intervallo (un intervallo + confidenza) |
| Stimatore corretto | In media azzecca il parametro (no errori sistematici) | Efficiente (varianza minima, più preciso) |
| Intervallo di confidenza | : intervallo che "cattura" il parametro con confidenza data | Stima puntuale (un numero senza incertezza) |
| Margine di errore | : la semi-ampiezza dell'intervallo | Errore standard (, senza il ) |
| Livello di confidenza | % di intervalli che (ripetendo) conterrebbero il parametro | NON "probabilità che sia in questo intervallo" |
| di Student | Sostituisce la normale quando è ignoto e piccolo | Normale (nota , o grande) |
📝 Riepilogo
- La stima puntuale usa uno stimatore per dare un singolo valore del parametro: stima , stima , (con ) stima . Limite: nessuna misura di affidabilità e quasi sicuramente non esatta. Un buon stimatore è corretto (non distorto: — perché la varianza usa ) ed efficiente (varianza minima, stime più precise).
- La stima per intervallo dà un intervallo di confidenza: , dove è il centro, l'errore standard (cap. 10) e dipende dalla confidenza ( per 90%, per 95%, per 99%). Sfrutta la normalità di (TLC/regola 68-95-99,7). Se è ignoto e piccolo → di Student.
- Interpretazione corretta (frequentista): ripetendo il campionamento, ~95% degli intervalli così costruiti conterrebbe — è una proprietà del metodo. Scorretto: "il 95% di probabilità che sia in questo intervallo" (l'intervallo è fisso, è fisso).
- L'ampiezza dipende da: confidenza (più alta → più largo: trade-off sicurezza/precisione), variabilità , numerosità (più grande → più stretto, come : dimezzare l'errore richiede quadruplo). Da qui si dimensiona un'indagine (es. sondaggio "±3%, 95%"). Stesso apparato → verifica di ipotesi (cap. 12).
Statistica
Hai letto. Ora impara.
L'AI trasforma questo modulo in strumenti di studio personalizzati.
La verifica delle ipotesi
In breve
Chiudiamo il corso con il secondo grande strumento dell'inferenza, forse il più usato nella ricerca scientifica: la verifica (o test) delle ipotesi. La domanda cambia: non più "quanto vale il parametro?" (stima, cap. 11), ma "un'affermazione sulla popolazione è plausibile alla luce dei dati?". Un nuovo farmaco funziona meglio del vecchio? La media è cambiata? Due gruppi differiscono? Il test è una procedura rigorosa per decidere tra due ipotesi contrapposte usando i dati campionari, sapendo che — poiché lavoriamo su un campione — possiamo sbagliare, e controllando la probabilità di sbagliare. Concetti come ipotesi nulla, significatività, p-value sono qui, e sono il linguaggio di ogni studio empirico. Questo capitolo studia la verifica delle ipotesi.
🎯 Alla fine di questo capitolo saprai: impostare ipotesi nulla () e alternativa (); capire gli errori di I e II tipo e la significatività ; usare la statistica test e il p-value per decidere; e interpretare correttamente un risultato "significativo".
Le ipotesi e la logica del test
Perché conta: impostare correttamente le ipotesi e capire la logica "per assurdo" del test è il presupposto di ogni analisi corretta.
Un test d'ipotesi serve a decidere, sulla base dei dati campionari, se un'affermazione riguardante la popolazione è sostenibile. La procedura contrappone due ipotesi:
- l'ipotesi nulla (): l'affermazione "di default", di assenza di effetto, di status quo, "nessuna differenza". Es.: "il nuovo farmaco non è più efficace del vecchio", "la media non è cambiata", "la moneta è equa". È l'ipotesi che si assume vera fino a prova contraria.
- l'ipotesi alternativa (): ciò che si vuole eventualmente dimostrare, la presenza di un effetto/differenza. Es.: "il nuovo farmaco è più efficace", "la media è cambiata".
La logica del test è sottile e ricalca quella di un processo per direttissima o di una dimostrazione "per assurdo": si assume vera e si guarda se i dati osservati sono compatibili con essa. Se i dati sono ciò che ci si aspetterebbe sotto , non c'è motivo di abbandonarla. Se invece i dati sono molto improbabili sotto (troppo "strani" per essere frutto del caso, se fosse vera), allora si rifiuta a favore di : si conclude che l'effetto c'è.
Un punto cruciale, spesso frainteso: il test è asimmetrico. Non "dimostra" : se i dati sono compatibili con , si dice che "non si può rifiutare ", non che " è vera". È come in tribunale: l'imputato è presunto innocente (); se le prove non bastano, viene assolto ("non colpevole"), il che non significa dimostrato innocente, ma solo che non ci sono prove sufficienti per condannarlo. Il test può rifiutare (condanna, "oltre ogni ragionevole dubbio") o non rifiutarla (assoluzione), mai "accettarla" come dimostrata.
🔗 Analogia. Il test d'ipotesi è un processo penale. = "innocente" (lo status quo che si presume finché non si prova il contrario); = "colpevole" (ciò che l'accusa deve dimostrare). I dati sono le prove. Si condanna (rifiuto ) solo se le prove sono incompatibili con l'innocenza "oltre ogni ragionevole dubbio" (la significatività ). Se le prove non bastano, si assolve senza dichiarare l'imputato innocente. E si può sbagliare in due modi: condannare un innocente (errore di I tipo) o assolvere un colpevole (errore di II tipo) — esattamente i due errori del test.
I due tipi di errore e la significatività
Perché conta: poiché lavoriamo su un campione, possiamo sbagliare; capire e controllare i due errori è il cuore del metodo.
Poiché la decisione si basa su un campione (non sull'intera popolazione), il test può portare a una conclusione sbagliata. Ci sono due modi di sbagliare, non simmetrici:
- Errore di I tipo (falso positivo): rifiutare quando è vera. Cioè "gridare all'effetto" quando in realtà non c'è (condannare un innocente; dichiarare efficace un farmaco che non lo è). La probabilità di questo errore si indica con ed è chiamata livello di significatività del test.
- Errore di II tipo (falso negativo): non rifiutare quando è falsa. Cioè non accorgersi di un effetto che esiste (assolvere un colpevole; non riconoscere un farmaco efficace). La sua probabilità si indica con . La quantità è la potenza del test (la capacità di "scovare" un effetto reale).
Il livello di significatività è la soglia che l'analista fissa in anticipo: la massima probabilità di errore di I tipo che è disposto ad accettare. I valori convenzionali sono (5%) o (1%). Scegliere significa: "accetto un rischio del 5% di rifiutare erroneamente ". È il "livello di prova" richiesto per la "condanna".
C'è un trade-off ineliminabile tra i due errori: rendere il test più "prudente" (abbassare , per non condannare innocenti) aumenta il rischio di errore di II tipo (assolvere colpevoli, ), e viceversa. Non si possono minimizzare entrambi contemporaneamente a parità di campione; l'unico modo per ridurli insieme è aumentare la numerosità (più dati = più potenza a parità di ). La scelta di riflette quale errore è più grave nel contesto: in medicina, dichiarare efficace un farmaco inutile (I tipo) può essere gravissimo, e si tiene basso.
La statistica test e il p-value
Perché conta: la statistica test e il p-value sono gli strumenti operativi con cui si prende concretamente la decisione.
Come si decide, in pratica, se i dati sono "troppo strani" sotto ? Con due strumenti equivalenti.
La statistica test. Si calcola dai dati campionari una statistica test, che tipicamente standardizza (cap. 9) la stima rispetto a ciò che ci si aspetterebbe sotto . Per un test sulla media, ad esempio, essa misura di quanti errori standard la media campionaria si discosta dal valore ipotizzato :
Se è vera, questa statistica segue una distribuzione nota (la normale standard, o la di Student se è stimato, cap. 11). Si confronta il valore calcolato con dei valori critici che delimitano la regione di rifiuto: se la statistica test "cade" nella regione di rifiuto (è più estrema dei valori critici corrispondenti ad ), si rifiuta . In pratica: se la media campionaria è troppo lontana (troppi ) da per essere plausibile sotto , si rifiuta.
Il p-value. È l'approccio equivalente e oggi più usato. Il p-value è la probabilità di osservare un risultato estremo (o più estremo) di quello effettivamente ottenuto, assumendo vera . In altre parole, misura quanto sono "sorprendenti" i dati se fosse vera:
- p-value piccolo (es. 0,001): i dati osservati sarebbero molto improbabili sotto → forte evidenza contro → si rifiuta;
- p-value grande (es. 0,40): i dati sono ben compatibili con → non si rifiuta.
La regola decisionale è semplice: si rifiuta se p-value . Se il p-value è sotto la soglia di significatività fissata, il risultato si dice statisticamente significativo. Il p-value è comodo perché fornisce non solo la decisione (sì/no) ma anche una misura graduata della forza dell'evidenza contro .
🧩 Esempio. Una macchina dovrebbe riempire bottiglie con ml. Si sospetta che si sia starata. Campione di bottiglie: media ml, con errore standard ml. : (tarata); : (starata). Statistica test: : la media campionaria dista 2,5 errori standard dal valore atteso. Il p-value (probabilità di un risultato così estremo o più, sotto ) è ≈ 0,012. Poiché , si rifiuta : c'è evidenza statisticamente significativa che la macchina sia starata. Con , invece, : non si rifiuterebbe. La soglia scelta cambia la conclusione — per questo va fissata prima.
Interpretare (e non abusare) della significatività
Perché conta: "statisticamente significativo" è tra le espressioni più abusate; interpretarla bene è essenziale per un uso onesto della statistica.
Il risultato "statisticamente significativo" (p-value < α) è potente ma insidioso, e va interpretato con rigore per non trarne conclusioni sbagliate. Alcuni avvertimenti fondamentali, che riassumono lo spirito critico di tutto il corso:
- Significatività statistica ≠ importanza pratica. Un risultato può essere statisticamente significativo ma irrilevante nella pratica. Con un campione enorme, anche una differenza minuscola e senza importanza reale (es. un farmaco che abbassa la pressione di 0,1 mmHg) può risultare "significativa". La significatività dice che l'effetto esiste (probabilmente non è caso), non che è grande o importante. Vanno sempre guardate anche la dimensione dell'effetto e la sua rilevanza concreta.
- "Non significativo" ≠ "nessun effetto". Non rifiutare non prova che l'effetto non esista: potrebbe esistere ma il campione essere troppo piccolo per rilevarlo (poca potenza). Assenza di prova non è prova di assenza.
- La soglia è una convenzione, non una verità di natura. Un p-value di 0,049 e uno di 0,051 sono praticamente identici come evidenza, eppure cadono su lati opposti della soglia. Trattare 0,05 come un confine sacro è un errore.
- Attenzione agli abusi: testare molte ipotesi e riportare solo quelle "significative" (p-hacking), o confondere la significatività con la conferma dell'ipotesi, genera falsi risultati. È una delle cause della "crisi di riproducibilità" nella scienza.
Questi caveat non sminuiscono il test d'ipotesi, che resta lo strumento-cardine della ricerca empirica: lo rendono usabile con onestà. E riassumono la lezione di fondo dell'intero corso di statistica: gli strumenti sono potenti, ma vanno usati con spirito critico, sapendo cosa dicono davvero e cosa non dicono. Saper leggere un dato senza farsi ingannare — da una media, da un grafico, da una correlazione, da un p-value — è il vero traguardo della statistica.
🗺️ Come si collega il tutto
Questo capitolo chiude l'inferenza (e il corso) con la verifica di ipotesi: decidere se un'affermazione sulla popolazione è plausibile, contrapponendo ipotesi nulla (nessun effetto, status quo) e alternativa . Logica "per assurdo"/processuale: si assume e la si rifiuta solo se i dati sono troppo improbabili sotto di essa (mai "accettarla"). Due errori: I tipo (rifiutare vera, probabilità = significatività) e II tipo (non rifiutare falsa, ; potenza ), in trade-off (ridurli insieme richiede più ). Operativamente: la statistica test standardizza (cap. 9) la stima sotto e la confronta con la regione di rifiuto; equivalentemente il p-value (probabilità di dati così estremi sotto ) → si rifiuta se p < α. Cautele: significatività ≠ importanza, "non significativo" ≠ nessun effetto, α=0,05 è convenzione. Riprende stima ed errore standard (cap. 10-11) e chiude riportando allo spirito critico di tutta la statistica (cap. 1, 3, 7).
🔑 Concetti chiave
| Termine | In una frase | Da non confondere con |
|---|---|---|
| Ipotesi nulla | L'affermazione di "nessun effetto"/status quo, presunta vera fino a prova contraria | Alternativa (ciò che si vuole dimostrare) |
| Errore di I tipo | Rifiutare quando è vera (falso positivo); probabilità | II tipo (non rifiutare falsa, ) |
| Livello di significatività | Soglia (fissata prima) di rischio di errore di I tipo accettato (5%, 1%) | p-value (calcolato dai dati) |
| Statistica test | Standardizza la stima rispetto a ; se cade nella regione di rifiuto → rifiuto | (segue una distribuzione nota sotto ) |
| p-value | Probabilità di dati così estremi (o più) se fosse vera | (soglia fissa); non è "prob. che sia vera" |
| Statisticamente significativo | p-value < : si rifiuta | Importante (significativo ≠ grande/rilevante) |
📝 Riepilogo
- Il test d'ipotesi decide se un'affermazione sulla popolazione è plausibile, contrapponendo ipotesi nulla (nessun effetto/status quo) e alternativa (l'effetto che si vuole dimostrare). Logica processuale: si assume e la si rifiuta solo se i dati sono molto improbabili sotto di essa; altrimenti "non si rifiuta" (≠ "si accetta"/"è vera"). Presunzione d'innocenza.
- Due errori: I tipo (rifiutare vera = falso positivo, probabilità ) e II tipo (non rifiutare falsa = falso negativo, ; potenza ). Il livello di significatività (fissato prima: 0,05, 0,01) è il rischio di I tipo accettato. Trade-off tra i due errori: ridurli insieme richiede più .
- Decisione operativa: la statistica test (es. ) standardizza (cap. 9) la stima sotto ; se cade nella regione di rifiuto → si rifiuta. Equivalente e più usato: il p-value = probabilità di osservare dati così estremi (o più) se è vera. Regola: si rifiuta se p-value < → risultato statisticamente significativo.
- Cautele (spirito critico): significatività statistica ≠ importanza pratica (un enorme rende significativo anche un effetto minuscolo); "non significativo" ≠ "nessun effetto" (magari poca potenza); è una convenzione (0,049 vs 0,051); attenzione al p-hacking. Il traguardo della statistica: leggere i dati senza farsi ingannare.
Statistica
Hai finito il corso. Ora studia davvero.
Usa l'AI per consolidare tutto quello che hai studiato.