Analisi Econometrica: Dati, Modelli e Test Statistici
Classificazione dei Dati: Quantitativi vs Qualitativi
Dati Quantitativi
- Si tratta di dati facilmente misurabili e quantificabili attraverso specifiche unità di misura.
- Esempi descritti:
- Reddito (espresso in euro o migliaia di euro).
- Prezzo (espresso in euro o dollari).
- Indicatori di performance aziendale come il ROE (Return on Equity) e il ROA (Return on Assets), espressi in percentuali.
- Dimensione aziendale, misurata tramite il numero di lavoratori o il logaritmo del totale attivo.
Dati Qualitativi
- Riguardano caratteristiche intrinseche più complesse da misurare numericamente in modo diretto.
- Esempi descritti: Genere, livello di istruzione, variabili percettive.
- Metodologia di misurazione:
- Variabili Dummy (dicotomiche): Possiedono solo 2 categorie o classi (ad esempio 0 o 1).
- Variabili Categoriali: Possiedono più di 2 categorie o classi.
Tipologie di Dataset in Econometria
Cross-section (Dati trasversali)
- Raccolgono dati su varie entità o unità (individui, imprese, lavoratori, paesi) in un singolo istante temporale ().
- Dimensione: , dove indica il numero di entità.
- Esempio 1: Studio del PIL di 30 paesi OCSE nell'anno 2021 (, ). Questo genera un vettore di dimensione .
- Esempio 2: Studio dello stipendio di 100 lavoratori nell'anno 2018 considerando il genere tramite una variabile dummy ( se femmina, altrimenti).
Serie Storiche (Time Series)
- Dati indicizzati in ordine temporale naturale, costituiti da osservazioni raccolte a intervalli di tempo discreti e regolari.
- Differenza chiave: A differenza dei dati trasversali, nelle serie storiche l'ordinamento cronologico è fondamentale per l'analisi.
- Operazioni comuni: Differenze prime, ritardi (lags) e tassi di variazione.
Panel (Dati Longitudinali)
- Dataset multidimensionale in cui si osservano molteplici entità () che cambiano nel corso del tempo ().
- Dimensioni: Richiede almeno due periodi di tempo (); la dimensione totale è .
- Panel Bilanciato: Tutti i partecipanti sono osservati costantemente per l'intera durata dello studio.
- Panel Sbilanciato: Include partecipanti osservati solo parzialmente, con conseguenti lacune nei dati.
- Distinzione dai Pooled Cross-sections: I dati panel tracciano gli stessi soggetti nel tempo, mentre i dati aggregati (pooled) combinano osservazioni di soggetti diversi in vari punti temporali trattandole come indipendenti.
Assunzioni e Proprietà degli Stimatori OLS (Minimi Quadrati Ordinari)
Le 3 Assunzioni Fondamentali (Regressione Semplice)
- Media Condizionata Zero: La distribuzione dell'errore data ha media zero: . Ciò implica che non vi sia correlazione tra il regressore e l'errore ().
- i.i.d.: Le coppie per sono indipendentemente e identicamente distribuite. Questa condizione è soddisfatta se i dati sono raccolti tramite campionamento casuale.
- Assenza di Outlier estremi: Gli outlier di grandi dimensioni sono rari; la presenza di valori anomali può distorcere pesantemente le stime OLS.
Proprietà degli Stimatori
- Quando le tre assunzioni sono rispettate, gli stimatori e sono non distorti (unbiased).
- Teorema del Limite Centrale: Per campioni sufficientemente grandi, la distribuzione campionaria degli stimatori è approssimativamente normale, indipendentemente dalla distribuzione originale dell'errore.
- Accuratezza e Dimensione Campionaria ():
- Al crescere di , l'incertezza associata alla varianza degli stimatori diminuisce.
- Un aumento di porta a valori più bassi per e .
- La distribuzione si concentra maggiormente attorno ai veri parametri della popolazione (maggiore precisione).
Verifica delle Ipotesi (Hypothesis Testing)
Incertezza Campionaria: Poiché i dati provengono da un campione e non dall'intera popolazione, esiste sempre un grado di incertezza misurato dall'Errore Standard (SE).
- .
- Un SE piccolo indica una stima precisa; un SE grande indica una stima imprecisa.
L'Ipotesi Nulla ()
- Rappresenta la convinzione mantenuta valida fino a prova contraria dall'evidenza campionaria.
- Formulazione tipica: .
- Test di Significatività: Caso comune in cui si pone (l'ipotesi che la variabile non abbia impatto su ).
L'Ipotesi Alternativa ()
- Test Bilaterale (Due code): . Si usa quando si cerca una differenza generica, senza specificarne la direzione.
- Test Unilaterale (Una coda):
- (direzione positiva).
- (direzione negativa).
La Statistica-t
- Si calcola come: .
Regione di Rifiuto e Valori Critici
- Se il valore calcolato cade nella regione di rifiuto, si rigetta .
- Livello di Significatività (): Probabilità di commettere un Errore di Tipo I (rifiutare quando è vera). Valori comuni: , , .
- Per un test bilaterale al , i valori critici sono . Se , si rifiuta l'ipotesi nulla.
Tipi di Errore
- Tipo I: Rifiutare vera ().
- Tipo II: Non rifiutare falsa.
P-value e Intervalli di Confidenza
P-value
- Definizione: Probabilità di ottenere una statistica test almeno tanto estrema quanto quella osservata, assumendo che sia vera.
- Regola decisionale:
- Se Rifiuta .
- Se Non rifiutare .
- Soglie comuni in software come R:
- Rifiuto all' (segnalato con
***). - Rifiuto al (segnalato con
*). - Rifiuto al (segnalato con
.).
- Rifiuto all' (segnalato con
Intervallo di Confidenza (CI)
- L'intervallo che contiene il vero valore del parametro della popolazione una determinata percentuale di volte (es. ) in caso di campionamenti ripetuti.
- Formula per un CI al :
Applicazione Pratica: Il Modello CAPM
- Il Capital Asset Pricing Model (CAPM) utilizza la regressione per analizzare i titoli finanziari.
- Parametri chiave:
- Beta (): Misura il rischio sistematico dell'asset rispetto al mercato.
- : Titolo difensivo (meno rischioso del mercato).
- : Titolo aggressivo (più rischioso del mercato).
- Alfa di Jensen (): Rappresenta il rendimento anomalo.
- : Sovraperformance.
- : Sottoperformance.
- : La performance è spiegata interamente dal rischio indicato dal beta.
- Beta (): Misura il rischio sistematico dell'asset rispetto al mercato.
Eteroschedasticità vs Omoschedasticità
- Omoschedasticità: La varianza dell'errore condizionata a è costante: .
- Eteroschedasticità: La varianza dell'errore non è costante: .
- Conseguenze dell'Eteroschedasticità:
- Gli stimatori OLS rimangono non distorti e consistenti.
- Gli Errori Standard () sono errati.
- I test-t e gli intervalli di confidenza non sono più affidabili.
- Lo stimatore OLS non è più BLUE (Best Linear Unbiased Estimator).
- Rimedi:
- Utilizzo di Errori Standard Robusti (es. HC0, HC1, HAC per le serie storiche).
- Test di rilevazione: Test di Breusch-Pagan e Test di White.
Teorema di Gauss-Markov
- Lo stimatore OLS è il migliore tra tutti gli stimatori lineari non distorti (BLUE) se valgono le 5 assunzioni:
- Modello lineare nei parametri.
- Campionamento casuale (i.i.d.).
- Assenza di collinearità perfetta.
- Omoschedasticità (Varianza costante dell'errore).
- Assenza di autocorrelazione degli errori.
- "Migliore" significa che ha la varianza più piccola tra tutti i possibili stimatori lineari non distorti.
Regressione Multipla e Distorsione da Variabile Omessa
Modello Generale:
Coefficiente di regressione parziale (): Misura l'effetto di una variazione in su , mantenendo costanti (ceteris paribus) tutti gli altri regressori nel modello.
Distorsione da Variabile Omessa (Omitted Variable Bias - OVB)
- Si verifica quando una variabile rilevante () viene esclusa dal modello.
- Due condizioni per OVB:
- è un determinante di (influenza direttamente la variabile dipendente).
- è correlata con il regressore incluso nel modello.
- Esempio: Relazione tra punteggio nei test () e rapporto studenti-insegnanti (). Se si omette la percentuale di studenti non madrelingua (), la stima di sarà distorta perché influenza i punteggi ed è correlata con le risorse scolastiche.
Misurazione della Bontà dell'Adattamento (Goodness-of-fit)
- R-quadrato (): Proporzione della varianza di spiegata dai regressori .
- Problema: L' aumenta sempre all'aggiunta di nuovi regressori, anche se irrilevanti.
- R-quadrato Corretto (Adjusted ): Introduce una penale per l'aggiunta di variabili.
- Aumenta solo se il nuovo regressore migliora il modello più di quanto ci si aspetterebbe per caso.
- È sempre inferiore all' standard.
- Criteri di Informazione (AIC e BIC/SC):
- Utilizzati per confrontare modelli con la stessa variabile dipendente.
- Si preferisce il modello che minimizza i valori di AIC e BIC.
Collinearità Perfetta e Imperfetta
- Collinearità Perfetta: Un regressore è una combinazione lineare esatta di altri regressori.
- Esempio: La trappola delle dummy. Accade se si includono tutte le categorie di una variabile dummy insieme all'intercetta.
- Conseguenza: Il software esclude automaticamente una variabile perché il modello non può essere stimato.
- Collinearità Imperfetta: Due o più regressori sono altamente correlati tra loro.
- Conseguenza: Gli errori standard aumentano sensibilmente, rendendo le stime imprecise.
- Misurazione: VIF (Variance Inflation Factor). Valori di VIF indicano multicollinearità problematica.
Autocorrelazione dei Residui
- Comune nelle Serie Storiche dove le osservazioni successive sono correlate ().
- Test di Durbin-Watson (DW):
- Verifica l'autocorrelazione di primo ordine.
- Statistica compresa tra e .
- : Assenza di autocorrelazione.
- : Autocorrelazione positiva.
- : Autocorrelazione negativa.
- Rimedi: Utilizzo di errori standard HAC (Newey-West), inclusione di valori ritardati (lags) o differenze prime.
Test F per Ipotesi Congiunte
- Si usa per testare restrizioni multiple (es. ).
- L'approccio "coefficiente per coefficiente" con i test-t non è valido perché la probabilità di commettere un Errore di Tipo I aumenterebbe oltre il livello stabilito (es. diventerebbe circa il invece del ).
- Il Test F confronta un modello non restrittivo (completo) con un modello restrittivo (dove i coefficienti sotto verifica sono posti a zero).
- Test di Significatività Globale: Un caso particolare di test F dove si verifica se almeno uno dei coefficienti (esclusa l'intercetta) sia diverso da zero.
Modelli di Regressione Non Lineare
- Funzioni Polinomiali: Includono termini come o per catturare relazioni curve. L'effetto marginale cambia a seconda del valore di .
- Modelli Logaritmici:
- Linear-Log (): Un aumento dell' in è associato a una variazione media di unità in .
- Log-Linear (): Un aumento unitario in associato a una variazione percentuale media del in .
- Log-Log (): Un aumento dell' in è associato a una variazione percentuale media del in (elasticità).
Termini di Interazione
- Permettono di modellare come l'effetto di un regressore dipenda dal valore di un altro.
- Interazione Dummy-Continua: Consente di avere rette con pendenze e intercette diverse per gruppi differenti (es. l'effetto dell'istruzione può differire tra maschi e femmine).
- Interazione Continua-Continua: L'effetto marginale di una variabile è funzione dell'altra variabile. Se , l'effetto di una variazione unitaria in è .