STAT-C11
Cours de Statistique - Semaine 11 : Intervalles de Confiance et Tests pour la Moyenne
Présentation Initiale : SDSA et Projets Étudiants
Collaboration SDSA (Swiss Diplomacy Student Association) : * Une association qui promeut et démocratise la diplomatie pour les étudiants. * Lancement d'un podcast en collaboration avec diverses entités (Suisse Presse Club, étudiants de deuxième année du BAR-I dans le cadre du cours gestion de projet). * Le premier épisode traite de la droite en Suisse et en Europe, avec la participation du professeur Scarini. * Disponibilité : YouTube et Spotify via le compte Instagram de la SDSA. * Futurs épisodes prévus avec l'AESPRI, incluant des formats de micro-trottoirs.
Conférence Annoncée : * Sujet : Pourquoi y a-t-il de plus en plus de femmes à la tête des partis de droite ? * Lieu : Domaine du Club Suisse et la Presse. * Date/Heure : Demain soir à 18h00 (6 heures).
Introduction au Cours et Calendrier Académique
Intervenant : Samu Lorso assure les deux prochains cours (Semaines 11 et 12).
Programme : * Semaine 11 (Aujourd'hui) : Intervalles de confiance pour la moyenne et tests d'hypothèses à un échantillon (test et test ). * Semaine 12 : Tests à deux échantillons. * Semaine 13 : Examen à blanc interactif. * Durée prévue : . * Format : PDF à disposition sur le site (prévoir PC ou tablette). * Objectif : S'acclimater pour l'examen final prévu le 20 mai.
Fondements de l'Inférence Statistique
Problème Central : En pratique, on n'a presque jamais accès à la population totale. On travaille donc sur un échantillon pour estimer des paramètres de population.
Paramètres vs Statistiques : * Population : Paramètre inconnu (ex: l'espérance ). * Échantillon : Statistique calculée (ex: la moyenne d'échantillon ).
De l'Estimation Ponctuelle à l'Intervalle : * L'estimation ponctuelle (un seul point) est jugée insuffisante car elle ne garantit pas la précision par rapport à la réalité. * L'intervalle de confiance (IC) fournit une plage de valeurs (deux points) pour situer le paramètre avec un certain niveau de confiance.
Intervalles de Confiance (IC) pour la Moyenne
Définitions Clés : * Niveau de confiance : Probabilité que la méthode génère un intervalle contenant la vraie valeur du paramètre sur le long terme (ex: ). * Niveau de signification () : Le risque d'erreur, défini par . Pour un IC à , .
Interprétation Rigoureuse : * Il est faux de dire qu'il y a de chances que la vraie valeur soit dans un intervalle spécifique calculé. * La réalité est binaire : soit la valeur est dedans, soit elle n'y est pas. * L'interprétation correcte est fréquentiste : si l'on répétait l'expérience indéfiniment, des intervalles construits contiendraient la vraie valeur .
Formule de l'IC (Écart-type connu) : * * est le quantile de la loi normale standard. * est l'écart-type de la population. * est la taille de l'échantillon.
Cas Pratique 1 : Âge des Véhicules
Données : * adultes. * . * (supposé connu).
Objectif : IC à . * 1. (donc ). * 2. . * 3. Quantile à chercher dans la table normale : . * 4. Lecture table : Entre () et (). On choisit d'être généreux avec .
Calcul final : donne un intervalle de .
Détermination de la Taille de l'Échantillon ()
Marge d'erreur () : Définie comme la valeur que l'on ajoute ou soustrait à la moyenne dans l'IC. *
Formule pour : En inversant l'équation de la marge d'erreur, on obtient : *
Exemple : Étude de l'âge moyen des étudiants d'une université * Données : , Confiance = (), . * Quantile . * Calcul : . * Décision : On arrondit toujours vers le haut, donc .
La Loi de Student () : Quand est Inconnu
Contexte : En réalité, on ne connaît pas . On utilise l'écart-type de l'échantillon ().
Deux Scénarios : 1. Grand échantillon (n > 30) : On peut approximer avec la loi normale () en remplaçant par . 2. Petit échantillon () : On doit utiliser la Loi de Student.
Caractéristiques de la Loi de Student : * Symétrique, centrée en , plus aplatie que la normale (plus de probabilité dans les queues/extrêmes). * Définie par ses degrés de liberté (). * Plus augmente, plus la loi de Student converge vers la loi normale.
Note Historique : Développée par William Gosset (pseudonyme "Student") travaillant pour la brasserie Guinness au 19ème siècle.
Formule de l'IC avec Student : *
Tests d'Hypothèses : Principes et Mécanismes
Structure du Test : * Hypothèse Nulle () : L'hypothèse de base, souvent une égalité (). On cherche à voir si les données permettent de la rejeter. * Hypothèse Alternative () : Ce que l'on accepte si est rejetée.
Types d'Orientation : * Bilatéral : . * Unilatéral : H_a: \mu > \mu_0 ou H_a: \mu < \mu_0.
Le Concept de P-valeur (P-value) : * Définit la probabilité d'obtenir une statistique de test au moins aussi extrême que celle observée, en supposant que est vraie. * Règle de décision : Si , on rejette (test significatif).
Calcul de la Statistique de Test () : * (sous ).
Exemples de Tests d'Hypothèses
Exemple 1 : Taille des étudiants du BAR-I * ; . * Données : , , . * Statistique . * p\text{-valeur} = 2 \times P(Z > 0.89) = 2 \times (1 - 0.8133) = 0.3734 (). * Conclusion : Comme 37\,\% > 5\,\% , on ne peut pas rejeter . L'évidence est insuffisante.
Exemple 2 : Régime alimentaire * Variable : Différence de poids (). * . H_a : \mu < 0 (perte de poids). * Données : , , calculé sur l'échantillon. * Résultat : (). * Conclusion : Puisque 0.57\,\% < 5\,\% , on rejette . Le régime est jugé efficace.
Approche par Valeurs Critiques (Loi de Student)
Difficulté du calcul de $p$-valeur : Sans logiciel, calculer la $p$-valeur exacte avec Student est difficile.
Alternative : Utiliser la table de Student pour trouver une "valeur critique".
Méthode : * On définit une région de rejet au-delà d'un quantile critique. * Si la statistique observée est plus extrême que la valeur critique, on rejette .
Dernier Exemple du Cours (Âge BAR-I) : * . H_a: \mu > 18. * Données : , , . * Statistique . * On doit comparer ce au quantile critique de la table de Student à ().
Questions & Discussion
Q : Peut-on changer le alpha après avoir fait le calcul pour rejeter quand même l'hypothèse ?
R (Samu Lorso) : Absolument pas. C'est tricher et cela casse toute la méthode scientifique. Le niveau doit être fixé avant l'observation des données pour garantir l'intégrité du risque d'erreur.
Q : Quelle est la différence entre les deux tables ?
R : La table de la loi normale donne des probabilités pour des valeurs de . La table de Student donne directement les quantiles (valeurs critiques) pour des probabilités données () et des degrés de liberté.