Stat-C10

Notes de Cours : Inférence Statistique, Intervalles de Confiance et Tests de Proportionnels sur les Proportions

Résultats de l’Examen de Mi-Session et Inférence Statistique

  • Statistiques de l’Examen :     * La moyenne générale obtenue par les étudiants est de 5.165.16.     * La médiane est fixée à 55, ce qui signifie que plus de 50%50\,\% des étudiants ont obtenu une note minimale de 55.     * Le premier quartile est également à 55, indiquant que 75%75\,\% de la cohorte a obtenu une note supérieure ou égale à 55.     * Taille de l’échantillon des étudiants (nn) : 327327 (corrigé de 328328).

  • Application du Théorème Central Limite (TCL) :     * L’utilisation du TCL permet de faire de l’inférence pour les cohortes futures.     * Scénario : Calcul de la probabilité que la moyenne des prochaines cohortes soit inférieure à 4.54.5, en supposant que la vraie moyenne de la population est de 5.165.16.     * Conclusion statistique : Cette probabilité est virtuellement égale à 00. Cela démontre la robustesse de l’inférence malgré le fait que la population initiale ne soit pas nécessairement distribuée normalement.

Distribution d'Échantillonnage des Proportions (p^\hat{p})

  • Nature de l'Estimateur :     * La proportion échantillonnale p^\hat{p} peut être considérée comme une moyenne de variables de Bernoulli.     * Les résultats de l’examen servent d’exemple : on définit p^\hat{p} comme la proportion d'étudiants ayant une note 5\ge 5.     * Valeur estimée basée sur les résultats actuels : p^=0.75\hat{p} = 0.75.

  • Exemple de Calcul de Probabilité avec Proportions :     * Objectif : Calculer la probabilité que, pour les prochaines cohortes, la proportion d'étudiants avec une note 5\ge 5 soit inférieure à 0.700.70.     * Données : n=327n = 327, p=0.75p = 0.75.     * Calcul de l'erreur standard (σp^\sigma_{\hat{p}}) :         σp^=p×(1p)n=0.75×0.253270.02\sigma_{\hat{p}} = \sqrt{\frac{p \times (1-p)}{n}} = \sqrt{\frac{0.75 \times 0.25}{327}} \approx 0.02     * Calcul du score ZZ pour une proportion cible de 0.700.70 :         z=0.700.750.02=2.5z = \frac{0.70 - 0.75}{0.02} = -2.5         (Note : L'enseignant mentionne par calculatrice une valeur proche de 2.09-2.09).     * Résultat : Selon la table de loi normale, cette probabilité est d'environ 1.8%1.8\,\%.     * Conclusion réciproque : Il existe environ 98.2%98.2\,\% de chances que la proportion d'étudiants atteignant une note de 55 reste supérieure à 70%70\,\% à l'avenir.

  • Impact de la Taille de l'Échantillon (nn) :     * Le facteur 1n\frac{1}{n} dans la formule de la variance indique que la variabilité de la distribution s'amenuise à mesure que nn augmente.     * Plus on dispose de données, plus l'estimation de p^\hat{p} est précise et l'incertitude réduite.

Étude de Cas : Élections Présidentielles Américaines 2020

  • Contexte Théorique :     * On s'intéresse à la véritable proportion de votants pour Joe Biden.     * Chaque électeur est représenté par une variable aléatoire XiX_i (11 pour Biden, 00 pour Trump ou Indépendant).     * Modèle simplifié de population de N=1200N = 1200 individus :         * Pro-Biden : 616616 votants (51.3%51.3\,\%).         * Pro-Trump : 571571 votants.         * Indépendants : 2323 individus.     * La proportion réelle est p=0.513p = 0.513.

  • Échantillonnage et Fluctuations :     * L'estimateur p^=mn\hat{p} = \frac{m}{n} (où mm est le nombre de votes Biden dans l'échantillon nn) varie selon l'échantillon tiré.     * Exemple 1 : n=10,m=5p^=0.50n = 10, m = 5 \rightarrow \hat{p} = 0.50.     * Exemple 2 : n=40p^=0.45n = 40 \rightarrow \hat{p} = 0.45 (l'échantillon contient aléatoirement plus de partisans de Trump).     * Le TCL stipule que p^\hat{p} suit approximativement une loi normale centrée sur pp :         p^N(p,p(1p)n)\hat{p} \sim N(p, \frac{p(1-p)}{n})

Intervalles de Confiance (IC) pour une Proportion

  • Définition et Objectif :     * Un intervalle de confiance est une plage de valeurs qui contient la véritable proportion pp selon un niveau de confiance fixé.     * L'intervalle est aléatoire car il dépend de l'échantillon prélevé. La vraie valeur pp est fixe.

  • Formule de l'Intervalle de Confiance :     p^±z1α2×p^×(1p^)n\hat{p} \pm z_{1-\frac{\alpha}{2}} \times \sqrt{\frac{\hat{p} \times (1-\hat{p})}{n}}     * 1α1-\alpha : Niveau de confiance (ex: 95%95\,\%).     * α\alpha : Risque d'erreur ou niveau de signification.     * z1α2z_{1-\frac{\alpha}{2}} : Quantile de la loi normale centrée réduite (ex: 1.961.96 pour 95%95\,\%).

  • Calcul Illustratif :     * Soit un échantillon n=200n = 200 avec m=95m = 95 partisans Biden (p^=0.475\hat{p} = 0.475).     * Niveau de confiance choisi : 95%95\,\% (α=0.05\alpha = 0.05, donc 1α2=0.9751-\frac{\alpha}{2} = 0.975).     * Valeur critique : z0.9751.96z_{0.975} \approx 1.96.     * Borne Inférieure : 0.4751.96×0.475×0.5252000.4060.475 - 1.96 \times \sqrt{\frac{0.475 \times 0.525}{200}} \approx 0.406.     * Borne Supérieure : 0.475+1.96×0.475×0.5252000.5440.475 + 1.96 \times \sqrt{\frac{0.475 \times 0.525}{200}} \approx 0.544.     * Contrôle : La vraie valeur p=0.513p = 0.513 est bien incluse dans cet intervalle.

  • Propriétés des Niveaux de Confiance :     * Si on répète l’expérience 100100 fois, 9595 intervalles contiendront la vraie valeur pp et 55 ne la contiendront pas.     * Plus 1α1-\alpha est grand, plus l'intervalle est large. Un niveau de confiance de 100%100\,\% produit un intervalle [0,1][0, 1] qui n'apporte aucune information.     * Plus la taille de l'échantillon nn est grande, plus l'intervalle est étroit (réduction de l'incertitude).

Tests d'Hypothèses et P-valeur

  • Concepts Fondamentaux :     * Hypothèse Nulle (H0H_0) : Hypothèse que l'on souhaite tester (ex: p=0.50p = 0.50).     * Hypothèse Alternative (H1H_1) : Hypothèse complémentaire à H0H_0 (ex: p0.50p \neq 0.50 pour un test bilatéral).

  • La P-valeur :     * C'est une mesure de la plausibilité de H0H_0 au regard des données observées.     * Plus la p-valeur est petite, plus la contradiction entre H0H_0 et les données est forte.     * Si la p-valeur est inférieure au niveau de signification (généralement α=0.05\alpha = 0.05), on rejette H0H_0.

  • Calcul du Z observé :     zobs=p^p0p0×(1p0)nz_{obs} = \frac{\hat{p} - p_0}{\sqrt{\frac{p_0 \times (1-p_0)}{n}}}     * p0p_0 est la valeur testée sous l'hypothèse nulle.     * Types de tests :         * Bilatéral : H1:pp0H_1 : p \neq p_0.         * Unilatéral : H_1 : p > p_0 ou p < p_0.

  • Démonstration par l'Animation :     * Avec un faible nombre de données (échantillon de 10%10\,\% de la population), la p-valeur est élevée (ex: 40%40\,\%), donc on ne peut rien conclure.     * À mesure que nn augmente, si la vraie valeur est différente de p0p_0, la p-valeur chute.     * Dès que la p-valeur est < 5\,\%, on peut rejeter H0H_0 en faveur de H1H_1.

Questions & Discussion

  • À quoi sert précisément l'intervalle de confiance ?     * C'est une mesure d'incertitude qui fournit une plage de valeurs plausibles pour le paramètre inconnu de la population.

  • Choix du niveau de confiance :     * Le choix entre 95%95\,\%, 90%90\,\% ou 80%80\,\% est souvent imposé par les normes du domaine d'étude ou les commanditaires de l'étude statistique. 95%95\,\% est la norme conventionnelle.

  • Interprétation du risque :     * L'inférence statistique comporte toujours un risque d'erreur quantifiable. On ne parle jamais de certitude absolue, mais de probabilités de capture de la valeur réelle.

  • Annonce Enseignement :     * Le prochain cours sera assuré par Samuel Orsault.     * Sujets à venir : Généralisation des tests d'hypothèses aux moyennes.     * Disponibilité des enregistrements : Mise en ligne sur Médiaserveur dès que possible.