Stat-C10
Notes de Cours : Inférence Statistique, Intervalles de Confiance et Tests de Proportionnels sur les Proportions
Résultats de l’Examen de Mi-Session et Inférence Statistique
Statistiques de l’Examen : * La moyenne générale obtenue par les étudiants est de . * La médiane est fixée à , ce qui signifie que plus de des étudiants ont obtenu une note minimale de . * Le premier quartile est également à , indiquant que de la cohorte a obtenu une note supérieure ou égale à . * Taille de l’échantillon des étudiants () : (corrigé de ).
Application du Théorème Central Limite (TCL) : * L’utilisation du TCL permet de faire de l’inférence pour les cohortes futures. * Scénario : Calcul de la probabilité que la moyenne des prochaines cohortes soit inférieure à , en supposant que la vraie moyenne de la population est de . * Conclusion statistique : Cette probabilité est virtuellement égale à . Cela démontre la robustesse de l’inférence malgré le fait que la population initiale ne soit pas nécessairement distribuée normalement.
Distribution d'Échantillonnage des Proportions ()
Nature de l'Estimateur : * La proportion échantillonnale peut être considérée comme une moyenne de variables de Bernoulli. * Les résultats de l’examen servent d’exemple : on définit comme la proportion d'étudiants ayant une note . * Valeur estimée basée sur les résultats actuels : .
Exemple de Calcul de Probabilité avec Proportions : * Objectif : Calculer la probabilité que, pour les prochaines cohortes, la proportion d'étudiants avec une note soit inférieure à . * Données : , . * Calcul de l'erreur standard () : * Calcul du score pour une proportion cible de : (Note : L'enseignant mentionne par calculatrice une valeur proche de ). * Résultat : Selon la table de loi normale, cette probabilité est d'environ . * Conclusion réciproque : Il existe environ de chances que la proportion d'étudiants atteignant une note de reste supérieure à à l'avenir.
Impact de la Taille de l'Échantillon () : * Le facteur dans la formule de la variance indique que la variabilité de la distribution s'amenuise à mesure que augmente. * Plus on dispose de données, plus l'estimation de est précise et l'incertitude réduite.
Étude de Cas : Élections Présidentielles Américaines 2020
Contexte Théorique : * On s'intéresse à la véritable proportion de votants pour Joe Biden. * Chaque électeur est représenté par une variable aléatoire ( pour Biden, pour Trump ou Indépendant). * Modèle simplifié de population de individus : * Pro-Biden : votants (). * Pro-Trump : votants. * Indépendants : individus. * La proportion réelle est .
Échantillonnage et Fluctuations : * L'estimateur (où est le nombre de votes Biden dans l'échantillon ) varie selon l'échantillon tiré. * Exemple 1 : . * Exemple 2 : (l'échantillon contient aléatoirement plus de partisans de Trump). * Le TCL stipule que suit approximativement une loi normale centrée sur :
Intervalles de Confiance (IC) pour une Proportion
Définition et Objectif : * Un intervalle de confiance est une plage de valeurs qui contient la véritable proportion selon un niveau de confiance fixé. * L'intervalle est aléatoire car il dépend de l'échantillon prélevé. La vraie valeur est fixe.
Formule de l'Intervalle de Confiance : * : Niveau de confiance (ex: ). * : Risque d'erreur ou niveau de signification. * : Quantile de la loi normale centrée réduite (ex: pour ).
Calcul Illustratif : * Soit un échantillon avec partisans Biden (). * Niveau de confiance choisi : (, donc ). * Valeur critique : . * Borne Inférieure : . * Borne Supérieure : . * Contrôle : La vraie valeur est bien incluse dans cet intervalle.
Propriétés des Niveaux de Confiance : * Si on répète l’expérience fois, intervalles contiendront la vraie valeur et ne la contiendront pas. * Plus est grand, plus l'intervalle est large. Un niveau de confiance de produit un intervalle qui n'apporte aucune information. * Plus la taille de l'échantillon est grande, plus l'intervalle est étroit (réduction de l'incertitude).
Tests d'Hypothèses et P-valeur
Concepts Fondamentaux : * Hypothèse Nulle () : Hypothèse que l'on souhaite tester (ex: ). * Hypothèse Alternative () : Hypothèse complémentaire à (ex: pour un test bilatéral).
La P-valeur : * C'est une mesure de la plausibilité de au regard des données observées. * Plus la p-valeur est petite, plus la contradiction entre et les données est forte. * Si la p-valeur est inférieure au niveau de signification (généralement ), on rejette .
Calcul du Z observé : * est la valeur testée sous l'hypothèse nulle. * Types de tests : * Bilatéral : . * Unilatéral : H_1 : p > p_0 ou p < p_0.
Démonstration par l'Animation : * Avec un faible nombre de données (échantillon de de la population), la p-valeur est élevée (ex: ), donc on ne peut rien conclure. * À mesure que augmente, si la vraie valeur est différente de , la p-valeur chute. * Dès que la p-valeur est < 5\,\%, on peut rejeter en faveur de .
Questions & Discussion
À quoi sert précisément l'intervalle de confiance ? * C'est une mesure d'incertitude qui fournit une plage de valeurs plausibles pour le paramètre inconnu de la population.
Choix du niveau de confiance : * Le choix entre , ou est souvent imposé par les normes du domaine d'étude ou les commanditaires de l'étude statistique. est la norme conventionnelle.
Interprétation du risque : * L'inférence statistique comporte toujours un risque d'erreur quantifiable. On ne parle jamais de certitude absolue, mais de probabilités de capture de la valeur réelle.
Annonce Enseignement : * Le prochain cours sera assuré par Samuel Orsault. * Sujets à venir : Généralisation des tests d'hypothèses aux moyennes. * Disponibilité des enregistrements : Mise en ligne sur Médiaserveur dès que possible.