STAT-C11

Cours de Statistique - Semaine 11 : Intervalles de Confiance et Tests pour la Moyenne

Présentation Initiale : SDSA et Projets Étudiants

  • Collaboration SDSA (Swiss Diplomacy Student Association) :     * Une association qui promeut et démocratise la diplomatie pour les étudiants.     * Lancement d'un podcast en collaboration avec diverses entités (Suisse Presse Club, étudiants de deuxième année du BAR-I dans le cadre du cours gestion de projet).     * Le premier épisode traite de la droite en Suisse et en Europe, avec la participation du professeur Scarini.     * Disponibilité : YouTube et Spotify via le compte Instagram de la SDSA.     * Futurs épisodes prévus avec l'AESPRI, incluant des formats de micro-trottoirs.

  • Conférence Annoncée :     * Sujet : Pourquoi y a-t-il de plus en plus de femmes à la tête des partis de droite ?     * Lieu : Domaine du Club Suisse et la Presse.     * Date/Heure : Demain soir à 18h00 (6 heures).

Introduction au Cours et Calendrier Académique

  • Intervenant : Samu Lorso assure les deux prochains cours (Semaines 11 et 12).

  • Programme :     * Semaine 11 (Aujourd'hui) : Intervalles de confiance pour la moyenne et tests d'hypothèses à un échantillon (test zz et test tt).     * Semaine 12 : Tests à deux échantillons.     * Semaine 13 : Examen à blanc interactif.         * Durée prévue : 80minutes80\,\text{minutes}.         * Format : PDF à disposition sur le site (prévoir PC ou tablette).         * Objectif : S'acclimater pour l'examen final prévu le 20 mai.

Fondements de l'Inférence Statistique

  • Problème Central : En pratique, on n'a presque jamais accès à la population totale. On travaille donc sur un échantillon pour estimer des paramètres de population.

  • Paramètres vs Statistiques :     * Population : Paramètre inconnu (ex: l'espérance μ\mu).     * Échantillon : Statistique calculée (ex: la moyenne d'échantillon xˉ\bar{x}).

  • De l'Estimation Ponctuelle à l'Intervalle :     * L'estimation ponctuelle (un seul point) est jugée insuffisante car elle ne garantit pas la précision par rapport à la réalité.     * L'intervalle de confiance (IC) fournit une plage de valeurs (deux points) pour situer le paramètre avec un certain niveau de confiance.

Intervalles de Confiance (IC) pour la Moyenne

  • Définitions Clés :     * Niveau de confiance : Probabilité que la méthode génère un intervalle contenant la vraie valeur du paramètre sur le long terme (ex: 95%95\,\%).     * Niveau de signification (α\alpha) : Le risque d'erreur, défini par α=1niveau de confiance\alpha = 1 - \text{niveau de confiance}. Pour un IC à 95%95\,\%, α=5%\alpha = 5\,\%.

  • Interprétation Rigoureuse :     * Il est faux de dire qu'il y a 95%95\,\% de chances que la vraie valeur soit dans un intervalle spécifique calculé.     * La réalité est binaire : soit la valeur est dedans, soit elle n'y est pas.     * L'interprétation correcte est fréquentiste : si l'on répétait l'expérience indéfiniment, 95%95\,\% des intervalles construits contiendraient la vraie valeur μ\mu.

  • Formule de l'IC (Écart-type σ\sigma connu) :     * xˉ±z1α/2×σn\bar{x} \pm z_{1-\alpha/2} \times \frac{\sigma}{\sqrt{n}}     * z1α/2z_{1-\alpha/2} est le quantile de la loi normale standard.     * σ\sigma est l'écart-type de la population.     * nn est la taille de l'échantillon.

Cas Pratique 1 : Âge des Véhicules

  • Données :     * n=30n = 30 adultes.     * xˉ=5.6ans\bar{x} = 5.6\,\text{ans}.     * σ=0.8ans\sigma = 0.8\,\text{ans} (supposé connu).

  • Objectif : IC à 90%90\,\%.     * 1. α=10%\alpha = 10\,\% (donc 0.10.1).     * 2. α/2=0.05\alpha/2 = 0.05.     * 3. Quantile à chercher dans la table normale : 10.05=0.951 - 0.05 = 0.95.     * 4. Lecture table : Entre 1.641.64 (0.94950.9495) et 1.651.65 (0.95050.9505). On choisit d'être généreux avec z=1.65z = 1.65.

  • Calcul final : 5.6±1.65×0.8305.6 \pm 1.65 \times \frac{0.8}{\sqrt{30}} donne un intervalle de [5.36;5.84][5.36 ; 5.84].

Détermination de la Taille de l'Échantillon (nn)

  • Marge d'erreur (EE) : Définie comme la valeur que l'on ajoute ou soustrait à la moyenne dans l'IC.     * E=z1α/2×σnE = z_{1-\alpha/2} \times \frac{\sigma}{\sqrt{n}}

  • Formule pour nn : En inversant l'équation de la marge d'erreur, on obtient :     * n=(z1α/2×σE)2n = \left( \frac{z_{1-\alpha/2} \times \sigma}{E} \right)^2

  • Exemple : Étude de l'âge moyen des étudiants d'une université     * Données : σ=3ans\sigma = 3\,\text{ans}, Confiance = 99%99\,\% (α=0.01\alpha=0.01), E=1E = 1.     * Quantile z10.01/2=z0.9952.58z_{1-0.01/2} = z_{0.995} \approx 2.58.     * Calcul : n=(2.58×31)2=(7.74)2=59.9076n = \left( \frac{2.58 \times 3}{1} \right)^2 = (7.74)^2 = 59.9076.     * Décision : On arrondit toujours vers le haut, donc n=60n = 60.

La Loi de Student (tt) : Quand σ\sigma est Inconnu

  • Contexte : En réalité, on ne connaît pas σ\sigma. On utilise l'écart-type de l'échantillon (ss).

  • Deux Scénarios :     1. Grand échantillon (n > 30) : On peut approximer avec la loi normale (zz) en remplaçant σ\sigma par ss.     2. Petit échantillon (n30n \leq 30) : On doit utiliser la Loi de Student.

  • Caractéristiques de la Loi de Student :     * Symétrique, centrée en 00, plus aplatie que la normale (plus de probabilité dans les queues/extrêmes).     * Définie par ses degrés de liberté (ddl=n1ddl = n - 1).     * Plus nn augmente, plus la loi de Student converge vers la loi normale.

  • Note Historique : Développée par William Gosset (pseudonyme "Student") travaillant pour la brasserie Guinness au 19ème siècle.

  • Formule de l'IC avec Student :     * xˉ±tn1,1α/2×sn\bar{x} \pm t_{n-1, 1-\alpha/2} \times \frac{s}{\sqrt{n}}

Tests d'Hypothèses : Principes et Mécanismes

  • Structure du Test :     * Hypothèse Nulle (H0H_0) : L'hypothèse de base, souvent une égalité (μ=μ0\mu = \mu_0). On cherche à voir si les données permettent de la rejeter.     * Hypothèse Alternative (HaH_a) : Ce que l'on accepte si H0H_0 est rejetée.

  • Types d'Orientation :     * Bilatéral : Ha:μμ0H_a: \mu \neq \mu_0.     * Unilatéral : H_a: \mu > \mu_0 ou H_a: \mu < \mu_0.

  • Le Concept de P-valeur (P-value) :     * Définit la probabilité d'obtenir une statistique de test au moins aussi extrême que celle observée, en supposant que H0H_0 est vraie.     * Règle de décision : Si p-valeurαp\text{-valeur} \leq \alpha, on rejette H0H_0 (test significatif).

  • Calcul de la Statistique de Test (zz) :     * z=xˉμ0σ/nz = \frac{\bar{x} - \mu_0}{\sigma / \sqrt{n}} (sous H0H_0).

Exemples de Tests d'Hypothèses

  • Exemple 1 : Taille des étudiants du BAR-I     * H0:μ=1.75mH_0 : \mu = 1.75\,\text{m} ; Ha:μ1.75mH_a : \mu \neq 1.75\,\text{m}.     * Données : n=20n = 20, xˉ=1.83m\bar{x} = 1.83\,\text{m}, σ=0.4\sigma = 0.4.     * Statistique z=0.89z = 0.89.     * p\text{-valeur} = 2 \times P(Z > 0.89) = 2 \times (1 - 0.8133) = 0.3734 (37%37\,\%).     * Conclusion : Comme 37\,\% > 5\,\% , on ne peut pas rejeter H0H_0. L'évidence est insuffisante.

  • Exemple 2 : Régime alimentaire     * Variable : Différence de poids (poidsfinalpoidsinitialpoids_{final} - poids_{initial}).     * H0:μ=0H_0 : \mu = 0. H_a : \mu < 0 (perte de poids).     * Données : n=40n = 40, xˉ=0.4kg\bar{x} = -0.4\,\text{kg}, ss calculé sur l'échantillon.     * Résultat : p-valeur=0.0057p\text{-valeur} = 0.0057 (0.57%0.57\,\%).     * Conclusion : Puisque 0.57\,\% < 5\,\% , on rejette H0H_0. Le régime est jugé efficace.

Approche par Valeurs Critiques (Loi de Student)

  • Difficulté du calcul de $p$-valeur : Sans logiciel, calculer la $p$-valeur exacte avec Student est difficile.

  • Alternative : Utiliser la table de Student pour trouver une "valeur critique".

  • Méthode :     * On définit une région de rejet au-delà d'un quantile critique.     * Si la statistique observée est plus extrême que la valeur critique, on rejette H0H_0.

  • Dernier Exemple du Cours (Âge BAR-I) :     * H0:μ=18H_0: \mu = 18. H_a: \mu > 18.     * Données : n=20n = 20, xˉ=21.46\bar{x} = 21.46, s=2.91s = 2.91.     * Statistique tobs=5.26t_{obs} = 5.26.     * On doit comparer ce 5.265.26 au quantile critique de la table de Student à 19degreˊs de liberteˊ19\,\text{degrés de liberté} (n1n-1).

Questions & Discussion

  • Q : Peut-on changer le alpha après avoir fait le calcul pour rejeter quand même l'hypothèse ?

  • R (Samu Lorso) : Absolument pas. C'est tricher et cela casse toute la méthode scientifique. Le niveau α\alpha doit être fixé avant l'observation des données pour garantir l'intégrité du risque d'erreur.

  • Q : Quelle est la différence entre les deux tables ?

  • R : La table de la loi normale donne des probabilités pour des valeurs de zz. La table de Student donne directement les quantiles (valeurs critiques) pour des probabilités données (α\alpha) et des degrés de liberté.