[Musique] dans cette vidéo nous allons revoir avec Pascal deux notions incontournables en statistique descriptive et inférentielle celle d'estimation et d'estimateur nous allons les retrouver dans les tests d'hypothèse la construction d'intervalle de confiance ou bien encore l'analyse multiv alors autant bien comprendre de quoi il s'agit Pascal pouvez-vous nous rappeler ce que l'on appelle estimation et nous expliquer la différence entre estimateur et estimation la notion d'estimation rebutee souvent les étudiants elle est pourtant très simple à comprendre en ce sens qu'elle ne fait que formaliser le contexte d'échantillonnage auquel nous sommes confrontés pour expliquer en quoi consiste l'estimation
je vais utiliser un système de notation précis et m'appuyer sur des exemples concrets qui vont vous permettre de bien maîtriser ce processus il vous faudra faire attention aux notations qui vont être employées commençons par définir une population caractérisée par deux paramètres exacts MU et Sigma respectivement moyenne et écarttible de la distribution d'une variable aléatoire d'étude grand x définie dans la population nous pouvons nous intéresser au tirage avec remise d'un échantillon de taille n tiré au hasard la population donc dit représentatif de la population que nous nommerons échantillon 1 dont les valeurs petit X sont identifiés
par un exposant portant le numéro de l'échantillon ici 1 et par un indice i désignant l'individu nous pouvons calculer une moyenne observée d également moyenne empirique que nous nommerons petit x bar indice 1 l'indice 1 spécifiant ici qu'il s'agit de la moyenne des valeurs observé pour l'échantillon 1 la moyenne peti x bar 1 est une estimation de la moyenne de la population calculée à partir d'un seul échantillon elle constitue ce que l'on appelle une estimation ponctuelle de la moyenne MU et nous pourrons également la représenter à l'aide de la notation mu chapeau 1 le caractère
chapeau spécifiant que nous n'obtenons pas une valeur exacte de la moyenne de la population mais une estimation de cette moyenne on peut aisément comprendre que si Lesch on est tiré au hasard et de taille suffisante mu chapoin ne sera pas très éloigné de la valeur de la moyenne exacte mu dans la population notez bien les codes couleur utilisés rouge pour ce qui concerne la population bleu pour ce qui se rapporte à l'échantillon mais également les lettres minuscules réservé aux observations ou aux estimations les lettres majuscules pour désigner les variables aléatoires et enfin les lettres grecques
employées pour symboliser les paramètres exacts dans la population moyenne et écarttype exact si nous poursuivons l'exploration de l'échantillonnage nous pouvons de la même façon nous intéresser au tirage d'un deuxème échantillon de taille n dont les valeurs petit XI 2 sont identifiées par un exposant portant le numéro de l'échantillon ici 2 l'indice i désignant le rang l'observation nous avons donc ici une nouvelle série de N valeurs qui vont de X1 2 jus xn2 nous pouvons calculer une nouvelle moyenne pour les observations dans ce deuxème échantillon que nous désignerons par petit x bar indice 2 ou encore
mu chapeau 2 constituant une estimation ponctuelle de MU qui ne sera statistiquement pas éloigné de la moyenne exacte mu nous pouvons en fait tirer avec remise un très grand nombre pour ne pas dire une infinité d'échantillons aléatoirees de taille n de cette population notons petit X1 k petit x2k jusqu'à petit xnk le dernier échantillon que nous pouvons tirer petit x désignant la valeur prise par la grandeur grand X pour l'individu i dans le K et dernier échantillon alors faisons maintenant le bilan de cet échantillonnage et intéressons-nous par exemple à la première valeur tirée dans chacun
des échantillons il apparaît sans peine que la variable grand X1 reflétant toutes les valeurs tirables en première position va pouvoir prendre l'ensemble des valeurs possibles pour la variable grand X de la même façon la variable aléatoire grand X2 représentant toutes les valeurs possibles de la deuxième valeur tirée dans l'ensemble des échantillons va pouvoir prendre l'ensemble des valeurs de la variable grand X et ainsi de suite jusqu'à la nè valeur observée dans les échantillons nous définissons ainsi n variable aléatoire grand X1 grand X2 jusqu'à grand xn 1 end et identiquement distribué de même loi que grand
x l'indépendance s'expliquant par le fait que le tirage s'effectue avec remise et donc que la valeur observée à une position donnée du tirage n'influe pas sur celle observée à une autre position la propriété indépendante et identiquement distribuée est souvent représentée par l'acronyme iid nous obtenons ainsi ce que l'on appelle n échantillon constitué de l'ensemble des variables aléatoires grand X1 grand X2 grand X6 jusqu'à grand xn l'échantillonnage résultant de tous les échantillons de taille n tirabl au hasard de la population est en quelque sorte résumé par ce n échantillon pour lequel chaque variable grand XI est
de même loi grand x nous pouvons définir sur ce n échantillon grand x bar n variable aléatoire égale à la somme des des i é= 1 à n des grand XI divis par N on démontre facilement que grand x̅ N constitue ce que l'on appelle un estimateur sans BIA de sa cible mu c'est-à-dire que l'espérance de grand x bar n vaut précisément mu de plus sa variance tend vers Z0 lorsque la taille de l'échantillon est grande si grand x ici en rouge est la variable d'étude définie dans la population l'estimateur grand x bar N en
bleu constitue quant à lui une variable dite d'échantillonnage rendant compte de l'ensemble des valeurs possibles prises par la moyenne empirique petite x bar ou mu chapeau dans des échantillons de taille n la loi de probabilité que suit grand x bar n dépendant du contexte tentons maintenant de simplifier la représentation de la situation en mettant à gauche et en rouge ce qui car caractérise la population MU et Sigma respectivement moyenne et écart type exact de la variable d'étude grand X et à droite et en bleu les données observées dans un échantillon tiré au hasard de cette
population constituant n valeurs qui vont de petit X1 à petit xn dont la moyenne observée est petit x bar ou encore mu chapeau il s'agit d'une estimation pctuelle de la moyenne exacte de la population c'est-à-dire calculer sur un seul échantillon par 1/ N somme des i é= 1 à n des petit XI notons que puisque nous nous intéressons à un échantillon quelconque nous n'avons plus besoin d'indiquer le numéro de l'échantillon en exposant grand x bar n en bleu ég à 1/ N somme des i é= 1 à n des grand XI défini sur le N
échantillon grand X1 jusqu'à grand xn et l'estimateur de MU il rend compte des fluctuations d'échantillonnage des moyennes mu chapeau que l'on ob ve sur l'ensemble des échantillons de taille n que l'on peut tirer de cette population pour terminer cette présentation nous désignerons d'une façon plus générale par thêta le paramètre exact caractérisant une population d'étude thta étant classiquement une moyenne une proportion ou bien encore une variance l'estimateur du paramètre exact thta sera noté grand tn la fonction qui le définit dépend de la cible estimée c'est-à-dire s'il s'agit d'une moyenne d'une variance ou encore d'une proportion exacte
grand en tant qu'estimateur rend compte des fluctuations de tête àchapeau dans l'ensemble des échantillons tirés au hasard de la population nous verrons que certains de ces estimateurs sont sans biais tandis que d'autres présentent un BIA qu'il faudra corriger pour pouvoir faire des statistiques inférentielles alors ça y est le mot est lâché dès que nous utilisons la notion d'estimateur nous rentrons dans l'univers des statistiques inférentielles nous verrons que ces estimateurs vont nous permettre de définir ce que l'on appelle des statistiques de test qui sont des variables aléatoires impliquées dans les études conduites en statistique inférentielle qu'il
s'agisse de construire un intervalle de fluctuation de tête à chapeau qui nous conduira à nous demander partant de la connaissance d'une population caractérisée par thêta à quels échantillons on peut s'attendre en encadrant les valeurs possibles de tête à chapeau ou qu'il s'agisse de réaliser un test d'hypothèse par exemple un test de conformité qui nous conduira à nous demander si la valeur de thêta chapeau observée dans un échantillon de taille n est conforme à la valeur exacte thêta attendue dans une population donnée en évaluant si les différences entre ces valeurs sont ou non significatives ou bien
encore qu'il s'agisse de construire un interval de confiance permettant de caractériser la population d'où pourrait provenir l'échantillon pour lequel on a observer thêta chapeau par un encadrement de la valeur du paramètre exact thêta pour résumer un paramètre exact caractérisant une variable d'étude définie dans une population peut être estimée par une valeur calculée dans un échantillon dont la taille n est considérée dans le processus les fluctuations de cette estimation ponctuell dans l'ensemble des échantillons possibles sont décrites par une variable aléatoire qui est l'estimateur du paramètre ciblé j'espère que cette vidéo aura satisfait votre curiosité et répondu
à vos questions sur le processus d'estimation en statistique