Thème 1 : Analyse de l'information chiffrée
Objectifs du chapitre
Savoir organiser et croiser deux caractères (statistique bivariée).
Utiliser et analyser des données sous forme de tableaux d'effectifs, diagrammes et nuages de points.
Réaliser un ajustement affine pour modéliser une tendance et estimer des valeurs inconnues (interpolation et extrapolation).
I. Croisement de deux caractères qualitatifs
Lorsque l'on étudie simultanément deux caractères qualitatifs (ex. : genre et pratique d'un sport, ou groupe sanguin et facteur Rhesus) sur une même population, on regroupe les données dans un tableau croisé d'effectifs (ou tableau à double entrée).
1. Tableau croisé d'effectifs
Soit une population de N individus.
En ligne : les modalités du premier caractère.
En colonne : les modalités du second caractère.
Les cases centrales contiennent les effectifs conjoints (nombre d'individus présentant à la fois la modalité Ai et la modalité Bj).
La dernière ligne et la dernière colonne indiquent les effectifs marginaux (totaux par ligne ou par colonne).
Exemple : Enquête auprès de 200 personnes sur le mode de transport principal selon la tranche d'âge.
Tranche d'âge / Transport Transport en commun (T) Véhicule individuel (V) Total marginal
Jeunes (J) 70 30 100
Adultes (A) 40 60 100
Total marginal 110 90 200
2. Représentations graphiques
Pour visualiser la répartition croisée de deux caractères qualitatifs, on utilise principalement :
Les diagrammes en barres empilées ou juxtaposées : permettent de comparer visuellement les fréquences ou effectifs de chaque groupe.
Les diagrammes circulaires comparatifs.
II. Croisement de deux caractères quantitatifs
Lorsque l'on mesure deux caractères numériques (ex. : taille et poids, ou température et consommation d'énergie), la série statistique est constituée de couples de valeurs (xi;yi).
1. Nuage de points
Dans un repère orthogonal, la représentation de l'ensemble des points Mi(xi;yi) constitue un nuage de points.
Source : Shutterstock
Explorer
Interprétation : Si le nuage présente une forme allongée dans une direction particulière, il existe une corrélation (une relation) entre les deux variables X et Y.
2. Point moyen G
Le point moyen du nuage, noté G, a pour coordonnées (xˉ;yˉ) où :
xˉ est la moyenne des valeurs xi :
xˉ=nx1+x2+⋯+xn
yˉ est la moyenne des valeurs yi :
yˉ=ny1+y2+⋯+yn
Propriété essentielle : Le point moyen G(xˉ;yˉ) appartient toujours à la droite d'ajustement affine.
III. Ajustement affine, Interpolation et Extrapolation
Lorsque le nuage de points a une forme approximativement rectiligne, on peut chercher à modéliser la relation entre X et Y par une droite, appelée droite d'ajustement affine.
1. Équation de la droite d'ajustement
La droite d'ajustement affine a pour équation réduite :
y=ax+b
a est le coefficient directeur (la pente).
b est l'ordonnée à l'origine.
Cette droite passe par le point moyen G(xˉ;yˉ), ce qui permet de vérifier l'égalité :
yˉ=axˉ+b⟹b=yˉ−axˉ
2. Méthodes d'obtention de la droite
(Au programme de Première, aucune théorie approfondie sur les algorithmes n'est exigée).
Au jugé : On trace à la règle une droite qui « passe au mieux » au milieu du nuage tout en passant obligatoirement par le point moyen G.
Par calculatrice / Tableur (Méthode des moindres carrés) : Le logiciel ou la calculatrice donne automatiquement le coefficient directeur a et l'ordonnée à l'origine b.
3. Exploitation du modèle : Interpolation et Extrapolation
Une fois l'équation y=ax+b établie, elle permet d'effectuer des prévisions :
A. Interpolation
Définition : C'est l'estimation d'une valeur de y pour une valeur de x située à l'intérieur de l'intervalle des données observées.
Fiabilité : Élevée, car basée sur la zone où les données sont connues.
B. Extrapolation
Définition : C'est l'estimation d'une valeur de y pour une valeur de x située en dehors de l'intervalle des données observées (ex. : faire une prévision dans le futur).
Fiabilité : Prudence nécessaire ! L'extrapolation suppose que la tendance linéaire observée reste valable dans le futur ou hors de la plage mesurée.
IV. Exercice d'application résolu
Énoncé
On étudie l'évolution des émissions de CO₂ d'une entreprise (en tonnes) selon le rang de l'année xi (x1=1 pour l'année 2020).
Rang de l'année (xi) 1 (2020) 2 (2021) 3 (2022) 4 (2023) 5 (2024)
Émissions de CO₂ (yi) 120 112 105 98 90
Calculer les coordonnées du point moyen G.
L'ajustement affine donné par le tableur est : y=−7,4x+127,2. Vérifier que le point moyen G appartient à cette droite.
Interpolation : Estimer les émissions de CO₂ au milieu de l'année 2022 (x=3,5).
Extrapolation : Selon ce modèle, estimer les émissions de CO₂ pour l'année 2030 (x=11).
Correction détaillée
Calcul des coordonnées du point moyen G(xˉ;yˉ) :
xˉ=51+2+3+4+5=515=3
yˉ=5120+112+105+98+90=5525=105
Donc G(3;105).
Vérification de l'appartenance de G à la droite y=−7,4x+127,2 :
Pour x=xˉ=3 :
−7,4×3+127,2=−22,2+127,2=105=yˉ
L'égalité est vérifiée, le point moyen G appartient bien à la droite d'ajustement.
Interpolation pour x=3,5 :
y=−7,4×3,5+127,2=−25,9+127,2=101,3
On estime qu'au milieu de l'année 2022, les émissions étaient de 101,3 tonnes.
Extrapolation pour l'année 2030 (x=11) :
y=−7,4×11+127,2=−81,4+127,2=45,8
Si la tendance se poursuit, les émissions prévues en 2030 seront d'environ 45,8 tonnes.