en cours


Analyse de l'information chiffrée

Statistique bivariée — Tronc commun (Première générale)

🎯 Objectifs du chapitre

  • Savoir organiser et croiser deux caractères (statistique bivariée).
  • Utiliser et analyser des données sous forme de tableaux d'effectifs, diagrammes et nuages de points.
  • Réaliser un ajustement affine pour modéliser une tendance et estimer des valeurs inconnues (interpolation et extrapolation).

I. Croisement de deux caractères qualitatifs

Lorsque l'on étudie simultanément deux caractères qualitatifs (ex. : genre et pratique d'un sport, ou groupe sanguin et facteur Rhésus) sur une même population, on regroupe les données dans un tableau croisé d'effectifs (ou tableau à double entrée).

1. Tableau croisé d'effectifs

Soit une population de N individus.

  • En ligne : les modalités du premier caractère.
  • En colonne : les modalités du second caractère.
  • Les cases centrales contiennent les effectifs conjoints (nombre d'individus présentant à la fois la modalité Ai et la modalité Bj).
  • La dernière ligne et la dernière colonne indiquent les effectifs marginaux (totaux par ligne ou par colonne).

Exemple :

Enquête auprès de 200 personnes sur le mode de transport principal selon la tranche d'âge.

Tranche d'âge / Transport Transport en commun (T) Véhicule individuel (V) Total marginal
Jeunes (J) 70 30 100
Adultes (A) 40 60 100
Total marginal 110 90 200

2. Représentations graphiques

Pour visualiser la répartition croisée de deux caractères qualitatifs, on utilise principalement :

  • Les diagrammes en barres empilées ou juxtaposées : permettent de comparer visuellement les fréquences ou effectifs de chaque groupe.
  • Les diagrammes circulaires comparatifs.

II. Croisement de deux caractères quantitatifs

Lorsque l'on mesure deux caractères numériques (ex. : taille et poids, ou température et consommation d'énergie), la série statistique est constituée de couples de valeurs (xi ; yi).

1. Nuage de points

Dans un repère orthogonal, la représentation de l'ensemble des points Mi(xi ; yi) constitue un nuage de points.

  • Interprétation : Si le nuage présente une forme allongée dans une direction particulière, il existe une corrélation (une relation) entre les deux variables X et Y.

2. Point moyen G

Le point moyen du nuage, noté G, a pour coordonnées (x̄ ; ȳ) où :

  • est la moyenne des valeurs xi :
    x̄ = (x1 + x2 + ⋯ + xn) / n
  • ȳ est la moyenne des valeurs yi :
    ȳ = (y1 + y2 + ⋯ + yn) / n

⭐ Propriété essentielle :

Le point moyen G(x̄ ; ȳ) appartient toujours à la droite d'ajustement affine.


III. Ajustement affine, Interpolation et Extrapolation

Lorsque le nuage de points a une forme approximativement rectiligne, on peut chercher à modéliser la relation entre X et Y par une droite, appelée droite d'ajustement affine.

1. Équation de la droite d'ajustement

La droite d'ajustement affine a pour équation réduite :

y = ax + b
  • a est le coefficient directeur (la pente).
  • b est l'ordonnée à l'origine.

Cette droite passe par le point moyen G(x̄ ; ȳ), ce qui permet de vérifier l'égalité :

ȳ = a·x̄ + b  ⟹  b = ȳ − a·x̄

2. Méthodes d'obtention de la droite

  • Au jugé : On trace à la règle une droite qui « passe au mieux » au milieu du nuage tout en passant obligatoirement par le point moyen G.
  • Par calculatrice / Tableur (Méthode des moindres carrés) : Le logiciel donne automatiquement le coefficient directeur a et l'ordonnée à l'origine b.

3. Exploitation du modèle : Interpolation et Extrapolation

🔍
Interpolation

Définition : Estimation d'une valeur de y pour une valeur de x située à l'intérieur de l'intervalle des données observées.

Fiabilité : ✅ Élevée

🔮
Extrapolation

Définition : Estimation d'une valeur de y pour une valeur de x située en dehors de l'intervalle des données observées.

Fiabilité : ⚠️ Prudence nécessaire ! La tendance peut ne pas se poursuivre.

Exemple d'exercice d'application

📝 Énoncé

On étudie l'évolution des émissions de CO₂ d'une entreprise (en tonnes) selon le rang de l'année xi (x1 = 1 pour l'année 2020).

Rang de l'année (xi) 1 (2020) 2 (2021) 3 (2022) 4 (2023) 5 (2024)
Émissions de CO₂ (yi) 120 112 105 98 90
  • 1. Calculer les coordonnées du point moyen G.
  • 2. L'ajustement affine donné par le tableur est : y = −7,4x + 127,2. Vérifier que le point moyen G appartient à cette droite.
  • 3. Interpolation : Estimer les émissions de CO₂ au milieu de l'année 2022 (x = 3,5).
  • 4. Extrapolation : Selon ce modèle, estimer les émissions de CO₂ pour l'année 2030 (x = 11).

✅ Correction détaillée

1. Calcul des coordonnées du point moyen G(x̄ ; ȳ) :

  • x̄ = (1 + 2 + 3 + 4 + 5) / 5 = 15 / 5 = 3
  • ȳ = (120 + 112 + 105 + 98 + 90) / 5 = 525 / 5 = 105
  • Donc G(3 ; 105)

2. Vérification de l'appartenance de G à la droite y = −7,4x + 127,2 :

  • Pour x = x̄ = 3 : −7,4 × 3 + 127,2 = −22,2 + 127,2 = 105 = ȳ
  • L'égalité est vérifiée, le point moyen G appartient bien à la droite d'ajustement.

3. Interpolation pour x = 3,5 :

  • y = −7,4 × 3,5 + 127,2 = −25,9 + 127,2 = 101,3
  • On estime qu'au milieu de l'année 2022, les émissions étaient de 101,3 tonnes.

4. Extrapolation pour l'année 2030 (x = 11) :

  • y = −7,4 × 11 + 127,2 = −81,4 + 127,2 = 45,8
  • Si la tendance se poursuit, les émissions prévues en 2030 seront d'environ 45,8 tonnes.