2  Tests d’hypothèses par permutations

Auteur·rice
Affiliation

Frédéric Santos

CNRS, Univ. Bordeaux, MCC – UMR 5199 PACEA

2.1 Principe général d’un test d’hypothèses

2.1.1 Objectifs

Comme précédemment exposé, les données dont on dispose en pratique (un échantillon constitué de \(n\) individus) sont brouillées par des fluctuations d’échantillonnage. Si l’on cherche par exemple à savoir si la longueur moyenne du neurocrâne des hylochères mâles est plus élevée que la longueur moyenne du neurocrânne des hylochères femelles, on peut prendre 10 femelles d’un côté, 10 mâles de l’autre, et comparer les moyennes obtenues dans ces deux échantillons (respectivement notées \(m_F\) et \(m_M\)).

Après avoir effectué les mesures, on obtient \(m_F\) = 89 cm, et \(m_M\) = 93 cm. On peut alors se demander si la longueur moyenne dans la population complète des mâles est supérieure à la longueur moyenne dans la population complète des femelles. On se demande donc si la différence observée entre \(m_F\) et \(m_M\) relève d’un véritable dimorphisme sexuel à l’échelle de la population, et non d’un malheureux biais d’échantillonnage.

En effet, si l’on recommençait la procédure avec 10 nouveaux mâles et 10 nouvelles femelles on obtiendrait peut-être un résultat différent, voire contradictoire avec ces premières observations !

Choisir le notebook 02_simulations_dimorphisme.ipynb pour une illustration.

Ainsi, on souhaite disposer d’une procédure qui nous permettra d’évaluer, pour une taille donnée d’échantillon, les chances que la différence observée entre les femelles et les mâles puisse ne relever que des seules fluctuations d’échantillonnage entre deux populations par ailleurs parfaitement égales.

  • Si ces chances sont élevées, rien ne s’opposera alors à considérer que les deux populations sous-jacentes possèdent le même paramètre moyen pour le neurocrâne.
  • Si, au contraire, ces chances sont faibles, alors la différence observée n’est probablement pas un simple hasard : le dimorphisme sexuel est sans doute bien réel.

2.1.2 Heuristique des tests d’hypothèses

Un test statistique, au moins suivant la philosophie de Fisher, est destiné à évaluer si une hypothèse nulle semble crédible ou non. Plus exactement : semble-t-elle compatible avec les données recueillies dans notre échantillon ?

L’hypothèse nulle est généralement l’hypothèse d’identité ou d’égalité. Par exemple, si le but est de comparer les moyennes des mâles et des femelles, l’hypothèse nulle sera que ces moyennes sont égales, i.e. qu’il n’y a pas de dimorphisme sexuel : \(\mu_F = \mu_M\).

Cette hypothèse nulle joue donc un rôle particulier : le but du test est de réunir suffisamment de preuves au sein des données pour démontrer qu’elle est fausse. Si c’est le cas, l’hypothèse nulle est rejetée. Dans le cas contraire, on ne la rejette pas, et on conclut sobrement que les données ne sont pas incompatibles avec cette hypothèse.

Pour reprendre une analogie assez parlante issue de Daudin, Robin, et Vuillet (1999), l’hypothèse nulle bénéficie de la présomption d’innocence : elle ne sera “condamnée” (écartée) que si l’on a suffisamment de preuves contre elle. Sinon, le test la “relâchera faute de preuves”… ce qui ne veut pas pour autant dire qu’elle est vraie !

2.2 Tests d’hypothèses par permutations

Les tests d’hypothèses par permutations constituent une introduction intuitive à la théorie générale des tests. Il s’agit d’une méthode approchée, délivrant des résultats basés sur des procédures empiriques plutôt que de lourds calculs mathématiques. Pour une introduction détaillée, on pourra par exemple consulter Zieffler, Harring, et Long (2011).

2.2.1 Principe général

On peut considérer qu’un test d’hypothèses est assimilable à une forme de raisonnement par l’absurde. En effet, l’idée de départ est de supposer que l’hypothèse nulle est vraie, puis de raisonner logiquement et de voir si cela nous conduit à une contradiction ou à une situation totalement improbable.

Dans notre cas, supposer que l’hypothèse nulle est vraie revient à supposer qu’il n’y a aucun dimorphisme sexuel réel sur la mesure C3 : les différences observées ne relèvent que de fluctuations d’échantillonnage au sein de deux populations (femelles et mâles) strictement identiques. Si cette hypothèse est vraie, alors les femelles et les mâles sont essentiellement indistinguables pour la mesure C3, et le fait d’inverser les étiquettes “Femelle” et “Mâle” dans un échantillon d’hylochères ne devrait donc avoir aucune importance et aucun effet concret. C’est précisément ce que l’on va vérifier !

2.2.2 Algorithme d’un test d’hypothèses par permutations

  1. Formuler précisément l’hypothèse nulle. Nous l’avons déjà dit : l’hypothèse nulle stipule généralement qu’il n’y a pas de différence entre les groupes. Ici : “Il n’existe pas de différence moyenne pour C3 entre hylochères femelles et mâles.”
  2. Calcul de la statistique observée. On calcule la grandeur mathématique qui nous intéresse sur les données réellement observées. Ici : on calcule la différence \(m_M - m_F\) entre les moyennes des mâles et des femelles sur les données observées.
  3. Génération des permutations. On génère informatiquement un assez grand nombre (par exemple \(B = 1000\)) de jeux de données “permutées”. Cela se fait en ré-attribuant aléatoirement un sexe à chaque individu, tout en conservant les tailles initiales des deux groupes.
  4. Calcul de la statistique pour chaque permutation. Pour chacune des \(B\) permutations générées, on calcule la même grandeur mathématique que celle obtenue sur les données réelles. Cela génère une distribution de cette grandeur sous l’hypothèse nulle (c’est-à-dire sous l’hypothèse que les groupes sont similaires et qu’il n’y a pas d’effet du sexe). Ici : on recalcule la différence entre les moyennes des mâles et des femelles sur chaque jeu de données permutées.
  5. Calculer la p-valeur empirique. Déterminer la proportion de permutations où la statistique obtenue est au moins aussi extrême que celle observée dans les données réelles. On appelle p-valeur empirique cette proportion.
  6. Conclure. Si cette p-valeur empirique est “faible” (on considère souvent que “faible” veut dire inférieur à 0.05, pour des raisons historiques), on rejette l’hypothèse nulle. En effet, l’expérience a alors montré qu’on n’obtient que très rarement des différences entre mâles et femelles aussi importantes que celle qui a réellement été observée : le hasard d’échantillonnage seul ne peut donc pas réussir à expliquer cette différence.

2.3 Intérêt des tests d’hypothèses par permutations

Un test par permutations repose sur la réorganisation aléatoire des données pour simuler la distribution sous l’hypothèse nulle. Puisque c’est une méthode empirique et approchée, quel est son intérêt alors même qu’il existe des méthodes théoriques et exactes ?

Une réponse courte : il s’agit d’une une manière flexible et robuste de tester des hypothèses, sans formuler de prérequis trop rigides sur la distribution des données. Les tests d’hypothèses “classiques”, que l’on verra dans la section suivante, ont généralement des conditions d’application assez strictes, qui seront souvent difficiles à remplir en sciences archéologiques.

2.4 Un exemple

Choisir le notebook 03-tests-permutations.ipynb pour une illustration.

2.5 Focus sur l’interprétation des p-valeurs

De nombreuses excellentes références (Altman et Bland 1995; Bourque, Blais, et Larose 2009; Zieffler, Harring, et Long 2011; Colquhoun 2017; Smith 2018) vous permettront de donner des interprétations correctes de vos p-valeurs, et vous éviteront d’écrire vos conclusions en utilisant des formulations fautives.

En résumé éclair, gardez à l’esprit que :

  • Vous pouvez traiter la p-valeur comme un niveau de preuve contre l’hypothèse nulle, basé sur les données de l’échantillon.
  • Vous devez si possible considérer la p-valeur le long d’une échelle continue allant de 0 à 1, et éviter les formulations trop dichotomiques basées sur seuil arbitraire (généralement 0.05).
  • Une p-valeur seule n’est pas toujours suffisante pour prouver un résultat scientifique, et pas souvent informative pour présenter ledit résultat. Accompagnez vos p-valeurs de statistiques descriptives plus parlantes, plus interprétables, et de graphiques !