Lâentreprise VertiGo ne nous a pas uniquement fourni des donnĂ©es quantitatives Ă tester. Nous avons aussi des donnĂ©es qualitatives comme le type de voyage, la destination, la saison ou encore le mode de paiement.
Cette fois-ci June a besoin de savoir si la saison influence la destination choisie.
Ok, mais dâabord que cherche-t-on exactement Ă comprendre avec ce genre de tests ?
Lorsque vous testez l'indépendance entre deux variables, vous cherchez à déterminer si une relation existe entre elles. Comprendre ces relations peut révéler des schémas ou des tendances cachées dans vos données. Par exemple, savoir si le genre du voyageur influence les préférences de consommation permet d'adapter des stratégies marketing plus efficaces.
Les tests d'indépendance de variables, combinés au calcul de la valeur p, vous permettent de déterminer si deux variables sont indépendantes ou si elles présentent une association statistiquement significative. En vérifiant l'indépendance des variables, vous pouvez éviter des conclusions erronées basées sur des relations apparentes mais non réelles.
Comme pour les tests de corrélation, les résultats des tests d'indépendance fournissent des bases solides pour la prise de décisions. Dans le domaine de la santé, par exemple, déterminer si un traitement est associé à certains effets secondaires peut influencer les choix thérapeutiques et améliorer les protocoles de soins.
Les tests d'indépendance comme le test de Chi-2 (ou test du chi carré) et le test de Fisher sont spécifiquement conçus pour les données qualitatives car ils analysent les relations entre des catégories distinctes.
Le test exact de Fisher est utilisé pour déterminer s'il y a une association significative entre deux variables catégorielles (genre des clients et type de voyages).
LâhypothĂšse nulle est dâaffirmer quâil nây a pas dâassociation entre les deux variables catĂ©gorielles. Alors que lâhypothĂšse alternative est de dire quâil y a bien une association entre les deux variables catĂ©gorielles.
Les conditions d'application sont variées :
Les donnĂ©es doivent ĂȘtre qualitatives.
Les observations doivent ĂȘtre indĂ©pendantes. Chaque observation doit ĂȘtre unique et ne doit pas influencer les autres.
Il est utilisé principalement quand les données sont sous forme de tableaux de contingence 2x2 (il y a deux lignes et deux colonnes).
Les Ă©chantillons sont plutĂŽt de petites tailles.Â
Pour mener Ă bien ce test, vous avez besoin de connaĂźtre lâodds ratio. Il permet de comparer le rapport de probabilitĂ© quâun Ă©vĂ©nement se produise en prĂ©sence dâun facteur choisi avec celle que ce mĂȘme Ă©vĂ©nement se produise en l'absence de ce facteur.Â
Exemple: l'Ă©vĂ©nement = choisir la catĂ©gorie aventure, le facteur = lâindividu est une femme:
Si l'odds ratio est 1, le fait que lâindividu soit une femme nâa aucun impact sur le fait de choisir la catĂ©gorie aventure.
Si l'odds ratio est supĂ©rieur Ă 1, ĂȘtre une femme augmente la probabilitĂ© de choisir la catĂ©gorie aventure.
Si l'odds ratio est infĂ©rieur Ă 1, ĂȘtre une femme diminue la probabilitĂ© de choisir la catĂ©gorie aventure.
Autre exemple que VertiGo
Une association Ă©cologiste souhaite examiner les effets de la pollution sur la prĂ©sence dâoiseaux entre deux zones (une polluĂ©e et une non polluĂ©e).
Le test de Chi-2 est utilisĂ© pour dĂ©terminer si une distribution observĂ©e de donnĂ©es catĂ©gorielles diffĂšre d'une distribution attendue. Il compare les frĂ©quences observĂ©es dans diffĂ©rentes catĂ©gories Ă des frĂ©quences attendues si les variables Ă©taient indĂ©pendantes. Ce type de test pourrait ĂȘtre utilisĂ©, par exemple, pour comparer la saison et le type de voyages. On reprend nos hypothĂšses :
H0 : La saison de voyage est indépendante du type de voyage préféré.
H1 : La saison de voyage dépend du type de voyage préféré.
Pour ce test, vous avez besoin de connaßtre trois concepts clés :
La statistique ÏÂČ mesure la somme des carrĂ©s des Ă©carts entre les frĂ©quences observĂ©es et les frĂ©quences attendues, rapportĂ©e aux frĂ©quences attendues.
Le DegrĂ© de libertĂ© (df) est calculĂ© en fonction du nombre de catĂ©gories des variables Ă©tudiĂ©es. Par exemple, pour un tableau de contingence de đ lignes et đ colonnes, les degrĂ©s de libertĂ© sont .
La valeur p est utilisée pour décider si nous rejetons l'hypothÚse nulle H0
Les conditions d'application sont variées :
Les donnĂ©es doivent ĂȘtre qualitatives.
Les observations doivent ĂȘtre indĂ©pendantes.Â
Les Ă©chantillons doivent ĂȘtre suffisamment grands (chaque catĂ©gorie doit avoir une frĂ©quence thĂ©orique d'au moins 5).
Il est utilisĂ© principalement quand les donnĂ©es sont sous forme de tableaux de contingence (2x3, 3x3, etc.).Â
Autre exemple que VertiGo
Une entreprise de marketing souhaite savoir si le type de publicité (télévision, en ligne, imprimée) influence les préférences des consommateurs pour trois produits électroniques différents (smartphone, tablette, ordinateur portable).
Visualiser des tableaux de contingence en statistiques permet de mieux comprendre les relations entre les variables catégorielles et de faciliter l'interprétation des données. Nous pouvons le visualiser de plusieurs façons.
Le tableau de contingence brut est trÚs utile pour avoir une vue détaillée des données exactes. Voici un exemple de tableau 4x5 pour le test Chi-2. Celui-ci montrerait la relation entre la saison et le type de voyages sélectionnés par les clients de VertiGo.
 | Aventure | Culturel | Détente |
Printemps | 31 | 52 | 37 |
ĂtĂ© | 82 | 132 | 64 |
Automne | 39 | 61 | 42 |
Hiver | 80 | 119 | 58 |
Ce graphique permet de voir comment les fréquences sont distribuées entre les différentes catégories. Il facilite la comparaison des fréquences entre différentes catégories, permettant de repérer rapidement les différences marquantes.
Voici lâhistogramme liĂ© Ă notre test Chi-2.

Le heatmap utilise une Ă©chelle de couleurs pour reprĂ©senter les frĂ©quences, ce qui permet de voir rapidement les points chauds (zones de haute frĂ©quence) et les points froids (zones de basse frĂ©quence). Nous ne lâavons pas vu dans la partie prĂ©cĂ©dente mais câest aussi une forme de visualisation trĂšs courante.
Voici le heat map lié à notre test Chi-2.

En combinant ces différentes visualisations, on obtient une compréhension plus complÚte des relations entre les variables. Cela permet de confirmer des hypothÚses, de repérer des anomalies ou des tendances inattendues et d'améliorer la communication des résultats à travers des représentations visuelles claires et compréhensibles.
Comme pour les tests de normalitĂ© et de corrĂ©lation, la valeur p joue un rĂŽle crucial ici. Si votre test d'indĂ©pendance indique une association significative avec une valeur p infĂ©rieure Ă 0,05, vous pouvez ĂȘtre confiant dans vos rĂ©sultats et poursuivre dans cette direction ! En revanche, si la valeur p est supĂ©rieure Ă 0,05, l'association observĂ©e pourrait ĂȘtre due au hasard plutĂŽt qu'Ă une relation rĂ©elle entre les variables.
Cet arbre de décision récapitule la marche à suivre quand vous serez confronté à des variables qualitatives.

Votre mission est maintenant de sélectionner le bon test pour comparer des données qualitatives.
Ă partir de âDonnĂ©es clients VertiGo nettoyĂ©esâ, vous devez analyser si la saison influence la destination choisie par les clients. Les donnĂ©es sont suffisantes pour constituer un grand Ă©chantillon et les catĂ©gories sont nombreuses.
Déterminez quel test de relation entre Chi-2 ou Fisher est le plus adapté.
Justifiez votre choix en expliquant pourquoi ce test est le plus approprié compte tenu des conditions et des caractéristiques des données.
Rédigez un rapport justifiant votre choix.
Les tests d'indépendance, combinés au calcul de la valeur p, permettent de déterminer si les relations observées entre les variables sont statistiquement significatives ou dues au hasard.
Le test de Fisher est utilisé pour déterminer s'il y a une association significative entre deux variables catégorielles dans de petits échantillons, particuliÚrement avec des tableaux de contingence 2x2.
Le test de Chi-2 est utilisé pour comparer les fréquences observées et attendues dans des données catégorielles, nécessitant des échantillons suffisamment grands et des fréquences théoriques d'au moins 5 par catégorie.
Les tableaux de contingence permettent de visualiser les relations entre variables catégorielles et facilitent l'interprétation des données à travers des représentations claires et compréhensibles.
Vous connaissez les deux principaux tests pour identifier les potentielles corrélations entre les données quantitatives et les potentielles indépendances entre variables qualitatives. Voyons maintenant comment intégrer des approches pour des données mixtes.