Annexe B — Arbre de choix des méthodes

C Partir de la question, pas de la fonction

Cette annexe aide à orienter une analyse. Elle ne remplace ni la documentation de l’enquête ni l’examen des hypothèses.

C.1 Étape 1 — Quelle est la question ?

Voulez-vous...
│
├── décrire une seule variable ? ───────────────→ univarié
│
├── comparer / associer deux variables ? ──────→ bivarié
│
├── estimer une association ajustée ? ─────────→ régression
│
├── étudier des changements dans le temps ? ───→ longitudinal / panel
│
└── corriger la structure de l'échantillon ? ──→ poids / calibration

Avant toute branche :

  • quel est l’univers de la question ?
  • quelles valeurs sont manquantes ou « sans objet » ?
  • disposez-vous de poids, strates et grappes ?

C.2 Étape 2 — Décrire une variable

Variable
│
├── qualitative nominale
│   └── effectifs, proportions, mode
│
├── qualitative ordinale
│   └── proportions ordonnées, médiane de rang si pertinent,
│       distribution complète
│
└── quantitative
    ├── centre : moyenne, médiane
    ├── dispersion : écart-type, IQR, quantiles
    └── forme : histogramme, densité, boxplot

Avec design : svymean(), svyquantile(), svytable().

C.3 Étape 3 — Comparer deux variables

C.3.1 Qualitative × qualitative

Questions typiques : le sport régulier varie-t-il selon le diplôme ?

  • tableau croisé ;
  • pourcentages en ligne ou colonne selon le dénominateur substantiel ;
  • test d’indépendance ;
  • avec design : svytable() et svychisq().

C.3.2 Quantitative × qualitative

Question : la satisfaction moyenne diffère-t-elle selon le sexe ?

  • moyenne/médiane par groupe ;
  • boxplot ;
  • deux groupes : t-test / alternative non paramétrique ;
  • plusieurs groupes : comparaison globale / modèle ;
  • avec design : svyby(), svyttest().

C.3.3 Quantitative × quantitative

Question : âge et satisfaction covarient-ils ?

  • nuage de points ;
  • corrélation ;
  • régression si l’objectif est directionnel/ajusté.
AvertissementAssociation n’est pas causalité

La présence d’une association, même après ajustement, ne suffit pas à démontrer un effet causal.

C.4 Étape 4 — Choisir un modèle selon Y

Variable dépendante Y Modèle de départ Exemple
Continue Linéaire satisfaction 0–10
Binaire Logistique sport régulier oui/non
Ordinale ≥ 3 niveaux Logistique ordinale santé auto-évaluée
Nominale ≥ 3 catégories Multinomiale statut d’emploi
Comptage Poisson / quasi-Poisson / modèle adapté nombre de livres
Mesures répétées Effets fixes / mixtes / modèle longitudinal satisfaction à plusieurs vagues

Puis demander :

  1. les hypothèses du modèle sont-elles plausibles ?
  2. la taille des catégories est-elle suffisante ?
  3. faut-il tenir compte du plan de sondage ?
  4. les effets seront-ils plus lisibles en coefficients, ratios ou probabilités prédites ?

C.5 Étape 5 — Le design d’enquête

L'enquête a-t-elle des poids / strates / grappes ?
│
├── Non / échantillon aléatoire simple réellement défendable
│   └── méthodes usuelles
│
└── Oui
    ├── construire l'objet svydesign()
    ├── utiliser les versions svy* des estimateurs/tests
    └── utiliser svyglm()/svyolr() ou méthode compatible

Ne remplacez pas l’objet de design par :

lm(y ~ x, weights = poids)

sans justification. Un poids dans une fonction générale ne signifie pas nécessairement que la stratification et les grappes sont prises en compte.

C.6 Étape 6 — Les valeurs manquantes

Une valeur manque
│
├── question non applicable ?
│   └── absence structurelle → ne pas imputer comme une réponse
│
├── code NSP / refus ?
│   ├── préserver le sens
│   └── recoder en NA pour les calculs si approprié
│
└── vraie non-réponse sur variable applicable ?
    ├── faible et plausiblement ignorable → cas complets possible
    ├── non-réponse substantielle → diagnostiquer
    └── imputation multiple / sensibilité si justifié

C.7 Étape 7 — Dois-je pondérer ?

Trois questions différentes :

  1. Décrire l’échantillon tel qu’il est ? → non pondéré peut être pertinent.
  2. Estimer une caractéristique de la population cible ? → utiliser les poids adaptés.
  3. Estimer un modèle ? → dépend de la question, du plan et de l’approche d’inférence ; pour ce livre, les modèles de population issus d’enquêtes complexes sont généralement présentés via {survey}.

Toujours indiquer dans le texte si le résultat est brut ou pondéré.

C.8 Étape 8 — Quel dénominateur ?

C.8.1 Pourcentage ligne

Parmi les diplômés du supérieur, quelle proportion pratique régulièrement un sport ?

Dénominateur = diplômés du supérieur.

C.8.2 Pourcentage colonne

Parmi les personnes pratiquant régulièrement, quelle est la distribution des diplômes ?

Dénominateur = pratiquants réguliers.

Le logiciel ne choisit pas le dénominateur à votre place : la question substantielle le fait.

C.9 Étape 9 — Test ou intervalle de confiance ?

Si la question principale est :

« Quelle est la proportion ? »

un estimateur et son intervalle de confiance sont centraux.

Si la question est :

« Les distributions diffèrent-elles ? »

un test peut compléter l’estimation.

Évitez de réduire une analyse à la seule question « p < 0,05 ? ».

C.10 Étape 10 — Modèle ou simple comparaison ?

Utilisez un modèle lorsque vous avez besoin de :

  • quantifier une relation continue ;
  • ajuster sur plusieurs variables ;
  • tester une interaction ;
  • produire des prédictions ;
  • représenter une structure longitudinale ou hiérarchique.

N’utilisez pas un modèle complexe uniquement parce qu’il est disponible.

C.11 Tableau de synthèse

Question Variable(s) Outil descriptif Outil d’inférence / modèle avec design
Proportion d’une modalité Qualitative svymean() sur indicatrice svyciprop()
Distribution Qualitative svytable() IC / tests selon question
Moyenne Quantitative svymean() confint()
Médiane / quantiles Quantitative svyquantile() IC de quantiles
Tableau croisé Quali × quali svytable() svychisq()
Moyenne par groupe Quant × quali svyby() svyttest() / svyglm()
Y continu ajusté Plusieurs X svyglm() gaussien
Y binaire ajusté Plusieurs X svyglm(..., quasibinomial())
Y ordinal Plusieurs X svyolr()
Y comptage Plusieurs X svyglm(..., quasipoisson())
Panel individu × temps trajectoires / transitions plm(), lmer() + réflexion sur poids

C.12 Cinq arrêts obligatoires

Avant de cliquer sur Render ou d’envoyer une table :

  1. Univers — qui est réellement dans le dénominateur ?
  2. Codage — les codes spéciaux ont-ils été traités ?
  3. Design — le plan de sondage est-il respecté ?
  4. Incertitude — un IC ou une mesure de précision est-il nécessaire ?
  5. Conclusion — le texte affirme-t-il davantage que ce que le plan et les données permettent ?