Annexe B — Arbre de choix des méthodes
C Partir de la question, pas de la fonction
Cette annexe aide à orienter une analyse. Elle ne remplace ni la documentation de l’enquête ni l’examen des hypothèses.
C.1 Étape 1 — Quelle est la question ?
Voulez-vous...
│
├── décrire une seule variable ? ───────────────→ univarié
│
├── comparer / associer deux variables ? ──────→ bivarié
│
├── estimer une association ajustée ? ─────────→ régression
│
├── étudier des changements dans le temps ? ───→ longitudinal / panel
│
└── corriger la structure de l'échantillon ? ──→ poids / calibration
Avant toute branche :
- quel est l’univers de la question ?
- quelles valeurs sont manquantes ou « sans objet » ?
- disposez-vous de poids, strates et grappes ?
C.2 Étape 2 — Décrire une variable
Variable
│
├── qualitative nominale
│ └── effectifs, proportions, mode
│
├── qualitative ordinale
│ └── proportions ordonnées, médiane de rang si pertinent,
│ distribution complète
│
└── quantitative
├── centre : moyenne, médiane
├── dispersion : écart-type, IQR, quantiles
└── forme : histogramme, densité, boxplot
Avec design : svymean(), svyquantile(), svytable().
C.3 Étape 3 — Comparer deux variables
C.3.1 Qualitative × qualitative
Questions typiques : le sport régulier varie-t-il selon le diplôme ?
- tableau croisé ;
- pourcentages en ligne ou colonne selon le dénominateur substantiel ;
- test d’indépendance ;
- avec design :
svytable()etsvychisq().
C.3.2 Quantitative × qualitative
Question : la satisfaction moyenne diffère-t-elle selon le sexe ?
- moyenne/médiane par groupe ;
- boxplot ;
- deux groupes : t-test / alternative non paramétrique ;
- plusieurs groupes : comparaison globale / modèle ;
- avec design :
svyby(),svyttest().
C.3.3 Quantitative × quantitative
Question : âge et satisfaction covarient-ils ?
- nuage de points ;
- corrélation ;
- régression si l’objectif est directionnel/ajusté.
La présence d’une association, même après ajustement, ne suffit pas à démontrer un effet causal.
C.4 Étape 4 — Choisir un modèle selon Y
| Variable dépendante Y | Modèle de départ | Exemple |
|---|---|---|
| Continue | Linéaire | satisfaction 0–10 |
| Binaire | Logistique | sport régulier oui/non |
| Ordinale ≥ 3 niveaux | Logistique ordinale | santé auto-évaluée |
| Nominale ≥ 3 catégories | Multinomiale | statut d’emploi |
| Comptage | Poisson / quasi-Poisson / modèle adapté | nombre de livres |
| Mesures répétées | Effets fixes / mixtes / modèle longitudinal | satisfaction à plusieurs vagues |
Puis demander :
- les hypothèses du modèle sont-elles plausibles ?
- la taille des catégories est-elle suffisante ?
- faut-il tenir compte du plan de sondage ?
- les effets seront-ils plus lisibles en coefficients, ratios ou probabilités prédites ?
C.5 Étape 5 — Le design d’enquête
L'enquête a-t-elle des poids / strates / grappes ?
│
├── Non / échantillon aléatoire simple réellement défendable
│ └── méthodes usuelles
│
└── Oui
├── construire l'objet svydesign()
├── utiliser les versions svy* des estimateurs/tests
└── utiliser svyglm()/svyolr() ou méthode compatible
Ne remplacez pas l’objet de design par :
lm(y ~ x, weights = poids)sans justification. Un poids dans une fonction générale ne signifie pas nécessairement que la stratification et les grappes sont prises en compte.
C.6 Étape 6 — Les valeurs manquantes
Une valeur manque
│
├── question non applicable ?
│ └── absence structurelle → ne pas imputer comme une réponse
│
├── code NSP / refus ?
│ ├── préserver le sens
│ └── recoder en NA pour les calculs si approprié
│
└── vraie non-réponse sur variable applicable ?
├── faible et plausiblement ignorable → cas complets possible
├── non-réponse substantielle → diagnostiquer
└── imputation multiple / sensibilité si justifié
C.7 Étape 7 — Dois-je pondérer ?
Trois questions différentes :
- Décrire l’échantillon tel qu’il est ? → non pondéré peut être pertinent.
- Estimer une caractéristique de la population cible ? → utiliser les poids adaptés.
- Estimer un modèle ? → dépend de la question, du plan et de l’approche d’inférence ; pour ce livre, les modèles de population issus d’enquêtes complexes sont généralement présentés via
{survey}.
Toujours indiquer dans le texte si le résultat est brut ou pondéré.
C.8 Étape 8 — Quel dénominateur ?
C.8.1 Pourcentage ligne
Parmi les diplômés du supérieur, quelle proportion pratique régulièrement un sport ?
Dénominateur = diplômés du supérieur.
C.8.2 Pourcentage colonne
Parmi les personnes pratiquant régulièrement, quelle est la distribution des diplômes ?
Dénominateur = pratiquants réguliers.
Le logiciel ne choisit pas le dénominateur à votre place : la question substantielle le fait.
C.9 Étape 9 — Test ou intervalle de confiance ?
Si la question principale est :
« Quelle est la proportion ? »
un estimateur et son intervalle de confiance sont centraux.
Si la question est :
« Les distributions diffèrent-elles ? »
un test peut compléter l’estimation.
Évitez de réduire une analyse à la seule question « p < 0,05 ? ».
C.10 Étape 10 — Modèle ou simple comparaison ?
Utilisez un modèle lorsque vous avez besoin de :
- quantifier une relation continue ;
- ajuster sur plusieurs variables ;
- tester une interaction ;
- produire des prédictions ;
- représenter une structure longitudinale ou hiérarchique.
N’utilisez pas un modèle complexe uniquement parce qu’il est disponible.
C.11 Tableau de synthèse
| Question | Variable(s) | Outil descriptif | Outil d’inférence / modèle avec design |
|---|---|---|---|
| Proportion d’une modalité | Qualitative | svymean() sur indicatrice |
svyciprop() |
| Distribution | Qualitative | svytable() |
IC / tests selon question |
| Moyenne | Quantitative | svymean() |
confint() |
| Médiane / quantiles | Quantitative | svyquantile() |
IC de quantiles |
| Tableau croisé | Quali × quali | svytable() |
svychisq() |
| Moyenne par groupe | Quant × quali | svyby() |
svyttest() / svyglm() |
| Y continu ajusté | Plusieurs X | — | svyglm() gaussien |
| Y binaire ajusté | Plusieurs X | — | svyglm(..., quasibinomial()) |
| Y ordinal | Plusieurs X | — | svyolr() |
| Y comptage | Plusieurs X | — | svyglm(..., quasipoisson()) |
| Panel | individu × temps | trajectoires / transitions | plm(), lmer() + réflexion sur poids |
C.12 Cinq arrêts obligatoires
Avant de cliquer sur Render ou d’envoyer une table :
- Univers — qui est réellement dans le dénominateur ?
- Codage — les codes spéciaux ont-ils été traités ?
- Design — le plan de sondage est-il respecté ?
- Incertitude — un IC ou une mesure de précision est-il nécessaire ?
- Conclusion — le texte affirme-t-il davantage que ce que le plan et les données permettent ?