Annexe C — Glossaire
Ce glossaire privilégie les définitions utilisées dans le livre. Certaines notions possèdent des définitions plus spécialisées selon les disciplines.
C.1 A
Analyse en cas complets
Analyse réalisée uniquement sur les observations sans valeur manquante pour toutes les variables nécessaires à l’estimation considérée.
Analyse de sensibilité
Ensemble de réanalyses faisant varier des décisions ou hypothèses raisonnables afin d’évaluer la dépendance des conclusions à ces choix.
Anonymisation
Processus visant à rendre impossible en pratique l’identification d’une personne de manière irréversible. Elle ne doit pas être confondue avec la pseudonymisation.
Attrition
Perte d’unités au fil des vagues d’une enquête longitudinale ou d’un panel.
C.2 B
Biais
Écart systématique entre ce qu’une procédure estime en moyenne et la quantité qu’elle vise à estimer. Le terme peut désigner des mécanismes très différents : sélection, non-réponse, mesure, traitement, etc.
Biais de non-réponse
Biais pouvant apparaître lorsque la probabilité de répondre est liée à la variable d’intérêt ou à des caractéristiques qui lui sont associées.
BRR — Balanced Repeated Replication
Méthode d’estimation de variance par réplications, adaptée à certains plans stratifiés.
C.3 C
Calibration
Ajustement des poids afin que certaines estimations auxiliaires pondérées correspondent à des totaux ou marges connus de population.
Cas complet
Observation ne comportant aucune valeur manquante parmi les variables nécessaires à une analyse donnée.
Catégorie de référence
Modalité par rapport à laquelle les autres modalités d’un facteur sont comparées dans de nombreux modèles de régression.
Coefficient de variation d’un poids
Rapport entre l’écart-type des poids et leur moyenne. Il renseigne sur leur dispersion relative.
Comptage
Variable numérique prenant des valeurs entières non négatives représentant un nombre d’événements ou d’objets.
Confondeur
Variable liée à la fois à l’exposition et au résultat et susceptible, sous certaines structures causales, de produire ou modifier une association observée.
Corrélation
Mesure de l’association entre deux variables quantitatives. Une corrélation ne démontre pas un lien causal.
C.4 D
Data frame
Structure tabulaire de R dans laquelle chaque colonne peut posséder un type différent.
Dénominateur
Population ou sous-population sur laquelle une proportion est calculée. Le choix du dénominateur est substantiel.
Design effect / effet de plan
Rapport entre la variance d’un estimateur sous le plan réel et celle obtenue sous un plan de référence, souvent un échantillonnage aléatoire simple de même taille.
Dichotomisation
Transformation d’une variable en deux catégories. Elle peut simplifier l’interprétation mais entraîne souvent une perte d’information.
Dictionnaire de données
Document décrivant les variables : noms, libellés, types, modalités, codes spéciaux, univers, unités et parfois provenance.
Distribution d’échantillonnage
Distribution théorique d’une statistique lorsqu’on répète le mécanisme d’échantillonnage.
C.5 E
Échantillon
Sous-ensemble d’unités effectivement sélectionnées ou observées à partir d’une population cible ou d’une base de sondage.
Échantillonnage probabiliste
Plan dans lequel les probabilités de sélection des unités sont connues ou calculables selon un mécanisme probabiliste défini.
Effet fixe individuel
Dans un modèle de panel, terme contrôlant les caractéristiques individuelles invariantes dans le temps ; l’estimation within s’appuie sur les changements au sein des individus.
Effet marginal
Mesure de la variation d’une prédiction associée à une variation d’une variable explicative, souvent exprimée sur l’échelle de la probabilité ou de la moyenne prédite.
Effet aléatoire
Composante d’un modèle mixte représentant une hétérogénéité entre groupes ou individus selon une distribution probabiliste.
Erreur standard
Mesure de l’incertitude d’un estimateur due à l’échantillonnage, calculée selon le modèle ou le plan d’inférence retenu.
Estimation
Valeur calculée à partir de l’échantillon pour approcher un paramètre de la population.
C.6 F
Facteur (factor)
Classe R utilisée pour représenter des variables catégorielles avec un ensemble de niveaux. Un facteur peut être ordonné.
FPC — correction de population finie
Correction de variance utilisée lorsque la fraction de sondage n’est pas négligeable et que les tailles de population pertinentes sont connues.
C.7 G
Grappe / cluster de sondage
Groupe d’unités échantillonné comme unité intermédiaire dans un plan en grappes. À distinguer d’un effet aléatoire substantiel d’un modèle multiniveau.
C.8 I
Imputation
Procédure produisant des valeurs plausibles pour certaines données manquantes sous des hypothèses explicites.
Imputation multiple
Procédure générant plusieurs versions complétées des données, analysées séparément puis combinées afin de refléter l’incertitude due aux valeurs manquantes.
Interaction
Situation dans laquelle l’association entre une variable explicative et le résultat dépend de la valeur d’une autre variable.
Intervalle de confiance
Intervalle construit par une procédure qui, sous répétition et hypothèses valides, couvre le paramètre avec une fréquence définie, par exemple 95 %.
C.9 L
Label de variable
Description lisible associée à un nom de variable, par exemple sport_freq → « fréquence de pratique sportive ».
Label de valeur
Étiquette associée à un code, par exemple 1 → « Homme ».
Logit
Logarithme des odds : \(\log(p/(1-p))\). C’est le lien canonique de la régression logistique.
C.10 M
MAR — Missing At Random
Hypothèse selon laquelle, conditionnellement aux informations observées du modèle d’imputation, la probabilité de manque ne dépend plus de la valeur manquante elle-même.
MCAR — Missing Completely At Random
Hypothèse forte selon laquelle la probabilité de manque ne dépend ni des données observées ni de la valeur manquante.
MNAR — Missing Not At Random
Situation dans laquelle le mécanisme de manque dépend encore de la valeur non observée ou d’informations non capturées, même après conditionnement sur les variables observées.
Modalité
Valeur ou catégorie possible d’une variable qualitative.
Modèle mixte
Modèle comprenant des effets fixes et des effets aléatoires, utile notamment pour des données groupées ou répétées.
C.11 N
NA
Valeur utilisée par R pour représenter une donnée manquante. Elle n’indique pas à elle seule la raison de l’absence.
Non-réponse
Absence de réponse à l’enquête entière (non-réponse unité) ou à une question particulière (non-réponse item).
C.12 O
Odds
Rapport \(p/(1-p)\) entre la probabilité d’un événement et celle de son complément.
Odds ratio (OR)
Rapport de deux odds. Un OR n’est pas un ratio de probabilités et ne doit pas être lu comme une différence de pourcentage.
Open data
Mise à disposition de données pour réutilisation selon des conditions explicites. L’ouverture de données d’enquête doit respecter les droits, licences et risques de confidentialité.
C.13 P
Panel
Dispositif longitudinal dans lequel les mêmes unités sont observées à plusieurs moments.
Paramètre
Quantité définie sur la population ou le modèle que l’on souhaite estimer.
Pipe (|> ou %>%)
Opérateur permettant d’enchaîner des opérations en transmettant le résultat d’une étape à la suivante.
Poids de sondage
Poids lié au mécanisme de sélection, souvent initialement inversement proportionnel à la probabilité d’inclusion.
Poids final
Poids après les ajustements prévus par le producteur, pouvant inclure correction de non-réponse et calibration.
Poids de réplication
Ensemble de poids alternatifs utilisés pour réestimer une statistique et calculer sa variance selon une méthode de réplication.
Population cible
Ensemble sur lequel la recherche souhaite produire des inférences.
Post-stratification
Ajustement des poids visant à reproduire une distribution jointe connue de variables auxiliaires dans la population.
Prédiction ajustée
Valeur du résultat prédite par un modèle pour un profil ou une distribution de covariables définie.
PSU — Primary Sampling Unit
Unité primaire d’échantillonnage dans un plan à plusieurs degrés.
Pseudonymisation
Traitement remplaçant ou séparant les identifiants directs de manière à ce que l’identité ne puisse être réattribuée sans information supplémentaire. Les données restent potentiellement réidentifiables.
p-value
Probabilité, sous l’hypothèse nulle et le modèle de test, d’observer une statistique au moins aussi extrême que celle obtenue. Elle n’est pas la probabilité que l’hypothèse nulle soit vraie.
C.14 Q
Question filtrée
Question posée seulement à une sous-population définie par des réponses antérieures ou des caractéristiques du répondant.
Quasi-Poisson
Famille de modèle conservant le lien log et la structure moyenne du Poisson tout en permettant une dispersion différente de l’égalité stricte moyenne–variance.
C.15 R
Raking
Ajustement itératif des poids pour faire correspondre plusieurs marges de population connues lorsque la distribution jointe complète n’est pas nécessairement disponible.
Régression linéaire
Modèle reliant la moyenne conditionnelle d’une variable quantitative à une combinaison linéaire de variables explicatives.
Régression logistique
Modèle pour une réponse binaire reliant le logit de la probabilité à une combinaison linéaire de variables explicatives.
Régression ordinale
Famille de modèles exploitant l’ordre d’une réponse catégorielle sans supposer des distances égales entre catégories.
Réponse multiple
Question autorisant plusieurs modalités simultanément, souvent représentée par une série de variables indicatrices.
C.16 S
Score composite
Variable construite en combinant plusieurs items destinés à représenter un même concept ou une dimension commune.
Strate
Sous-population définie avant l’échantillonnage et échantillonnée séparément selon le plan.
Surdispersion
Situation dans laquelle la variabilité observée ou conditionnelle excède celle prévue par un modèle de référence, notamment le Poisson classique.
Survey design / objet de design
Objet R regroupant les données et les informations nécessaires au calcul d’estimations et de variances selon le plan d’enquête.
C.17 T
Taux de réponse
Proportion des unités éligibles sélectionnées ayant fourni une réponse selon la définition retenue. Il faut documenter précisément le dénominateur.
Tibble
Variante moderne du data.frame utilisée dans le tidyverse.
Total Survey Error (TSE)
Cadre qui considère l’ensemble des sources d’erreur d’une enquête : couverture, échantillonnage, non-réponse, mesure, traitement, etc.
Trimming des poids
Réduction de poids extrêmes selon une règle définie. Cette opération peut réduire la variance mais modifier les propriétés de biais et les contraintes de calibration.
C.18 U
Unité d’analyse
Entité sur laquelle porte l’analyse statistique : individu, ménage, établissement, publication, etc.
Univers d’une question
Ensemble des unités auxquelles une question s’applique et aurait dû être posée.
C.19 V
Valeur aberrante
Valeur atypique au regard de la distribution ou du contexte. Une valeur extrême n’est pas automatiquement erronée.
Valeur impossible
Valeur incompatible avec les règles du questionnaire ou le domaine théorique défini, par exemple un âge négatif dans une enquête d’adultes.
Variable dépendante
Variable que le modèle cherche à décrire ou expliquer conditionnellement à des variables explicatives.
Variable ordinale
Variable catégorielle dont les modalités ont un ordre, sans que les écarts entre modalités soient nécessairement quantifiables de manière égale.
Variance
Mesure de dispersion quadratique. Dans l’analyse d’enquête, la variance d’un estimateur doit être calculée en cohérence avec le plan d’échantillonnage.
C.20 W
Workflow
Enchaînement organisé et reproductible des étapes allant des sources de données aux résultats et à leur communication.