Dire qu’une donnée est « de mauvaise qualité » ne permet pas d’agir. Est-elle fausse ? Incomplète ? Périmée ? En double ? Chacun de ces défauts a une cause différente et appelle un traitement différent. C’est pour cette raison que la qualité des données se décompose en dimensions : des critères distincts, mesurables séparément, qui transforment un ressenti en diagnostic.
Six dimensions font aujourd’hui référence : l’exactitude, la complétude, la cohérence, l’actualité, l’unicité et la validité. Dans cet article je vais les définir une à une, montrer comment les qualifier, et les appliquer à un cas concret pour montrer qu’une donnée d’apparence correcte peut échouer sur presque tous les critères.
Qu’est-ce que la qualité des données ?
La qualité des données désigne l’aptitude d’une donnée à servir l’usage auquel on la destine. Cette définition, dite de « l’adéquation à l’usage » , a une conséquence importante : la qualité n’est pas une propriété absolue. Une même base peut être excellente pour un envoi postal et médiocre pour une campagne téléphonique, selon les champs dont chaque usage a besoin.
Le concept de dimensions de la qualité a été formalisé en 1996 par les chercheurs Richard Wang et Diane Strong, qui en recensaient alors une quinzaine. Aucune norme universelle ne s’est imposée depuis, et certains cadres en retiennent six, d’autres neuf ou davantage. La liste de six dimensions présentée ici, popularisée notamment par l’association professionnelle DAMA, est la plus largement utilisée, car elle couvre l’essentiel des défauts rencontrés en pratique sans multiplier les critères.
Pour rendre ces dimensions concrètes, prenons une fiche comme on en trouve des milliers dans les bases de données :
M. Jean Dupuis — Directeur commercial — Société Batiforme — 14 rue de la République, 69002 Lyon — j.dupuis@batiforme.fr — Effectif : (vide) — Dernière mise à jour : mars 2022.
À première vue, rien d’anormal : l’adresse est bien formée, l’e-mail a une syntaxe correcte, le poste est renseigné. Cette fiche passerait sans difficulté un contrôle superficiel. Nous allons voir, dimension par dimension, qu’elle en échoue pourtant cinq sur six.
Les 6 dimensions qui régissent la qualité d’une donnée
L’exactitude : la donnée reflète-t-elle la réalité ?
L’exactitude mesure la correspondance entre la donnée et la réalité qu’elle est censée décrire. Une donnée exacte est une donnée vraie.
En ce qui concerne notre donnée précédemment citée, Jean Dupuis a quitté Batiforme en 2024. Son adresse e-mail a une syntaxe parfaite, le poste est plausible, la société existe mais la fiche décrit une situation qui n’existe plus. Elle est inexacte.
L’exactitude est la dimension la plus importante et la plus difficile à mesurer, car elle exige une référence externe : on ne peut pas savoir qu’une information est fausse en la regardant seule. Il faut la confronter à la réalité : un référentiel d’entreprises, une vérification d’adresse, un appel, un rebond d’e-mail.
Mesure : taux d’exactitude = nombre de fiches confirmées exactes / nombre de fiches contrôlées, calculé sur un échantillon vérifié.
Conseil d'expert
Dans un premier temps, ne cherchez pas à mesurer l’exactitude sur toute la base : c’est coûteux et inutile. Contrôlez un échantillon aléatoire de 200 à 300 fiches en les confrontant à une source fiable, puis extrapolez. Cet ordre de grandeur suffit pour décider. Et retenez que vos campagnes mesurent déjà l’exactitude gratuitement : chaque rebond d’e-mail, chaque courrier retourné, chaque numéro qui n’aboutit pas est une inexactitude révélée. Consolider ces retours vous donne un indicateur d’exactitude permanent.
La complétude : toutes les informations nécessaires sont-elles présentes ?
La complétude mesure la présence des informations requises. Une fiche complète contient tous les champs dont l’usage prévu a besoin.
Sur notre fiche, le champ « effectif » est vide. Si vous souhaitez cibler les entreprises de plus de cinquante salariés, cette fiche est inexploitable : vous ne savez pas si Batiforme entre dans votre cible. Elle est incomplète pour cet usage.
La nuance est essentielle : la complétude se juge par rapport à un besoin, pas dans l’absolu. Un champ vide n’est un défaut que si vous en avez besoin. Exiger que tous les champs d’une base soient remplis est à la fois irréaliste et inutile ; exiger que les champs critiques le soient est indispensable.
Mesure : taux de complétude = nombre de champs critiques renseignés / nombre de champs critiques attendus.
Attention au piège des faux remplissages : un champ contenant « N/A », « inconnu » ou un tiret est compté comme rempli par la plupart des outils, alors qu’il est vide en pratique. Il faut les exclure explicitement du calcul.
La cohérence : la donnée concorde-t-elle d’un endroit à l’autre ?
La cohérence mesure l’absence de contradiction, à la fois entre plusieurs systèmes et au sein d’une même fiche.
Sur notre exemple, la société s’appelle « Batiforme » dans l’outil d’emailing et « Batiforme Rhône » dans le CRM. Laquelle est la bonne ? Aucune des deux valeurs n’est forcément fausse, mais leur divergence empêche de savoir quelle version fait foi, fausse les rapprochements et produit des communications incohérentes.
La cohérence a deux niveaux. La cohérence inter-systèmes vérifie qu’une même donnée est identique partout où elle est stockée. La cohérence interne vérifie que les champs d’une même fiche ne se contredisent pas : un code postal qui ne correspond pas à la ville, une date de création postérieure à la date de dernière commande, une civilité « Madame » associée à un prénom masculin.
Mesure : taux de cohérence = nombre de fiches concordantes / nombre de fiches comparées entre deux sources, sur les champs clés.
L’actualité : la donnée est-elle encore à jour ?
L’actualité, parfois appelée fraîcheur, mesure si la donnée reflète l’état présent de la réalité. Une donnée peut avoir été exacte au moment de sa collecte et ne plus l’être.
Sur notre fiche, la dernière mise à jour date de mars 2022. Même sans savoir que Jean Dupuis est parti, cette ancienneté est en soi un signal d’alerte : en B2B, on estime qu’environ un 20% des données professionnelles devient obsolète chaque année, sous l’effet des changements de poste, des déménagements et des évolutions d’entreprise.
L’actualité a une particularité qui la distingue de toutes les autres dimensions : elle se dégrade toute seule. Une base parfaitement exacte aujourd’hui sera partiellement fausse dans un an, sans que personne n’ait commis la moindre erreur. C’est la seule dimension que l’on ne peut pas corriger une fois pour toutes : elle exige un entretien continu.
Mesure : âge médian des fiches, ou part des fiches mises à jour au cours des douze derniers mois.
Conseil d'Expert
Ajoutez une date de dernière vérification à chaque fiche, distincte de la date de dernière modification. Une fiche peut être modifiée sans être vérifiée (un commercial ajoute une note) et vérifiée sans être modifiée (on confirme que tout est juste). Seule la date de vérification mesure réellement la fraîcheur. C’est un champ simple à créer, et il devient rapidement votre meilleur allié pour décider quelles fiches rafraîchir en priorité.
L’unicité : chaque entité n’est-elle représentée qu’une seule fois ?
L’unicité mesure l’absence de doublons : chaque personne, chaque entreprise, chaque adresse ne doit apparaître qu’une fois dans la base.
Notre base contient une deuxième fiche au nom de « Jean Dupuy », même société, même adresse e-mail. Une faute de frappe à la saisie a créé un doublon. Conséquence : Jean Dupuis recevrait deux fois chaque campagne, les statistiques de ciblage sont faussées, et une mise à jour effectuée sur une fiche ne sera pas répercutée sur l’autre.
Les doublons ont rarement une origine unique : imports successifs de fichiers, saisies multiples par différents collaborateurs, formulaires remplis plusieurs fois, fusions de bases. Et ils sont souvent approximatifs plutôt qu’identiques, ce qui les rend invisibles à un simple tri.
Mesure : taux de doublons = nombre d’enregistrements en double / nombre total d’enregistrements.
La validité : la donnée respecte-t-elle le format et les règles attendus ?
La validité mesure la conformité d’une donnée aux règles qui la définissent : format, type, plage de valeurs autorisées, référentiel.
Sur notre fiche, c’est le seul point qui est OK. L’e-mail contient un arobase et un nom de domaine, le code postal comporte cinq chiffres, le format adresse respecte la structure attendue. Exemples de données invalides : un code postal à quatre chiffres, un e-mail sans arobase, un SIRET de douze chiffres, une date au 31 février, une civilité qui n’appartient pas à la liste prévue.
La validité est la dimension la plus facile à contrôler, car elle ne nécessite aucune source externe : une simple règle suffit.
Mesure : taux de validité = nombre de valeurs conformes aux règles / nombre de valeurs contrôlées.
Le bilan de notre fiche : une donnée valide n’est pas une donnée fiable
Récapitulons. Notre fiche est valide, mais inexacte (le contact est parti), incomplète (effectif manquant), incohérente (nom de société divergent), périmée (mise à jour en 2022) et en double (fiche Jean Dupuy). Une seule dimension sur six est respectée précisément celle que la plupart des contrôles automatiques vérifient.
C’est l’enseignement principal de cet exercice : la validité est la dimension la plus souvent contrôlée et la moins révélatrice. Une base qui passe tous les contrôles de format peut être largement inutilisable. Se fier aux seuls contrôles de validité donne une fausse impression de propreté.
Les dimensions ne sont pas indépendantes
Présentées comme une liste, les six dimensions semblent indépendantes. Elles ne le sont pas, et comprendre leurs relations évite des erreurs de méthode coûteuses.
La validité est un prérequis de l’unicité. Pour détecter que « 14 rue de la République » et « 14 r. de la Republique » désignent la même adresse, il faut d’abord normaliser les deux valeurs. Sur une base non normalisée, une grande partie des doublons reste invisible. On ne déduplique donc jamais avant d’avoir travaillé la validité.
La validité ne garantit pas l’exactitude. Une adresse parfaitement formée peut être fausse ; un e-mail syntaxiquement irréprochable peut ne mener nulle part. La validité dit qu’une donnée pourrait être vraie, jamais qu’elle l’est.
L’actualité érode l’exactitude. Une donnée exacte au moment de sa collecte devient inexacte avec le temps. Le défaut d’actualité est donc la première cause d’inexactitude dans une base de prospection, bien avant les erreurs de saisie.
La complétude sans exactitude est une illusion. Une base dont tous les champs sont remplis mais dont une partie des valeurs est fausse inspire une confiance qu’elle ne mérite pas. Mieux vaut un champ vide, que l’on sait vide, qu’un champ rempli d’une valeur erronée que l’on croit juste.
Conseil d'Expert
Respectez un ordre de traitement fixe quand vous améliorez une base : validité d’abord (normaliser, corriger les formats), puis unicité (dédupliquer sur des valeurs désormais comparables), puis actualité et exactitude (vérifier, mettre à jour), et seulement ensuite complétude (enrichir). Enrichir avant d’avoir dédupliqué revient à payer plusieurs fois pour le même contact ; enrichir avant d’avoir vérifié revient à compléter des fiches qui décrivent des personnes parties. Cet ordre n’est pas une préférence de méthode, il découle directement des dépendances entre dimensions.
La dimension que les référentiels oublient souvent : la conformité
Les six dimensions classiques ont été pensées pour des données d’entreprise en général. Appliquées à une base de prospection contenant des données personnelles, elles laissent de côté un critère devenu décisif : la conformité.
Une donnée peut être exacte, complète, cohérente, à jour, unique et valide et pourtant inutilisable, parce que vous n’avez pas le droit de l’exploiter. Trois questions définissent cette septième dimension : connaissez-vous l’origine de la donnée et pouvez-vous la documenter ? Disposez-vous d’une base légale valide pour l’utiliser, et en particulier d’un consentement lorsque celui-ci est requis ? Respectez-vous la durée de conservation applicable ?
Le RGPD fait d’ailleurs de l’exactitude une obligation légale et non un simple objectif de performance : les données personnelles doivent être exactes et, si nécessaire, tenues à jour. Avec la généralisation de la logique d’opt-in en matière de prospection, la conformité est devenue une condition préalable à tout le reste : une base de haute qualité sur les six dimensions classiques, mais dont le consentement n’est pas traçable, reste une base que vous ne pouvez pas activer.
Des dimensions au pilotage
Connaître les six dimensions n’a d’intérêt que si elles deviennent des indicateurs suivis. La démarche est progressive. Elle commence par un audit de la base, le data profiling qui mesure l’état de chaque dimension sur les champs critiques. Elle se poursuit par la fixation d’un seuil acceptable pour chaque dimension, défini en fonction de l’usage. Elle aboutit à un score de qualité synthétique, suivi dans le temps, qui permet de vérifier que les actions engagées produisent un effet et que la base ne se dégrade pas entre deux campagnes.
L’essentiel est de ne pas chercher à tout mesurer d’emblée. Trois ou quatre indicateurs bien choisis, alignés sur votre usage principal et suivis régulièrement, apportent davantage qu’un tableau exhaustif que personne ne consulte.
FAQ : Qualité de la donnée
Oui, plusieurs. La norme ISO 8000 est consacrée à la qualité des données, notamment des données de référence, et la norme ISO/IEC 25012 définit un modèle de caractéristiques de qualité. Elles servent surtout de cadre aux grandes organisations ; pour une base de prospection, les six dimensions présentées dans cet article suffisent largement à piloter.
Non. Atteindre la perfection sur toutes les dimensions coûte de plus en plus cher à mesure qu’on s’en approche, pour un bénéfice de plus en plus faible. L’objectif est un niveau suffisant pour l’usage : un seuil défini par dimension et par champ critique, au-delà duquel l’effort supplémentaire ne change plus les résultats.
Les dimensions sont identiques, mais leur poids diffère. En B2B, l’actualité est critique car les contacts changent souvent de poste. En B2C, l’enjeu porte davantage sur la validité des adresses postales, les déménagements et la conformité, les données de particuliers étant plus strictement encadrées par le RGPD.
En contrôlant la donnée au point d’entrée plutôt qu’en la corrigeant après coup : champs obligatoires pour les informations critiques, listes déroulantes plutôt que saisie libre, vérification en temps réel des e-mails et des adresses, double opt-in pour les inscriptions. Corriger une donnée à la source coûte une fraction de ce que coûte sa correction une fois entrée dans vos systèmes.