IA & INNOVATION
DIGITALISATION

Votre IA hérite des défauts de vos données

October 5, 2026
5 min
Jamila Boussaâ
Docteur en IA

La qualité des données d’un projet IA s’évalue en fonction de la décision à prendre. Un fichier peut être suffisant pour produire un reporting mensuel et inadapté à une prévision quotidienne. Avant de sélectionner un algorithme, l’entreprise doit donc déterminer quelles informations sont indispensables, comment elles sont produites et quelles erreurs risquent de modifier le résultat.

Relier la qualité à un usage précis

Prenons un cas fictif de prévision des besoins en formation.La direction souhaite consolider les compétences de plusieurs entités. Lesfichiers sont complets en apparence, mais les mêmes métiers portent des nomsdifférents et certaines évaluations datent de plusieurs années. Le problème nese résout pas simplement en fusionnant les tableaux.

Il faut d’abord définir les notions communes : qu’est-cequ’une compétence maîtrisée, à quelle date une évaluation devient-elle tropancienne et comment traiter une personne qui change de poste ? Sans cesdécisions, un traitement automatisé peut produire un résultat cohérent sur leplan informatique, mais difficile à exploiter par les RH.

Mesurer plusieurs dimensions

Le Government Data Quality Framework distingue notamment lacomplétude, l’unicité, la cohérence, l’actualité, la validité et l’exactitude[1]. Ces dimensions permettent de dépasser le seul contrôle des champs vides.Une date correctement formatée peut être fausse ; une ligne complète peut êtreun doublon.

Pour chaque champ critique, l’équipe doit préciser la règlede contrôle et l’impact d’un défaut. L’absence d’un numéro de téléphone nebloque pas nécessairement une analyse des effectifs. L’absence d’un identifiantstable peut, en revanche, empêcher de rapprocher correctement deux sources.

Il devient alors possible de hiérarchiser les corrections.Traiter en premier les défauts qui affectent la décision est généralement plusutile que viser une perfection uniforme sur tous les fichiers. Le niveau dequalité attendu doit être décidé avec le métier, puis rendu mesurable.

‍

Documenter les données pour préserver leur sens

La préparation technique ne suffit pas à expliquer l’origined’un jeu de données. La proposition de recherche Datasheets for Datasetsrecommande de documenter sa motivation, sa composition, sa collecte et lesusages envisagés [2]. Cette logique est directement utile lorsque plusieurséquipes réutilisent les mêmes informations.

Une fiche de données peut ainsi préciser le propriétaire, lafréquence de mise à jour, les transformations et les limites connues. Dansnotre exemple, elle signalerait qu’une filiale utilise une échelle decompétences différente. Cette information évite de présenter des scores commecomparables alors qu’ils ne le sont pas.

Conserver les règles de transformation permet également decomprendre pourquoi un indicateur change. Une hausse apparente peut résulterd’une nouvelle définition plutôt que d’une évolution réelle de l’activité.

‍

Installer une responsabilité durable

Nous recommandons de commencer par un périmètre limité : lessources et les champs indispensables au premier cas d’usage. Pour chacun,désignez une personne capable de corriger les anomalies et définissez le délaiattendu. Les contrôles doivent être exécutés à chaque alimentationsignificative, avec un traitement explicite des exceptions.

Un tableau de suivi utile associe chaque anomalie à sonvolume, à son impact et à une action. Il ne se limite pas à afficher un scoreglobal de qualité, qui pourrait masquer un défaut critique.

Le résultat attendu est une chaîne de données compréhensibleet maintenable. Cette base permet d’évaluer ensuite l’IA sur des informationsdont l’entreprise connaît les limites, au lieu de confondre les erreurs dedonnées avec celles du modèle.