Nettoyer, dédoublonner et enrichir une base clients

Par Alexandre Rastello, publié le

  • données
  • CRM
  • dédoublonnage

En résumé. Quatre opérations, dans cet ordre : normaliser, dédoublonner, enrichir, maintenir. Inverser deux étapes fait perdre le travail. L’essentiel du dédoublonnage, environ 80 % des cas, se règle sans intelligence artificielle, par normalisation et par rapprochement sur le numéro SIREN. L’IA sert uniquement pour les paires ambiguës qui restent, et pour quelques centimes. Sur une base B2B française, l’enrichissement de base coûte zéro euro : les données d’entreprise sont publiques et accessibles par l’API Sirene de l’INSEE. Le budget d’un tel projet est dans les règles de décision, pas dans la technique.

L’ordre compte plus que les outils

Beaucoup de projets commencent par acheter un outil de dédoublonnage et se terminent par une base aussi sale qu’avant, en trois mois de plus.

La raison est simple : dédoublonner avant de normaliser revient à comparer des chaînes de caractères qui ne se ressemblent pas alors qu’elles désignent la même entreprise. « SARL Martin & Fils », « martin et fils », « MARTIN ET FILS SARL » sont trois fiches distinctes pour n’importe quel outil, et une seule entreprise pour vous.

Enrichir avant de dédoublonner coûte trois fois le prix : vous payez l’enrichissement de trois fiches qui n’en font qu’une, puis vous jetez deux enrichissements.

L’ordre correct ne change jamais : normaliser, dédoublonner, enrichir, maintenir.

Normaliser : le travail ingrat qui décide de tout

Sur chaque champ, ramener les variantes à une forme unique.

Les raisons sociales, en retirant les formes juridiques, la ponctuation, les accents et les mots vides pour la comparaison, tout en conservant la valeur d’origine pour l’affichage.

Les adresses, en passant par un référentiel officiel. La Base Adresse Nationale, construite avec l’IGN, La Poste et OpenStreetMap France, permet de ramener « 12 av. du Gal de Gaulle » et « 12 avenue du Général de Gaulle » à la même adresse normalisée.

Les téléphones, en format international, ce qui règle les 0033, les points, les espaces et les indicatifs manquants.

Les emails, en minuscules, avec détection des fautes de frappe courantes sur les domaines les plus répandus.

Cette étape est entièrement déterministe. Aucun modèle n’est nécessaire, et en introduire un ici ajoute du risque sans rien apporter.

Dédoublonner : d’abord la certitude, ensuite le doute

Trois niveaux, à traiter dans l’ordre, du plus sûr au plus incertain.

Le rapprochement certain. Deux fiches partageant le même SIRET sont la même entité, sans discussion. Même chose pour un email professionnel identique. Sur une base B2B française, ce niveau résout déjà une grande partie des doublons, à condition d’avoir les SIREN, ce qui nous amène à l’étape suivante.

Le rapprochement calculé. Après normalisation, on mesure la proximité entre les fiches sur plusieurs champs à la fois : raison sociale, adresse, téléphone, domaine de messagerie. Un score au-dessus d’un seuil élevé fusionne automatiquement, un score en dessous d’un seuil bas écarte. Cette mécanique est de l’algorithmique classique, rapide et reproductible.

La zone grise. Entre les deux seuils restent les cas que l’algorithme ne tranche pas : deux établissements d’un même groupe, une entreprise qui a changé de nom, un client particulier et son entreprise individuelle. C’est ici, et seulement ici, qu’un modèle de langage apporte quelque chose : il lit les deux fiches complètes et explique sa décision.

Sur une base de 20 000 fiches, cette zone grise représente typiquement quelques centaines de paires. À moins d’un centime la paire, l’arbitrage complet coûte quelques euros.

Retenez la proportion : environ 80 % du travail se fait sans IA. Un prestataire qui vous vend du « dédoublonnage par intelligence artificielle » pour l’ensemble de la chaîne vous facture de la mode.

Enrichir : ce qui est gratuit avant ce qui est payant

Sur des clients professionnels français, une part importante de l’enrichissement ne coûte rien.

L’API Sirene de l’INSEE donne accès aux données du répertoire officiel : raison sociale exacte, SIREN et SIRET, code d’activité, adresse du siège, tranche d’effectif, date de création, état administratif. L’accès est gratuit, après création d’un compte sur le portail des API de l’INSEE et souscription. Les données sont mises à jour quotidiennement.

C’est la source à brancher en premier, pour deux raisons. Elle est fiable, puisqu’elle fait foi. Et elle apporte le SIREN, qui devient ensuite la clé de rapprochement la plus solide de toute votre base.

Les données ouvertes complémentaires sur data.gouv.fr couvrent d’autres besoins selon votre activité.

Les fournisseurs payants gardent leur utilité pour ce que le public ne donne pas : contacts nominatifs, effectifs précis, données financières détaillées, signaux d’intention. Branchez-les après les sources gratuites, sur les fiches qui en ont vraiment besoin, pas sur la base entière.

Ce qu’un état administratif révèle. Une fois le SIREN branché, il apparaît presque toujours que plusieurs pour cent de la base sont des entreprises cessées. Les relancer coûtait du temps commercial depuis des années.

Ce que l’IA apporte, et ce qu’elle n’apporte pas

Tâche Bonne approche
Normaliser les formats code déterministe
Rapprocher sur SIRET ou email code déterministe
Calculer une proximité entre fiches algorithme de similarité
Trancher les paires ambiguës modèle de langage
Classer une activité à partir d’un texte libre modèle de langage
Extraire des informations d’un champ « notes » modèle de langage
Décider quelle fiche survit à la fusion vos règles métier, écrites

La dernière ligne mérite attention. Quand deux fiches fusionnent, laquelle garde son identifiant, quelles valeurs l’emportent champ par champ, que deviennent les historiques rattachés à la fiche supprimée. Ces questions n’ont rien de technique et elles conditionnent la confiance de vos équipes dans le résultat. Une fusion qui fait disparaître trois ans d’échanges commerciaux se paie en réunion houleuse.

Le RGPD, qui s’invite dès l’enrichissement

Deux points à traiter avant de démarrer, pas après.

L’enrichissement de données personnelles suppose une base légale et une information des personnes concernées. Récupérer des informations d’entreprise sur le répertoire Sirene ne pose pas de difficulté ; constituer des fiches nominatives sur des personnes qui ne vous ont rien demandé en pose une.

La suppression des doublons est aussi une occasion de traiter les durées de conservation. Une base clients contient presque toujours des contacts inactifs depuis dix ans, qui n’ont plus de raison d’y figurer. Le nettoyage est le bon moment pour appliquer une règle de purge, parce que personne ne le fera à un autre moment.

Maintenir, sinon tout recommence

Une base nettoyée redevient sale en dix-huit mois si rien ne change en amont. Trois mesures, aucune coûteuse.

Le contrôle à la saisie : une vérification d’existence avant création d’une fiche, qui propose les fiches proches. C’est la mesure la plus efficace de toutes.

La normalisation automatique à l’entrée, sur les mêmes règles que le nettoyage initial.

Une vérification périodique contre le répertoire officiel, pour détecter les cessations, les changements d’adresse et les changements de nom.

Sans ces trois mesures, prévoyez de refaire l’opération complète tous les deux ans, ce qui est un choix défendable mais qu’il faut faire en connaissance de cause.

Le coût

Le traitement des données ne coûte presque rien : quelques euros de modèle pour les cas ambigus d’une base de 20 000 fiches, zéro euro pour l’enrichissement public.

Le budget est ailleurs. Comptez 8 à 15 jours selon la taille de la base, le nombre de systèmes concernés et la complexité des règles de fusion, à multiplier par le TJM de votre prestataire. La partie longue n’est pas le code, c’est la validation : faire relire un échantillon de fusions proposées par les personnes qui connaissent les clients, ajuster les seuils, recommencer. Comptez deux heures par semaine de disponibilité de leur côté, comme sur n’importe quelle mission d’automatisation.


Conditions d’accès à l’API Sirene et à la Base Adresse Nationale vérifiées en août 2026 ; consultez le portail des API de l’INSEE pour les modalités de souscription à jour.

Questions fréquentes

Quel est le meilleur outil de déduplication et d'enrichissement de base clients en 2026 ?
Les CRM du marché intègrent une détection de doublons souvent limitée à une comparaison exacte, insuffisante sans normalisation préalable. Les outils dédiés fonctionnent bien sur des bases standard. Sur une base B2B française, la combinaison la plus efficace reste la normalisation, le rapprochement par SIREN via l'API Sirene, un calcul de similarité, et un modèle de langage uniquement sur les cas ambigus. Le choix de l'outil compte moins que l'ordre des opérations.
Comment dédoublonner une base clients sans se tromper ?
En trois niveaux. D'abord le rapprochement certain sur SIRET ou email professionnel identique, qui fusionne sans risque. Ensuite un score de similarité sur plusieurs champs normalisés, avec un seuil haut qui fusionne automatiquement et un seuil bas qui écarte. Enfin un arbitrage sur la zone grise entre les deux seuils, où un modèle de langage lit les fiches complètes et justifie sa décision. Chaque fusion automatique doit être réversible pendant la phase de validation.
Peut-on enrichir gratuitement une base d'entreprises françaises ?
Oui, pour les données de référence. L'API Sirene de l'INSEE donne accès gratuitement à la raison sociale exacte, au SIREN et au SIRET, au code d'activité, à l'adresse du siège, à la tranche d'effectif et à l'état administratif, avec une mise à jour quotidienne. L'accès demande la création d'un compte et une souscription sur le portail des API de l'INSEE. Les fournisseurs payants restent utiles pour les contacts nominatifs et les données financières détaillées.
Combien coûte le nettoyage d'une base de données clients ?
Le traitement lui-même est marginal, quelques euros de modèle pour les cas ambigus d'une base de 20 000 fiches et rien pour l'enrichissement public. Le budget porte sur le développement et la validation : 8 à 15 jours selon la taille de la base et la complexité des règles de fusion, à multiplier par le TJM de votre prestataire.
Faut-il de l'intelligence artificielle pour dédoublonner un CRM ?
Pour environ 80 % des cas, non. La normalisation des formats, le rapprochement sur identifiant officiel et le calcul de similarité sont de l'algorithmique classique, plus rapide et plus reproductible qu'un modèle. L'IA apporte une valeur réelle sur les paires ambiguës, sur le classement d'activité à partir de texte libre et sur l'extraction d'informations enfouies dans les champs de commentaires libres.
Dans quel ordre nettoyer une base clients ?
Normaliser, dédoublonner, enrichir, maintenir. Dédoublonner avant de normaliser fait rater les doublons évidents. Enrichir avant de dédoublonner multiplie la facture par le nombre de doublons. Et sans les mesures de maintien, contrôle à la saisie en tête, la base redevient sale en dix-huit mois.
Que dit le RGPD sur l'enrichissement de données clients ?
L'enrichissement de données personnelles suppose une base légale et une information des personnes concernées. Récupérer des données d'entreprise sur le répertoire Sirene ne pose pas de difficulté particulière ; constituer des fiches nominatives à partir de sources tierces en pose une. Le nettoyage est aussi le bon moment pour appliquer une règle de durée de conservation aux contacts inactifs depuis des années.
Comment éviter qu'une base clients redevienne sale ?
Trois mesures. Un contrôle à la saisie qui propose les fiches existantes proches avant d'en créer une nouvelle, de loin la plus efficace. Une normalisation automatique appliquée à toute entrée, selon les mêmes règles que le nettoyage initial. Et une vérification périodique contre le répertoire officiel pour détecter cessations, déménagements et changements de nom.

Cet article fait partie du dossier Assistant IA sur vos documents internes : ce que le RAG fait et ne fait pas.