Accueil › Guides › Déduplication en masse

Dédupliquer HubSpot en masse : la méthode complète

Par Anthony Abreu · Fondateur d’Inspectable · Certifié HubSpot Revenue Operations & Sales Hub
Mis à jour le

Trente doublons se traitent à la main. Trois cents, non : chaque décision prise une par une, sans règle, finit par se prendre au hasard, et le hasard fusionne mal. Ce guide décrit la méthode qui tient à l'échelle : mesurer, définir une clé, écrire les règles de choix, exécuter, tracer. Il prolonge le guide complet sur les doublons HubSpot, qui présente les trois approches, en détaillant celle qui reste quand les deux autres ont cédé.

Le moment où la méthode change

L'outil natif de HubSpot examine les doublons paire par paire, pour les contacts et les entreprises, et sa page de documentation ne décrit aucune fusion en masse : c'est un outil de revue, pas de chantier. La méthode par export dans Excel tient jusqu'à une cinquantaine de groupes. Au-delà, ce n'est pas seulement le temps qui explose : c'est la cohérence. La fiche gardée lundi selon un critère, jeudi selon un autre, et personne ne sait plus dire pourquoi telle fiche a disparu. Le seuil n'est pas un chiffre magique, c'est le moment où vos décisions cessent d'être reproductibles.

Mesurer avant de toucher

Un chantier de déduplication commence par un chiffre, pas par une fusion. Exportez la base complète avec les colonnes d'identité (email, prénom, nom, entreprise, téléphone), le Record ID, le propriétaire et la date de dernière activité, puis comptez : combien de groupes, de quelle taille, avec quelle part de fiches actives. Ce comptage décide de tout le reste : dix groupes renvoient à la méthode manuelle, trois cents imposent celle-ci, et une majorité de groupes inactifs déplace le sujet du côté de la conservation plutôt que de la fusion.

Le diagnostic d'inspectabilité : cinq indicateurs mesurés séparément, parce qu'un score global ne dit pas par où commencer.
Le diagnostic d'inspectabilité : cinq indicateurs mesurés séparément, parce qu'un score global ne dit pas par où commencer. La mesure vient avant la méthode.

La clé de rapprochement, au-delà de l'email

HubSpot déduplique sur l'email exact ; une déduplication en masse cherche donc précisément ce que l'email exact ne voit pas. La clé de base reste prénom + nom + entreprise, normalisée : minuscules, sans espaces ni accents. On l'affine ensuite : le téléphone normalisé rapproche les fiches aux emails différents, et la partie locale de l'adresse (« j.dupont » contre « jean.dupont » sur le même domaine) attrape les variantes de la même personne.

Plus la clé est large, plus elle attrape, et plus elle se trompe. Deux homonymes dans la même entreprise ont exactement la tête d'un doublon. Une clé large sert à présélectionner des candidats, jamais à décider : la décision revient à une règle, ou à un humain.

Des règles écrites pour choisir la fiche à garder

C'est le cœur de la méthode, et ce qui la distingue d'un bricolage : les critères de choix sont écrits avant de commencer, puis appliqués à tous les groupes dans le même ordre. Par exemple : l'historique d'activité d'abord, la présence d'un propriétaire ensuite, la complétude des champs enfin, et à égalité, l'ancienneté. L'ordre exact importe moins que son existence : des règles écrites transforment trois cents décisions en une seule, prise une fois, et permettent de répondre plus tard à la question « pourquoi celle-ci ? ». Les groupes qu'aucune règle ne tranche sont mis de côté pour arbitrage humain, et c'est un résultat, pas un échec.

Le piège central : un import ne fusionne jamais

Réimporter un fichier « dédoublonné » ne fusionne rien. Un import HubSpot met à jour les fiches qu'il rapproche et crée celles qu'il ne rapproche pas. En aucun cas il ne fusionne deux fiches existantes : les doublons survivent à l'import, intacts.

C'est l'erreur la plus coûteuse du sujet, parce qu'elle ressemble à une solution : on nettoie le fichier dans Excel, on supprime les lignes en trop, on réimporte, et on croit avoir terminé. Dans HubSpot, les fiches « supprimées du fichier » sont toujours là. La fusion est une opération distincte, qui se fait dans HubSpot, groupe par groupe. Le fichier nettoyé n'est pas une commande, c'est une feuille de route : la liste des fusions à exécuter, avec pour chacune la fiche à garder.

Exécuter les fusions, dans l'ordre

L'exécution se prépare comme un import volumineux : automatisations en pause sur les propriétés concernées, sauvegarde par export avant de commencer, et un lot d'essai d'une dizaine de groupes pour vérifier que les règles produisent bien ce qu'on attend. Puis les fusions s'enchaînent, feuille de route sous les yeux, en commençant par les groupes sûrs et en gardant les ambigus pour la fin. Deux mécaniques à connaître avant de cliquer, détaillées dans le guide sur ce qu'une fusion HubSpot conserve : la fiche principale l'emporte sur les valeurs en conflit, et HubSpot refuse de fusionner au-delà de 250 fusions cumulées sur les mêmes fiches.

La trace qui vous protège

Six mois plus tard, quelqu'un demandera où est passée une fiche. La seule bonne réponse est un fichier : groupe par groupe, la fiche conservée, les fiches fusionnées, la règle appliquée, la date. C'est aussi lui qui permet de reprendre le chantier après une interruption sans refaire le tri. Sur la base de démonstration d'Inspectable, entièrement synthétique, ce fichier documente 36 groupes détectés sur 1 400 contacts : 30 fusionnables, documentés fiche par fiche pour validation avant toute action, et 9 groupes entièrement inactifs isolés pour arbitrage plutôt que fusionnés d'office. La méthode entière tient dans cette phrase : aucune fusion sans trace, aucune trace sans règle.

Sources

Chaque page ci-dessous a été ouverte et lue. Ce sont des sources primaires : l’autorité qui édicte la règle, ou l’éditeur du logiciel.

  • Use data quality toolsHubSpot, base de connaissances. L'outil natif examine les doublons paire par paire, contacts et entreprises ; la page ne décrit aucune fusion en masse.
  • Merge recordsHubSpot, base de connaissances. Ce qu'une fusion conserve, son absence d'annulation et la limite des 250 fusions cumulées.

Votre feuille de route, prête à valider

C'est exactement ce que produit l'audit Inspectable : vos groupes de doublons détectés hors ligne à partir d'un simple export, la fiche à garder choisie selon des règles explicites, et chaque décision tracée dans un fichier que vous validez avant d'agir. Le mini-audit gratuit vous donne le chiffre de départ en 24 h.

Obtenir mon mini-audit gratuit

Questions fréquentes

Réimporter un fichier dédoublonné fusionne-t-il les fiches ?

Non, et c'est le piège central du sujet : un import met à jour ou crée, il ne fusionne jamais. Les doublons survivent au réimport, intacts. Le fichier nettoyé sert de feuille de route pour les fusions, qui se font dans HubSpot.

Peut-on automatiser toute la déduplication ?

La détection et le choix de la fiche à garder, oui, avec des règles explicites. La décision sur les groupes ambigus, non : deux homonymes de la même entreprise ressemblent exactement à un doublon. Ces groupes se mettent de côté pour un arbitrage humain.

Qu'est-ce qui prend le plus de temps ?

Pas les fusions : les décisions. Chaque groupe demande de choisir la fiche à garder, et c'est le nombre de décisions qui dimensionne le chantier. D'où l'intérêt de règles écrites, qui en tranchent la grande majorité d'avance.

Faut-il fusionner les doublons inactifs ?

Non. Fusionner deux fiches mortes fabrique une fiche morte propre. Sur la base de démonstration, 9 groupes sur 36 étaient entièrement inactifs : ils relèvent d'une décision de conservation, garder ou supprimer, pas d'une fusion.