Trente doublons se traitent à la main. Trois cents, non : chaque décision prise une par une, sans règle, finit par se prendre au hasard, et le hasard fusionne mal. Ce guide décrit la méthode qui tient à l'échelle : mesurer, définir une clé, écrire les règles de choix, exécuter, tracer. Il prolonge le guide complet sur les doublons HubSpot, qui présente les trois approches, en détaillant celle qui reste quand les deux autres ont cédé.
Le moment où la méthode change
L'outil natif de HubSpot examine les doublons paire par paire, pour les contacts et les entreprises, et sa page de documentation ne décrit aucune fusion en masse : c'est un outil de revue, pas de chantier. La méthode par export dans Excel tient jusqu'à une cinquantaine de groupes. Au-delà, ce n'est pas seulement le temps qui explose : c'est la cohérence. La fiche gardée lundi selon un critère, jeudi selon un autre, et personne ne sait plus dire pourquoi telle fiche a disparu. Le seuil n'est pas un chiffre magique, c'est le moment où vos décisions cessent d'être reproductibles.
Mesurer avant de toucher
Un chantier de déduplication commence par un chiffre, pas par une fusion. Exportez la base complète avec les colonnes d'identité (email, prénom, nom, entreprise, téléphone), le Record ID, le propriétaire et la date de dernière activité, puis comptez : combien de groupes, de quelle taille, avec quelle part de fiches actives. Ce comptage décide de tout le reste : dix groupes renvoient à la méthode manuelle, trois cents imposent celle-ci, et une majorité de groupes inactifs déplace le sujet du côté de la conservation plutôt que de la fusion.
La clé de rapprochement, au-delà de l'email
HubSpot déduplique sur l'email exact ; une déduplication en masse cherche donc précisément ce que l'email exact ne voit pas. La clé de base reste prénom + nom + entreprise, normalisée : minuscules, sans espaces ni accents. On l'affine ensuite : le téléphone normalisé rapproche les fiches aux emails différents, et la partie locale de l'adresse (« j.dupont » contre « jean.dupont » sur le même domaine) attrape les variantes de la même personne.
Des règles écrites pour choisir la fiche à garder
C'est le cœur de la méthode, et ce qui la distingue d'un bricolage : les critères de choix sont écrits avant de commencer, puis appliqués à tous les groupes dans le même ordre. Par exemple : l'historique d'activité d'abord, la présence d'un propriétaire ensuite, la complétude des champs enfin, et à égalité, l'ancienneté. L'ordre exact importe moins que son existence : des règles écrites transforment trois cents décisions en une seule, prise une fois, et permettent de répondre plus tard à la question « pourquoi celle-ci ? ». Les groupes qu'aucune règle ne tranche sont mis de côté pour arbitrage humain, et c'est un résultat, pas un échec.
Le piège central : un import ne fusionne jamais
C'est l'erreur la plus coûteuse du sujet, parce qu'elle ressemble à une solution : on nettoie le fichier dans Excel, on supprime les lignes en trop, on réimporte, et on croit avoir terminé. Dans HubSpot, les fiches « supprimées du fichier » sont toujours là. La fusion est une opération distincte, qui se fait dans HubSpot, groupe par groupe. Le fichier nettoyé n'est pas une commande, c'est une feuille de route : la liste des fusions à exécuter, avec pour chacune la fiche à garder.
Exécuter les fusions, dans l'ordre
L'exécution se prépare comme un import volumineux : automatisations en pause sur les propriétés concernées, sauvegarde par export avant de commencer, et un lot d'essai d'une dizaine de groupes pour vérifier que les règles produisent bien ce qu'on attend. Puis les fusions s'enchaînent, feuille de route sous les yeux, en commençant par les groupes sûrs et en gardant les ambigus pour la fin. Deux mécaniques à connaître avant de cliquer, détaillées dans le guide sur ce qu'une fusion HubSpot conserve : la fiche principale l'emporte sur les valeurs en conflit, et HubSpot refuse de fusionner au-delà de 250 fusions cumulées sur les mêmes fiches.
La trace qui vous protège
Six mois plus tard, quelqu'un demandera où est passée une fiche. La seule bonne réponse est un fichier : groupe par groupe, la fiche conservée, les fiches fusionnées, la règle appliquée, la date. C'est aussi lui qui permet de reprendre le chantier après une interruption sans refaire le tri. Sur la base de démonstration d'Inspectable, entièrement synthétique, ce fichier documente 36 groupes détectés sur 1 400 contacts : 30 fusionnables, documentés fiche par fiche pour validation avant toute action, et 9 groupes entièrement inactifs isolés pour arbitrage plutôt que fusionnés d'office. La méthode entière tient dans cette phrase : aucune fusion sans trace, aucune trace sans règle.
Sources
Chaque page ci-dessous a été ouverte et lue. Ce sont des sources primaires : l’autorité qui édicte la règle, ou l’éditeur du logiciel.
- Use data quality toolsHubSpot, base de connaissances. L'outil natif examine les doublons paire par paire, contacts et entreprises ; la page ne décrit aucune fusion en masse.
- Merge recordsHubSpot, base de connaissances. Ce qu'une fusion conserve, son absence d'annulation et la limite des 250 fusions cumulées.
Votre feuille de route, prête à valider
C'est exactement ce que produit l'audit Inspectable : vos groupes de doublons détectés hors ligne à partir d'un simple export, la fiche à garder choisie selon des règles explicites, et chaque décision tracée dans un fichier que vous validez avant d'agir. Le mini-audit gratuit vous donne le chiffre de départ en 24 h.
Obtenir mon mini-audit gratuit