Excel trouver les doublons et garder la bonne ligne : la méthode sûre

Un fichier client avec des lignes en double, une extraction CRM où le même contact apparaît trois fois avec des dates différentes : le vrai problème n’est pas de repérer les doublons. Le vrai problème, c’est de garder la bonne ligne et supprimer les autres. Le bouton « Supprimer les doublons » du ruban Excel fait le ménage, mais il ne vous laisse pas choisir quelle occurrence conserver. Voici une méthode fiable pour maîtriser ce choix.

Pourquoi le bouton Supprimer les doublons d’Excel ne suffit pas

Vous avez probablement déjà utilisé l’onglet Données > Supprimer les doublons. Le résultat tombe en une seconde : Excel garde la première occurrence qu’il trouve et efface les suivantes. Mais « première » se réfère à l’ordre actuel des lignes dans la feuille, pas à une logique métier.

Si votre tableau contient un même identifiant client avec plusieurs dates de commande, Excel conservera la ligne qui se trouve en haut. Pas forcément la plus récente, ni la plus complète.

L’autre limite : la suppression est définitive. Aucun historique, aucune possibilité de revenir en arrière une fois le fichier enregistré. Pour un nettoyage ponctuel sur un petit tableau, cela peut convenir. Pour un fichier de données mis à jour régulièrement, c’est un risque.

Trier avant de dédoublonner : la clé pour garder la bonne ligne dans Excel

L’astuce que la plupart des tutoriels survolent tient en deux étapes simples. Avant de lancer la moindre suppression, il faut trier le tableau selon le critère qui définit « la bonne ligne ».

Prenons un exemple concret. Vous avez un export de commandes avec trois colonnes : ID client, date de commande, montant. Un même client apparaît sur plusieurs lignes. Vous voulez garder uniquement sa commande la plus récente.

Les étapes du tri préalable

  • Triez votre tableau par ID client (croissant), puis par date de commande (décroissant). Ainsi, pour chaque client, la ligne la plus récente se retrouve en premier.
  • Allez dans Données > Supprimer les doublons, puis cochez uniquement la colonne ID client.
  • Excel conserve la première occurrence de chaque ID, qui est désormais la commande la plus récente grâce au tri.

Ce tri préalable transforme un outil basique en outil fiable. L’ordre de tri détermine la ligne qu’Excel conserve.

Homme analysant des doublons dans une feuille Excel sur un grand écran dans un bureau à domicile

Power Query : garder la bonne ligne de façon répétable

Le tri + suppression fonctionne pour un nettoyage ponctuel. Mais si vous recevez un fichier mis à jour chaque semaine ou chaque mois, il faut recommencer à chaque fois. C’est là que Power Query change la donne.

Power Query est intégré à Excel (onglet Données > Obtenir et transformer). Il permet de créer une requête de nettoyage qui se relance en un clic à chaque nouvelle extraction.

Group By dans Power Query pour choisir la ligne conservée

La fonction Group By (Regrouper par) permet de regrouper les lignes par identifiant, puis de ne garder que la première ou la dernière ligne de chaque groupe. Vous choisissez explicitement « Keep first row » ou « Keep last row ».

En pratique, voici le flux :

  • Chargez votre tableau dans Power Query via Données > À partir d’un tableau.
  • Triez par date décroissante (pour placer la ligne la plus récente en haut de chaque groupe).
  • Utilisez Regrouper par sur la colonne identifiant, avec l’opération « Première ligne » pour conserver l’enregistrement le plus récent.
  • Chargez le résultat dans une nouvelle feuille. Votre fichier source reste intact.

Ce workflow est non-destructif et traçable. La requête est sauvegardée dans le fichier. Quand vous collez un nouvel export dans la feuille source, un simple « Actualiser » relance le nettoyage avec la même logique.

Figer l’ordre avec Table.Buffer

Un point technique à connaître : dans Power Query, l’ordre des lignes n’est pas toujours garanti après certaines transformations. Si vous triez par date puis appliquez Table.Distinct (suppression des doublons), l’ordre peut être modifié en coulisses.

Pour éviter ce piège, certains praticiens recommandent d’insérer la fonction Table.Buffer() dans le code M juste après le tri. Cette fonction fige l’ordre des lignes en mémoire avant l’étape de déduplication. Vous avez ainsi la certitude que la première ligne conservée est bien celle que vous avez placée en tête via le tri.

Vérifier le résultat : NB.SI avant et après suppression

Quel que soit l’outil choisi, une vérification s’impose. Avant la suppression, comptez les doublons avec la formule NB.SI.

Par exemple, dans une colonne temporaire, saisissez =NB.SI($A:$A,A2) pour compter combien de fois chaque identifiant apparaît. Toute valeur supérieure à 1 signale un doublon.

Après le nettoyage, relancez le même contrôle. Chaque cellule doit renvoyer 1. Si ce n’est pas le cas, certains doublons ont survécu, souvent à cause d’espaces invisibles en fin de cellule ou de formats de date incohérents.

Espaces invisibles et formats piégeux

Un doublon « invisible » est un classique. Deux cellules semblent identiques à l’oeil, mais l’une contient un espace en fin de chaîne. Excel les considère comme différentes.

La fonction SUPPRESPACE (TRIM en anglais) élimine ces espaces parasites. Pour les dates, vérifiez que toutes les cellules sont bien au format date et non au format texte. Un « 15/06/2024 » stocké comme texte ne sera jamais reconnu comme doublon d’un 15/06/2024 stocké comme date.

Vue aérienne d'un écran d'ordinateur portable affichant un tableau Excel avec des doublons surlignés sur un bureau en bois

Méthode sûre pour Excel : choisir entre ponctuel et récurrent

Le choix de la bonne approche dépend de la fréquence du nettoyage. Pour un fichier unique que vous traitez une fois, le tri suivi du bouton Supprimer les doublons fait le travail en moins d’une minute. Pensez simplement à dupliquer votre feuille avant toute suppression pour conserver une copie de sécurité.

Pour des extractions régulières (hebdomadaires, mensuelles), Power Query est le standard à privilégier. La requête se documente elle-même dans l’éditeur, et vous pouvez ajouter un commentaire dans le code M pour expliquer pourquoi vous gardez la première ligne plutôt que la dernière.

Dans les deux cas, la logique reste la même : trier d’abord selon le critère métier, dédoublonner ensuite. C’est cette séquence qui transforme un nettoyage approximatif en méthode fiable.

Articles populaires