D'abord, vérifiez que le chiffre est réel

Avant de paniquer, une question : d'où sort ce 20 000 ? Si vous l'avez lu dans le compteur de la commande site:, il ne vaut pas grand-chose, c'est une estimation qui varie d'une heure à l'autre. J'ai déjà détaillé pourquoi la commande site: ne donne pas le même nombre que la Search Console, et le réflexe est simple : la seule source qui compte, c'est le rapport « Indexation des pages » de la Search Console.

Si la Search Console confirme un ordre de grandeur pareil, là, oui, vous avez un vrai sujet. On peut avancer.

D'où sortent ces milliers de pages en trop

Un catalogue de 500 produits ne fabrique pas 20 000 pages tout seul. C'est le CMS qui le fait, en silence, à chaque fois qu'un paramètre change l'adresse d'une page. Les coupables habituels sur une boutique :

  • Les filtres à facettes : couleur, taille, prix, marque. Chaque combinaison crée une URL, et les combinaisons se multiplient très vite. C'est presque toujours le premier contributeur.
  • Le tri et l'affichage : ?orderby=price, ?sort=, nombre de produits par page.
  • Les paramètres techniques : suivi de campagnes (utm_), identifiants de session, liens d'ajout au panier qu'un robot peut suivre.
  • Les tags et étiquettes, sur les produits comme sur le blog, qui recréent des listes quasi identiques aux catégories.
  • La recherche interne, quand ses pages de résultats sont accessibles et liées.
  • Les chemins multiples vers un même produit, par exemple une fiche accessible à la fois sous /products/ et sous /collections/.../products/ sur Shopify.

Sur la plupart des audits e-commerce que je fais, deux ou trois de ces familles expliquent l'essentiel du gonflement. Rarement les six à la fois.

Est-ce vraiment grave ?

Pas de pénalité automatique, soyons clairs. Google n'a pas de compteur qui vous sanctionne au-delà d'un certain nombre de pages. Le problème est plus diffus : Googlebot passe une partie de son temps sur des variantes de listes au lieu de vos nouvelles fiches, les signaux (liens, pertinence) se répartissent sur plusieurs versions d'une même page, et Google évalue aussi la qualité d'un site dans son ensemble. Des milliers de pages creuses n'aident pas ce jugement global.

Et il y a un coût très concret pour vous : un rapport d'indexation noyé sous le bruit, dans lequel vous ne voyez plus les vraies anomalies.

Étape 1 : l'inventaire, sans rien toucher

On ne supprime rien tant qu'on n'a pas classé. Trois sources à croiser :

  1. La Search Console, rapport Pages puis « Pages indexées » : l'export de l'interface n'est qu'un échantillon, mais il suffit pour repérer les motifs d'URL récurrents.
  2. Un crawl complet du site avec un crawler (Screaming Frog, Sitebulb ou équivalent). La version gratuite de Screaming Frog est plafonnée à quelques centaines d'URL, insuffisant ici : prévoyez une licence ou un outil en ligne.
  3. Le rapport Performances sur la période la plus longue disponible (16 mois) : la liste des URL qui ont reçu des clics et des impressions.

Ensuite, regroupez par motif dans un tableur : tout ce qui contient ?color=, tout ce qui commence par /tag/, etc. Vous obtenez une poignée de familles, avec pour chacune le volume d'URL et le trafic réel. Ce tableau-là, c'est votre plan de nettoyage.

Tableur ouvert à l'écran avec des URL regroupées par familles colorées, à côté d'une feuille de notes manuscrites

Étape 2 : un traitement par famille d'URL

Il n'y a pas de solution unique, et c'est là que la plupart des nettoyages ratent : on applique du noindex partout, ou on bloque tout dans le robots.txt, et on casse quelque chose. Chaque famille a son outil.

Famille d'URLTraitement
Tri, paramètres de suivi, chemins multiples vers une ficheCanonical vers la version principale
Facettes sans demande de recherche (ex. couleur + taille + prix)Noindex, puis blocage de l'exploration une fois désindexées
Facettes que les gens cherchent vraiment (ex. « chaussures de trail femme »)À garder : en faire de vraies pages catégorie, indexables, avec un texte propre
Recherche interne, tags en doublon des catégoriesNoindex, ou suppression pure des tags inutiles
Produits retirés définitivement301 vers un produit équivalent ou la catégorie la plus proche, sinon 404/410
Produits en rupture temporaireNe touchez à rien, la page revient

Pour la canonical, gardez en tête qu'il s'agit d'une indication et non d'un ordre : si vos liens internes pointent massivement vers la variante, Google peut ignorer votre choix. Si le mécanisme vous paraît flou, relisez ce qui fait l'utilité réelle d'une balise canonical avant de la déployer sur des milliers d'URL. Google détaille aussi les bonnes pratiques propres aux boutiques dans sa page sur la gestion de l'exploration des navigations à facettes.

Le piège qui fait échouer la moitié des nettoyages

Mettre un noindex sur des pages ET les bloquer dans le robots.txt en même temps. Ça paraît doublement sûr. C'est l'inverse : si Googlebot n'a plus le droit d'explorer la page, il ne lit jamais la balise noindex, et l'URL peut rester dans l'index pendant des mois. Google le dit explicitement dans sa documentation sur la balise noindex.

Le bon ordre : noindex d'abord, vous attendez que les URL sortent de l'index, et seulement ensuite vous fermez l'exploration si vous voulez économiser du crawl. Toute la logique pour trancher entre noindex et robots.txt selon le cas est détaillée dans un article dédié.

Ne pas perdre de trafic : avancer par lots

Reprenez votre tableau. Toute URL qui a reçu des clics sur les derniers mois sort du traitement automatique et passe en revue manuelle. Il arrive qu'une page de facette, que vous pensiez inutile, ramène des visites régulières sur une requête précise : celle-là, on la garde et on la soigne.

Commencez ensuite par la famille la plus évidemment inutile (recherche interne, tri), observez trois ou quatre semaines, puis passez à la suivante. Si quelque chose bouge dans le mauvais sens, vous savez exactement quel lot en est la cause.

Dernier point, et pas le moindre : corrigez la source. Si vos filtres restent des liens explorables partout dans le site, les URL reviendront aussi vite qu'elles sont parties. Selon votre CMS, cela passe par un réglage du module de filtres, des liens en JavaScript ou des attributs sur les liens de facettes.

Un index sain n'a pas de chiffre magique : c'est la somme de ce que vous voulez vraiment voir dans Google, produits, catégories, facettes utiles et contenus éditoriaux. Comptez-les, c'est votre cible. La baisse dans la Search Console sera lente, comptez plusieurs semaines à quelques mois selon la fréquence de passage de Googlebot.