Page orpheline : de quoi parle-t-on exactement ?

Une page orpheline, c'est une URL publiée sur votre site vers laquelle aucune autre page du site ne fait de lien. Elle existe, elle répond en 200, parfois elle figure même dans le sitemap. Mais si vous partez de la page d'accueil et cliquez sur tout ce qui est cliquable, vous ne tombez jamais dessus.

Or Googlebot fonctionne exactement comme ça : il découvre les pages en suivant les liens. Le sitemap et les backlinks ne sont que des portes d'entrée secondaires. Une page orpheline peut donc être trouvée, voire indexée, mais elle sera explorée rarement et Google n'a aucun signal interne qui lui dise qu'elle compte. Sur un blog, ça donne ces articles coincés en « Détectée, actuellement non indexée » pendant des mois.

Une nuance que je vois souvent oubliée en audit : une page peut avoir un lien bien visible à l'écran et rester orpheline pour Google. C'est le cas quand le « lien » est un bouton en JavaScript sans balise <a href>, ou qu'il n'apparaît qu'après un clic de l'utilisateur. Google le rappelle dans sa documentation sur les liens explorables : seuls les liens <a> dotés d'un attribut href sont suivis de façon fiable.

Comment un article devient orphelin sans que personne ne le remarque

Personne ne crée une page orpheline exprès. Elles apparaissent par érosion, et les causes se ressemblent d'un site à l'autre :

  • L'article n'était relié que par le widget « articles récents » de la barre latérale. Dix publications plus tard, il en est sorti, et plus rien ne pointe vers lui.
  • Une refonte du menu ou du thème a fait disparaître une rubrique entière, avec tous les liens qu'elle portait.
  • Des pages de campagne (landing pages, concours) n'ont jamais été reliées, volontairement ou par oubli.
  • L'article a été publié sans catégorie, ou dans une catégorie affichée nulle part.

Le premier cas est celui que je croise le plus sur les sites éditoriaux. Si vos articles ne sont reliés qu'à travers des listes chronologiques, vous fabriquez un orphelin potentiel à chaque nouvelle publication.

La méthode de détection : croiser deux listes d'URL

Le principe tient en une phrase : comparer ce qui existe avec ce qui est atteignable par les liens. Tout ce qui existe sans être atteignable est orphelin. Concrètement :

  1. Liste A, tout ce qui existe. Rassemblez toutes les URL connues : le sitemap XML, l'export des articles depuis le CMS, l'export des pages du rapport Performances de la Search Console (sur la période la plus longue disponible) et les pages de destination de votre outil d'analytics.
  2. Liste B, tout ce qui est relié. Lancez un crawler depuis la page d'accueil (Screaming Frog, Sitebulb ou équivalent) en lui demandant de suivre uniquement les liens. Désactivez l'exploration du sitemap pour cette passe, sinon l'outil retrouvera les orphelines par la porte de derrière et le test ne vaudra plus rien.
  3. Normalisez avant de comparer : même protocole, même version avec ou sans www, même gestion du slash final, paramètres de suivi retirés. Sans ça, vous allez « découvrir » des centaines de fausses orphelines qui ne sont que des variantes d'écriture.
  4. Croisez. Dans un tableur, liste A en colonne A, liste B en colonne B, et en C2 : =NB.SI(B:B;A2)=0. Chaque VRAI correspond à une page orpheline.
Schéma dessiné à la main de deux listes d'URL qui se recoupent, avec les pages isolées entourées au crayon vert

Les crawlers du marché savent en général faire ce croisement tout seuls si vous leur fournissez le sitemap et un accès à la Search Console. Le faire une fois à la main reste utile pour comprendre ce qu'ils vous montrent.

Si vous avez accès aux logs du serveur, ajoutez une troisième source : les URL que Googlebot visite et que votre crawl n'a jamais atteintes. Ce sont les orphelines que Google connaît déjà, souvent via un vieux backlink ou un ancien sitemap. C'est un des usages les plus rentables de l'analyse des logs serveur côté SEO.

Avant de relier quoi que ce soit, triez

Toutes les orphelines ne méritent pas d'être sauvées. Sur un site de quelques années, une partie sont des contenus périmés, des doublons ou des brouillons publiés par erreur. Les relier, c'est inviter Google à explorer des pages faibles.

Pour chaque URL, quatre options :

  • Relier : la page est utile, à jour, et répond à une vraie recherche. C'est le cas qui nous intéresse ici.
  • Fusionner : elle traite le même sujet qu'un article plus solide. On récupère ce qui est bon dedans, puis redirection 301 vers l'article principal.
  • Supprimer : contenu dépassé, sans trafic ni backlink. Un 410 ou un 404 propre, et on n'en parle plus.
  • Laisser isolée : page de remerciement, landing page de campagne payante. Elle peut rester hors du maillage, mais alors en noindex.

Pour trancher vite, ajoutez deux colonnes à votre tableur : les clics des douze derniers mois dans la Search Console et les backlinks éventuels. Une orpheline qui reçoit encore des clics malgré son isolement passe en tête de liste.

Faire indexer une page orpheline, dans le bon ordre

Le réflexe classique, c'est d'ouvrir la Search Console et de cliquer sur « Demander une indexation ». C'est la dernière étape, pas la première. Si la page reste isolée, Google peut l'indexer puis la laisser retomber, faute de signal.

  1. Vérifiez les bloqueurs. Passez l'URL dans l'outil d'inspection : pas de noindex, pas de canonical vers une autre page, pas de blocage dans le robots.txt.
  2. Créez deux ou trois liens contextuels, depuis des articles proches par le sujet, déjà indexés et si possible qui reçoivent du trafic. Le lien va dans le corps du texte, avec une ancre qui décrit la page cible.
  3. Rattachez-la à sa rubrique : la page catégorie ou l'article pilier du sujet doit pointer vers elle. Si vous ne savez pas où la ranger, c'est souvent le signe que l'architecture manque de rubriques claires, et relire ce qu'est une structure en silo et comment la construire aide à remettre de l'ordre.
  4. Mettez le sitemap à jour, avec une date lastmod juste. Il ne remplace pas les liens, il accélère la découverte, comme l'explique Google dans sa présentation des sitemaps. Pour les réglages, voyez comment piloter l'exploration de votre site avec robots.txt et sitemap XML.
  5. Demandez l'indexation, mais seulement pour les pages importantes. L'outil d'inspection a un quota quotidien limité, et le mitrailler ne fait rien gagner : une fois les liens en place, Googlebot repasse de lui-même.

Ensuite, patience. Selon l'autorité du site et le rythme auquel Google l'explore, comptez de quelques jours à quelques semaines. Suivez l'état de chaque URL dans le rapport « Indexation des pages ».

Si une page bien reliée reste en « Explorée, actuellement non indexée » plusieurs semaines après, le problème n'est plus la découverte, c'est le contenu. Google l'a vue et a choisi de ne pas la garder. Là, on retravaille la page, on ne lui ajoute pas de liens.

Une routine pour ne plus en fabriquer

Le vrai correctif se joue au moment de publier. À chaque nouvel article, retournez dans deux ou trois anciens articles du même sujet et ajoutez un lien vers le nouveau. C'est ce lien entrant qui l'empêchera de devenir orphelin le jour où il quittera la page d'accueil.

Et refaites le croisement des deux listes une fois par trimestre. Une fois la méthode rodée, c'est l'affaire d'une heure ou deux, et l'effet se lit directement dans la Search Console.