Cet outil explore le site pour extraire tout le texte visible présent sur toutes les pages. Vous pouvez récupérer tout le texte en un clic et de cette manière corriger l'orthographe et la grammaire dans le bloc ou avec un logiciel adapté. De plus, l'outil permet aussi de lire tout le contenu d'un site internet sans avoir à passer de page en page.
Analyse en cours... (0%)
Pages scannées : 0 / Total en file d'attente : 0
Relire son site page par page dans le navigateur est un exercice où l'on ne voit plus rien au bout de dix minutes. La mise en page, les images et les menus captent l'attention, et l'œil glisse sur les fautes. Extraire le texte brut casse cette habitude : vous vous retrouvez avec le contenu seul, sans décor, dans un format que vous pouvez coller n'importe où.
L'outil explore votre site en suivant les liens internes, retire le code, les scripts et les feuilles de style, puis restitue pour chaque page le texte réellement visible par un visiteur, c'est-à-dire aussi celui que lit le moteur de recherche.
C'est l'usage principal. Vous collez le texte extrait dans votre traitement de texte ou dans un correcteur en ligne, et vous traitez l'ensemble du site en une seule passe au lieu d'ouvrir quarante pages. Les fautes anciennes, celles qui traînent depuis la mise en ligne et que plus personne ne remarque, ressortent immédiatement.
L'outil indique le nombre de caractères de texte visible trouvés sur chaque page. C'est un indicateur très utile pour repérer vos pages creuses : celles où le contenu tient en trois phrases noyées dans un gabarit. Ces pages ont peu de chances de se positionner, et sur un site entier elles pèsent sur la perception de qualité : c'est exactement ce que les programmes publicitaires appellent du contenu à faible valeur.
En comparant les textes extraits, vous voyez apparaître les passages recopiés d'une page à l'autre. Un paragraphe de présentation identique sur toutes les fiches produits, ou une même description reprise sur trois pages de services : le moteur devra choisir laquelle afficher, et ce n'est pas forcément celle que vous auriez choisie.
Si le texte extrait d'une page est vide ou anormalement court, c'est un signal important. Cela signifie généralement que le contenu est injecté par JavaScript après le chargement. Les moteurs savent souvent traiter ce cas, mais pas toujours, et jamais aussi bien que du texte présent directement dans le code source.
Avant de changer de CMS ou de thème, une extraction complète vous donne une sauvegarde lisible de tous vos textes. C'est une précaution simple qui évite de découvrir après coup qu'une page a disparu dans la migration.
Pour chaque page, l'outil affiche l'adresse, le texte extrait et le nombre de caractères trouvés. Trois cas méritent votre attention.
Un ordre de grandeur utile : sur un site classique, le menu et le pied de page représentent souvent 300 à 600 caractères identiques sur chaque page. Retranchez-les mentalement du total pour estimer le contenu réel de chaque page.
Non. L'outil lit le code HTML, il ne fait pas de reconnaissance de caractères. Un texte incrusté dans une image ne sera pas récupéré, et c'est précisément pour cette raison qu'il ne faut pas mettre de contenu important dans une image : le moteur de recherche ne le lit pas davantage.
Parce qu'il se trouve réellement dans le code de chaque page. L'outil restitue ce qu'il trouve, sans tenter de deviner quelle partie relève du gabarit. C'est d'ailleurs représentatif de ce que voit le moteur de recherche.
Non, et c'est volontaire. Les espaces multiples et les retours à la ligne sont normalisés pour obtenir un texte continu, plus facile à coller dans un correcteur. Si vous avez besoin de la mise en forme, travaillez directement depuis votre site.
Techniquement oui, puisque l'outil ne lit que des pages publiques. Mais les textes d'un site sont protégés par le droit d'auteur : les consulter est libre, les republier ne l'est pas. L'outil est conçu pour auditer vos propres sites.
L'exploration s'arrête à 2 000 pages et peut être interrompue à tout moment. L'usage est limité à 30 analyses par 24 heures et par adresse IP, afin de garder l'outil disponible pour tout le monde.
Une fois vos textes relus, changez de lecture. Lireunlivre rassemble des ouvrages du domaine public à lire directement dans le navigateur, sans compte ni téléchargement.