Indiquez l'adresse d'un site : l'outil en liste les pages, vous cochez celles qui vous intéressent, et leur texte s'ajoute au fur et à mesure dans un seul bloc. Idéal pour les gros sites, dont l'extraction complète serait trop lourde.
L'outil lit d'abord le sitemap du site. Sans sitemap, il parcourt rapidement les liens de l'accueil. Vous pouvez aussi indiquer directement l'adresse d'un fichier sitemap (.xml). Jusqu'à 2 500 pages.
Recherche du sitemap
L'extraction d'un site complet convient aux sites de quelques dizaines de pages. Au-delà de trois cents pages, le bloc de texte obtenu devient trop volumineux : le navigateur rame, le copier-coller échoue parfois, et la relecture perd tout son sens puisqu'on ne sait plus par où commencer.
Ici, vous gardez la main. L'outil vous montre d'abord la liste des pages, sans rien télécharger d'autre que le sitemap. Vous choisissez ensuite ce qui compte : une rubrique, les articles d'une année, les fiches produits d'une catégorie. Seules ces pages sont lues.
robots.txt du site pour y trouver le sitemap déclaré, puis les adresses habituelles d'un sitemap. Un index de sitemaps est suivi. Si le site n'en a aucun, l'outil parcourt une vingtaine de pages en suivant les liens.blog, 2025, categorie. Le bouton « Tout cocher » ne coche que les pages visibles, ce qui permet de sélectionner une rubrique entière en deux clics.Une page déjà ajoutée est grisée, pour ne pas l'extraire deux fois. Le bouton « Vider » efface le bloc et remet toute la liste à disposition.
Le texte visible de chaque page, débarrassé du code, des scripts et de la mise en forme. Chaque titre et chaque paragraphe occupe sa propre ligne, les éléments de liste commencent par un tiret et les cellules de tableau sont séparées par une barre verticale : les mots ne sont plus collés d'un bloc à l'autre, et le texte reste lisible dans un correcteur orthographique.
Le bloc est modifiable : vous pouvez supprimer les menus répétés, corriger une faute ou ajouter une note avant de tout copier. Les pages ajoutées ensuite s'inscrivent à la suite, sans effacer vos modifications.
Sur un blog de cinq cents articles, filtrez sur une catégorie ou une année, cochez tout, et vous obtenez un bloc de taille raisonnable à passer dans votre correcteur. Recommencez la semaine suivante avec la rubrique suivante.
Rassemblez les fiches d'une même catégorie pour repérer les descriptions recopiées d'une page à l'autre. Le contenu dupliqué interne se voit tout de suite quand les textes sont côte à côte.
Extrayez les pages clés d'un concurrent pour étudier son vocabulaire, la longueur de ses textes et la façon dont il structure ses titres. Les textes restent protégés par le droit d'auteur : les lire est libre, les republier ne l'est pas.
Sans sitemap, l'outil ne parcourt qu'une vingtaine de pages pour rester léger avec le serveur visité. La liste contient alors les liens trouvés sur ces pages. Pour une liste complète, déclarez un sitemap dans votre fichier robots.txt, ou indiquez directement son adresse.
La liste s'arrête à 2 500 pages. L'extraction est limitée à 400 pages par heure et par adresse IP, et à 30 listes de sites par heure, pour que l'outil reste gratuit et disponible pour tout le monde.
Non. Chaque page est téléchargée, son texte vous est renvoyé, et rien n'est enregistré. Le bloc n'existe que dans votre navigateur : si vous fermez l'onglet sans copier, il est perdu.
Si la liste de vos pages est incomplète, c'est souvent que le site n'a pas de sitemap à jour. Unsitemap génère gratuitement le fichier sitemap.xml de votre site en explorant toutes ses pages.