Extracteur de ressources HTML, images et Markdown

Analyse du HTML brut à la recherche de scripts, feuilles de style, images et liens. Inclut les URLs d'images d'arrière-plan en ligne provenant des attributs style et des balises style — extrait aussi le texte visible de la page en Markdown propre, pratique pour lire des articles derrière de simples paywalls côté client.

Chargement de la simulation interactive...

Analyse algorithmique des modèles d'objets de documents 🖖

L’extraction d’actifs incorporés à partir de HTML nécessite un parcours récursif de la structure arborescente du modèle objet de document. En utilisant des expressions régulières précises et un ciblage spécifique aux balises, l'algorithme sépare les URI d'image et les éléments structurels. Il convertit ensuite algorithmiquement les nœuds hiérarchiques en syntaxe Markdown équivalente. Ce processus de réduction systématique transforme efficacement un langage de présentation complexe et imbriqué en une structure mathématique de texte brut rationalisée et logiquement ordonnée.

Les images se cachent au-delà des balises img 🖖

Beaucoup pensent qu'une image web réside toujours dans une balise `<img>`, mais les navigateurs peignent aussi des images à partir de règles CSS `background-image`, de listes responsives `srcset`, de balises `<meta>` d'aperçu et même de tableaux dans du JavaScript. Cet outil ratisse tous ces endroits d'un coup. À retenir : une photo bien visible à l'écran peut n'avoir aucune balise `<img>` — elle est dessinée par une feuille de style, ce qui explique que 'clic droit, enregistrer l'image' échoue parfois.

Un mur payant léger cache un texte déjà envoyé 🖖

Beaucoup de murs 'abonnez-vous pour continuer' sont du pur théâtre. L'article complet est généralement déjà livré dans le HTML de la page et seulement recouvert par une surcouche ou un flou — les mots ont traversé le réseau avant qu'on ne vous demande de payer. Comme cet extracteur lit le texte visible directement dans le balisage analysé et le convertit en Markdown, ce contenu réapparaît intact. Cacher quelque chose avec du CSS n'est pas la même chose que le retenir.

Exemples de problèmes

  • galerie responsive - Page d'accueil avec un bloc JSON-LD schema.org ImageObject et un <img srcset> responsive — illustre l'extraction d'images à partir de données structurées ainsi que la déduplication des variantes de résolution d'une même image.
  • arrière-plans CSS - Page dont les seules images se trouvent dans des déclarations CSS background-image — l'une dans un bloc <style>, l'autre dans un attribut style en ligne — le type de ressource qu'un simple scan d'<img> manquerait.
  • carrousel généré en JS - Carrousel d'images entièrement construit à l'exécution par JavaScript, sans aucune balise <img> dans le markup — montre comment l'extracteur récupère les URL d'images depuis un simple littéral de tableau JS dans un bloc <script>.