HTML elementide, piltide ja Markdowni ekstraktor

Analüüsib toorest HTML-i skriptide, laaditabelite, piltide ja linkide leidmiseks. Hõlmab ka style-atribuutidest ja style-siltidest pärit sisseehitatud taustapildi URL-e — samuti eraldab lehe nähtava teksti puhta Markdownina, mis on kasulik artiklite lugemiseks lihtsate kliendipoolsete tasumüüride taga.

Interaktiivse simulatsiooni laadimine...

Algorithmic Parsing of Document Object Models 🖖

Extracting embedded assets from HTML requires recursive traversal of the Document Object Model tree structure. By utilizing precise regular expressions and tag-specific targeting, the algorithm segregates image URIs and structural elements. It then algorithmically converts hierarchical nodes into equivalent Markdown syntax. This systematic reduction process efficiently transforms a complex, nested presentation language into a streamlined, logically ordered plain-text mathematical structure.

Pildid ei peitu ainult img-siltides 🖖

Paljud arvavad, et veebipilt asub alati `<img>`-sildis, kuid brauserid joonistavad pilte ka CSS-i `background-image` reeglitest, responsiivsetest `srcset`-loenditest, `<meta>` eelvaatesiltidest ja isegi JavaScripti massiividest. See tööriist läbib kõik need kohad korraga. Praktiline järeldus: foto, mida sa ekraanil selgelt näed, ei pruugi omada ühtegi `<img>`-silti — selle joonistab stiilileht, mistõttu 'parem klõps, salvesta pilt' vahel ei tööta.

Pehme maksemüür peidab juba saadetud teksti 🖖

Paljud 'telli edasilugemiseks' müürid on puhas teater. Terve artikkel on tavaliselt juba lehe HTML-is olemas ja seda vaid katab ülekate või hägustus — sõnad ületasid võrgu enne, kui sinult tasu küsiti. Kuna see ekstraktor loeb nähtava teksti otse parsitud märgistusest Markdownina, ilmub see sisu puutumatuna taas nähtavale. See tuletab meelde, et millegi peitmine CSS-iga ei ole sama mis selle kinnihoidmine.

Näiteülesanded

  • reageeriv galerii - Sihtleht schema.org ImageObject JSON-LD plokiga ja reageeriva <img srcset>-iga — näitab struktureeritud andmetega piltide eraldamist ning sama pildi eri eraldusvõimega variantide dubleerimise vältimist.
  • CSS-taustad - Leht, mille ainsad pildid asuvad CSS background-image määrangutes — üks <style> plokis, teine sisese style atribuudi sees — selline ressurss jääks lihtsal <img>-skannimisel märkamata.
  • JS-renderdatud slaider - Pildikarusell, mille JavaScript ehitab täielikult käivitusajal, ilma ühegi <img> märgendita HTML-is — näitab, kuidas eraldaja leiab pildi URL-id lihtsast JS-massiivi literaalist <script> plokis.