← Kollege Gruenfeld Alle ProjekteAlle Projekte ↗

Text Extractor

Includes 2 visuals Keep scrolling
Text Extractor

Text Extractor ist ein Firefox-Add-on, das den Text einer Seite oder einer ganzen Website als eine einzige, strukturierte Markdown-Datei speichert.

Im Website-Modus crawlt das Add-on Seite für Seite, mit Grenzen für Seitenzahl und Linktiefe, wahlweise nur diese Domain, inklusive Subdomains oder nur den aktuellen Ordner. Es respektiert auf Wunsch robots.txt, liest sitemap.xml mit ein und nutzt die Cookies des Browsers, sodass auch Seiten hinter einem Login mitkommen. Für Single-Page-Apps gibt es einen Render-Modus, der die Seiten in einem minimierten Fenster tatsächlich ausführt.

Der eigentliche Aufwand steckt in der Aufbereitung: Menüs, Header, Footer, Cookie-Banner und versteckte Elemente fliegen raus. Überschriften, Listen, Tabellen und Code bleiben erhalten. Text, der auf fast jeder Seite wiederkehrt, wird nur einmal am Ende aufgeführt, Duplikate mit Tracking-Parametern oder gleichem Canonical werden übersprungen. Heraus kommt eine Datei mit Frontmatter, Inhaltsverzeichnis nach Seitenstruktur und Crawl-Report.

Die Screenshots zeigen das Popup mit nachgestellten Beispieldaten.

Text Extractor — Visual 1
Text Extractor — Visual 2
Next project
Tour De Tonka →