doc-scraper: Gehe Crawlers, die lokalen Dokumentationskontext für LLMs erstellen
doc-scraper, von Sriram PR, sammelt technische Website-Dokumentationen und bereitet sie für KI-unterstützte Arbeitsabläufe vor. Die App durchsucht Dokumentationsseiten und extrahiert lesbare Inhalte, die für die Verwendung als Modellkontext optimiert sind, und richtet sich an Entwickler und KI-Forscher. Sie legt Wert auf saubere, durchsuchbare Ausgaben und einen lokalen Wissensspeicher, damit editorbasierte Assistenten auf relevantes Referenzmaterial zugreifen können, ohne während der Erstellung von Eingabeaufforderungen störende Webseiten zu laden.
Konvertiert HTML von Webseiten in strukturiertes Markdown, das für den Modellkontext geeignet ist
Das Tool ist ein auf Go basierender Crawler, der Dokumentations-HTML in strukturiertes Markdown umwandelt und Navigationsleisten, Fußzeilen und andere nicht-inhaltliche Elemente entfernt. Die Konvertierung bewahrt Überschriften und Inline-Code und reduziert gleichzeitig den textuellen Lärm, wodurch kompakte Korpusdateien entstehen, die den Navigationskontext über saubere Überschriften und Links für eine einfachere Abrufung und Referenz durch nachgelagerte Modell-Workflows beibehalten.
Durchsuchbarkeit und Änderungsdetektion machen das Korpus zuverlässig für Agenten
Die App bettet eine Offline-BM25-Suche ein, die über SQLite FTS5 implementiert ist, und ermöglicht lokale Abfragen gegen das gecrawlte Korpus ohne Internetzugang. Die Zustandspersistenz mit BadgerDB und SQLite unterstützt wiederaufnehmbare Operationen und einen Verlaufsindex. Ein inhaltsbewusster Diff-Mechanismus identifiziert tatsächliche Seitenänderungen, anstatt sich ausschließlich auf Zeitstempel zu verlassen, was redundante Downloads reduziert und das lokale Korpus auf substanziellen Änderungen fokussiert hält.
Eingabemuster und Crawl-Grenzen definieren, wo es erfolgreich ist
doc-scraper erkennt automatisch Dokumentationsframeworks wie Docusaurus, MkDocs, Sphinx, GitBook und ReadTheDocs und verwendet einen lesbarkeitsbasierten Extraktor auf unbekannten Seiten. Das Crawlen erfolgt parallel mit gemeinsamem Ressourcenmanagement und eingebauter Ratenbegrenzung, und der Crawler respektiert robots.txt, um höflich zu bleiben. Diese Grenzen priorisieren das Extrahieren von entwicklerrelevantem Inhalt, während übermäßige Netzwerkbelastung vermieden wird.
Lokales MCP-Hosting passt zu editorzentrierten KI-Workflows und Datenschutzbedürfnissen
Im Servermodus fungiert die App als Model Context Protocol-Server, sodass lokale KI-Agenten Dokumentationen innerhalb von Editoren lesen und durchsuchen können. Das lokale, offline Wissensdatenbankdesign hält durchsuchbare Dokumentationen für Agenten wie Claude Desktop, Claude Code und Cursor verfügbar und reduziert die Abhängigkeit von remote Abrufen. Das Tool ist in Go- und KI-Entwicklergemeinschaften bekannt für die Erzeugung sauberer Ausgaben auf Seiten, mit denen andere Crawler Schwierigkeiten haben.
Am besten geeignet für technisch versierte Entwickler, die lokalen Kontext erstellen und hosten können
doc-scraper ist eine praktische Option für Entwickler und Forscher, die überprüfbare, lokal gehostete Dokumentation als Modellkontext benötigen. Da das Tool aus dem Quellcode mit Go (Version 1.25 oder höher) erstellt werden muss, bevorzugt es technisch fähige Benutzer; Teams, die Go-Projekte nicht kompilieren können, sollten mit Einrichtungsaufwand rechnen. Benutzer sollten die gescrapten Passagen überprüfen, bevor sie diese als autoritative Modellinputs verwenden.





