Web-Parser — Benutzerhandbuch | YoBench
So verwenden Sie das Modul „Web-Parser" in YoBench: Website-Crawler, KI-Seitenverarbeitung, Export in JSON/CSV, Pause/Fortsetzen, Proxy und Rate Limit.
Was das Modul „Web-Parser" leistet
Das Modul durchsucht eine Website automatisch entlang interner Links, extrahiert den Text jeder Seite und schickt ihn (optional) an den von Ihnen gewählten KI-Anbieter mit Ihrem Prompt — und verwandelt HTML in strukturierte Daten. Ausgabe: JSON oder CSV, bereit zur Weiterverarbeitung. Geeignet für einmalige Extraktionen und für große Parser-Läufe mit komplexer Logik.
Was Sie bekommen:
- Crawler mit Auto-Discovery — geben Sie eine Start-URL und ein Seitenlimit an, das Modul folgt internen Links selbstständig.
- KI-Seitenverarbeitung — jede Seite wird mit Ihrem Prompt und Datenschema ans LLM geschickt; das Ergebnis wird separat gespeichert.
- JSON/CSV-Export — über die Schaltfläche Herunterladen im Bericht.
- Spider-Trap-Erkennung — eingebauter Detektor für zyklische URLs und Tiefenlimit (15 Segmente).
- Proxy und Auth — jedes Template kann einen Proxy und ein Auth-Profil (Header, Cookies) nutzen.
- Pause und Fortsetzen — Job kann gestoppt und später ohne Fortschrittsverlust fortgesetzt werden.
- Geschwindigkeitssteuerung — Anfragen pro Sekunde pro Template.
- Lokale Speicherung — alle Seiten und Ergebnisse bleiben in der YoBench-Datenbank.
- Endlos-Scroll in der Seitenliste — große Crawls (Hunderte Seiten) werden bei Bedarf nachgeladen, statt über Seiten zu blättern.
Template-Parameter
Ein Template ist ein wiederverwendbares Parameter-Bündel. Sie geben an:
- Start-URL — Einstiegspunkt.
- Max. Seiten —
max_pages. Standard 100. Begrenzt die Gesamtgröße des Jobs. - Rate (req/s) —
rate_limit. Standard 2. Drosselt die Anfragerate. - KI aktiviert —
ai_enabled-Flag. Wenn aus, speichert das Modul nur den Seitentext ohne KI-Verarbeitung. - KI-Anbieter — welcher Anbieter aus der AI Chat-Registrierung verwendet wird.
- LLM-Prompt — Anweisung, wie Daten aus der Seite zu extrahieren sind.
- Datenschema — ein JSON-Gerüst, das das LLM ausfüllen soll (
data_template). - Ausgabeformat —
none/json/csv. - Proxy (optional) — Verkehr über ein Proxy-Profil leiten.
- Auth-Profil (optional) — Header, Cookies, Query-Parameter für die Authentifizierung.
Technische Einschränkungen (im UI nicht änderbar):
- Anfragen verwenden die fetch-API (kein Headless-Browser, kein JavaScript-Rendering). JS-only-Seiten lassen sich schlecht parsen — nutzen Sie dafür Site Audit mit Chromium.
- User-Agent ist fest:
Mozilla/5.0 ... Chrome/120. - Request-Timeout beträgt 30 Sekunden pro Seite.
- robots.txt wird nicht beachtet — gehen Sie freundlich mit Sites um und nutzen Sie das Rate-Limit.
Globale Einstellungen
Das Modul hat keine eigenen Einträge im zentralen Einstellungen-Bereich — alles wird auf Template-Ebene konfiguriert.
Aktionen
Auf einem Job:
- Starten — startet einen Job aus dem Template: eine Seitenwarteschlange wird erstellt, der Parser läuft.
- Pause — speichert den aktuellen Zustand der Warteschlange und LLM-Verarbeitung.
- Fortsetzen — startet ab dem Pausepunkt.
- Stoppen — bricht den Job ab und leert die Warteschlange.
- JSON / CSV herunterladen — exportiert strukturierte Daten aller verarbeiteten Seiten.
Auf einer Seite:
- Originaltext, LLM-Antwort und das resultierende JSON ansehen.
Status
Job: queued → running → paused | completed | stopped | error.
Seite: crawled → processing → processed | error.
Ablauf
1. Template anlegen
- Öffnen Sie das Modul Web-Parser im linken Menü.
- Auf dem Tab Parse-Templates klicken Sie Template erstellen.
- Tragen Sie Start-URL, Seitenlimit und Rate ein.
- Schalten Sie KI ein, wählen Sie einen Anbieter, schreiben Sie den Prompt und das Datenschema.
- Wählen Sie das Ausgabeformat (JSON / CSV) oder
nonefür reinen Text. - Optional Proxy und Auth-Profil wählen.
- Speichern.
2. Job starten
- Neben dem Template klicken Sie Starten. Ein neuer Job mit Status
runningerscheint. - Der Tab Berichte zeigt den Fortschritt: gecrawlte / verarbeitete / fehlgeschlagene Seiten.
- Bei Bedarf Pause — der Job wird in der DB gespeichert und übersteht einen App-Neustart.
- Zum Fortsetzen — Fortsetzen.
3. Ergebnisse herunterladen
Bei einem completed-Job klicken Sie JSON herunterladen oder CSV herunterladen. Die Datei enthält structured_data jeder verarbeiteten Seite.
4. Auswerten
- Eine bestimmte Seite im Bericht öffnen — Sie sehen Originaltext, LLM-Antwort und das resultierende JSON.
- Das JSON in andere Module (z. B. Context Manager) oder externe Skripte einspeisen.
Nächste Schritte
- Verbinden Sie KI-Anbieter — ohne sie funktioniert die KI-Verarbeitung nicht (das Modul kann nur Text speichern).
- Für Seiten, die JS-Rendering brauchen, nutzen Sie Site Audit auf Chromium.
- Für laufende Verfügbarkeitsprüfungen läuft Health Check parallel.
Hilfe und Feedback
Wünschen Sie einen Headless-Browser, robots.txt-Unterstützung oder einen Scheduler? Schreiben Sie uns über das Feedback-Formular.