Herunterladen

Web-Parser — Benutzerhandbuch | YoBench

So verwenden Sie das Modul „Web-Parser" in YoBench: Website-Crawler, KI-Seitenverarbeitung, Export in JSON/CSV, Pause/Fortsetzen, Proxy und Rate Limit.

Was das Modul „Web-Parser" leistet

Das Modul durchsucht eine Website automatisch entlang interner Links, extrahiert den Text jeder Seite und schickt ihn (optional) an den von Ihnen gewählten KI-Anbieter mit Ihrem Prompt — und verwandelt HTML in strukturierte Daten. Ausgabe: JSON oder CSV, bereit zur Weiterverarbeitung. Geeignet für einmalige Extraktionen und für große Parser-Läufe mit komplexer Logik.

Was Sie bekommen:

  • Crawler mit Auto-Discovery — geben Sie eine Start-URL und ein Seitenlimit an, das Modul folgt internen Links selbstständig.
  • KI-Seitenverarbeitung — jede Seite wird mit Ihrem Prompt und Datenschema ans LLM geschickt; das Ergebnis wird separat gespeichert.
  • JSON/CSV-Export — über die Schaltfläche Herunterladen im Bericht.
  • Spider-Trap-Erkennung — eingebauter Detektor für zyklische URLs und Tiefenlimit (15 Segmente).
  • Proxy und Auth — jedes Template kann einen Proxy und ein Auth-Profil (Header, Cookies) nutzen.
  • Pause und Fortsetzen — Job kann gestoppt und später ohne Fortschrittsverlust fortgesetzt werden.
  • Geschwindigkeitssteuerung — Anfragen pro Sekunde pro Template.
  • Lokale Speicherung — alle Seiten und Ergebnisse bleiben in der YoBench-Datenbank.
  • Endlos-Scroll in der Seitenliste — große Crawls (Hunderte Seiten) werden bei Bedarf nachgeladen, statt über Seiten zu blättern.

Template-Parameter

Ein Template ist ein wiederverwendbares Parameter-Bündel. Sie geben an:

  • Start-URL — Einstiegspunkt.
  • Max. Seitenmax_pages. Standard 100. Begrenzt die Gesamtgröße des Jobs.
  • Rate (req/s)rate_limit. Standard 2. Drosselt die Anfragerate.
  • KI aktiviertai_enabled-Flag. Wenn aus, speichert das Modul nur den Seitentext ohne KI-Verarbeitung.
  • KI-Anbieter — welcher Anbieter aus der AI Chat-Registrierung verwendet wird.
  • LLM-Prompt — Anweisung, wie Daten aus der Seite zu extrahieren sind.
  • Datenschema — ein JSON-Gerüst, das das LLM ausfüllen soll (data_template).
  • Ausgabeformatnone / json / csv.
  • Proxy (optional) — Verkehr über ein Proxy-Profil leiten.
  • Auth-Profil (optional) — Header, Cookies, Query-Parameter für die Authentifizierung.

Technische Einschränkungen (im UI nicht änderbar):

  • Anfragen verwenden die fetch-API (kein Headless-Browser, kein JavaScript-Rendering). JS-only-Seiten lassen sich schlecht parsen — nutzen Sie dafür Site Audit mit Chromium.
  • User-Agent ist fest: Mozilla/5.0 ... Chrome/120.
  • Request-Timeout beträgt 30 Sekunden pro Seite.
  • robots.txt wird nicht beachtet — gehen Sie freundlich mit Sites um und nutzen Sie das Rate-Limit.

Globale Einstellungen

Das Modul hat keine eigenen Einträge im zentralen Einstellungen-Bereich — alles wird auf Template-Ebene konfiguriert.

Aktionen

Auf einem Job:

  • Starten — startet einen Job aus dem Template: eine Seitenwarteschlange wird erstellt, der Parser läuft.
  • Pause — speichert den aktuellen Zustand der Warteschlange und LLM-Verarbeitung.
  • Fortsetzen — startet ab dem Pausepunkt.
  • Stoppen — bricht den Job ab und leert die Warteschlange.
  • JSON / CSV herunterladen — exportiert strukturierte Daten aller verarbeiteten Seiten.

Auf einer Seite:

  • Originaltext, LLM-Antwort und das resultierende JSON ansehen.

Status

Job: queuedrunningpaused | completed | stopped | error.

Seite: crawledprocessingprocessed | error.

Ablauf

1. Template anlegen

  1. Öffnen Sie das Modul Web-Parser im linken Menü.
  2. Auf dem Tab Parse-Templates klicken Sie Template erstellen.
  3. Tragen Sie Start-URL, Seitenlimit und Rate ein.
  4. Schalten Sie KI ein, wählen Sie einen Anbieter, schreiben Sie den Prompt und das Datenschema.
  5. Wählen Sie das Ausgabeformat (JSON / CSV) oder none für reinen Text.
  6. Optional Proxy und Auth-Profil wählen.
  7. Speichern.

2. Job starten

  1. Neben dem Template klicken Sie Starten. Ein neuer Job mit Status running erscheint.
  2. Der Tab Berichte zeigt den Fortschritt: gecrawlte / verarbeitete / fehlgeschlagene Seiten.
  3. Bei Bedarf Pause — der Job wird in der DB gespeichert und übersteht einen App-Neustart.
  4. Zum Fortsetzen — Fortsetzen.

3. Ergebnisse herunterladen

Bei einem completed-Job klicken Sie JSON herunterladen oder CSV herunterladen. Die Datei enthält structured_data jeder verarbeiteten Seite.

4. Auswerten

  • Eine bestimmte Seite im Bericht öffnen — Sie sehen Originaltext, LLM-Antwort und das resultierende JSON.
  • Das JSON in andere Module (z. B. Context Manager) oder externe Skripte einspeisen.

Nächste Schritte

  • Verbinden Sie KI-Anbieter — ohne sie funktioniert die KI-Verarbeitung nicht (das Modul kann nur Text speichern).
  • Für Seiten, die JS-Rendering brauchen, nutzen Sie Site Audit auf Chromium.
  • Für laufende Verfügbarkeitsprüfungen läuft Health Check parallel.

Hilfe und Feedback

Wünschen Sie einen Headless-Browser, robots.txt-Unterstützung oder einen Scheduler? Schreiben Sie uns über das Feedback-Formular.