Télécharger

Web Parser — Guide utilisateur | YoBench

Comment utiliser le module « Web Parser » dans YoBench : crawler de sites, traitement IA des pages, export JSON/CSV, pause/reprise, proxy et rate limit.

À quoi sert le module « Web Parser »

Le module parcourt automatiquement un site en suivant ses liens internes, extrait le texte de chaque page et (optionnellement) le passe au fournisseur IA choisi avec votre prompt — transformant le HTML en données structurées. La sortie est en JSON ou CSV, prête à être réutilisée. Utile pour les extractions ponctuelles et pour les gros parsings avec une logique d'extraction complexe.

Ce que vous obtenez :

  • Crawler avec auto-découverte — vous fixez une URL de départ et une limite de pages, le module suit les liens internes lui-même.
  • Traitement IA des pages — chaque page est envoyée au LLM avec votre prompt et un modèle de données ; le résultat est sauvegardé séparément.
  • Export JSON/CSV — via le bouton Télécharger dans le rapport.
  • Détection de spider-trap — détecteur intégré des URLs cycliques et limite de profondeur (15 segments).
  • Proxy et auth — chaque modèle peut utiliser un proxy choisi et un profil d'authentification (en-têtes, cookies).
  • Pause et reprise — un job peut être arrêté et repris plus tard sans perte d'avancement.
  • Contrôle de débit — limite de requêtes par seconde par modèle.
  • Stockage local — toutes les pages et résultats restent dans la base YoBench.
  • Défilement infini sur la liste de pages — les crawls importants (centaines de pages) chargent à la demande, sans pagination.

Paramètres du modèle

Un modèle est un ensemble réutilisable de paramètres. Vous spécifiez :

  • URL de départ — point d'entrée.
  • Pages max.max_pages. Par défaut 100. Borne la taille totale du job.
  • Débit (req/s)rate_limit. Par défaut 2. Bride le débit des requêtes.
  • IA activée — drapeau ai_enabled. Si désactivé, le module ne sauvegarde que le texte sans traitement IA.
  • Fournisseur IA — quel fournisseur du registre AI Chat utiliser.
  • Prompt LLM — instructions pour extraire les données de la page.
  • Modèle de données — squelette JSON que le LLM doit remplir (data_template).
  • Format de sortienone / json / csv.
  • Proxy (optionnel) — fait passer le trafic par un profil proxy.
  • Profil d'authentification (optionnel) — en-têtes, cookies, paramètres de requête pour s'authentifier.

Limites techniques (non exposées dans l'UI) :

  • Les requêtes utilisent l'API fetch (pas de navigateur headless, pas de rendu JavaScript). Les sites JS-only se parsent mal — utilisez Site Audit avec Chromium pour ceux-là.
  • User-Agent est fixe : Mozilla/5.0 ... Chrome/120.
  • Délai d'attente de 30 secondes par page.
  • robots.txt n'est pas respecté — soyez courtois avec les sites et utilisez le rate limit.

Réglages globaux

Le module n'a pas d'entrées dédiées dans la section centrale Réglages — tout se configure au niveau du modèle.

Actions

Sur un job :

  • Démarrer — lance un job depuis le modèle : une file de pages est créée, le parseur démarre.
  • Pause — sauvegarde l'état courant de la file et du traitement LLM.
  • Reprendre — reprend au point de pause.
  • Arrêter — annule le job et vide la file.
  • Télécharger JSON / CSV — exporte les données structurées de toutes les pages traitées.

Sur une page :

  • Voir le texte original, la réponse du LLM et le JSON résultant.

États

Job : queuedrunningpaused | completed | stopped | error.

Page : crawledprocessingprocessed | error.

Flux d'utilisation

1. Créez un modèle

  1. Ouvrez le module Web Parser depuis le menu de gauche.
  2. Sur l'onglet Modèles de parsing, cliquez sur Créer un modèle.
  3. Renseignez l'URL de départ, la limite de pages, le débit.
  4. Activez IA, choisissez un fournisseur, écrivez le prompt et le modèle de données.
  5. Choisissez le format de sortie (JSON / CSV) ou none pour du texte brut.
  6. Optionnellement, choisissez un proxy et un profil d'auth.
  7. Enregistrez.

2. Démarrez un job

  1. À côté du modèle, cliquez sur Démarrer. Un nouveau job en running apparaît.
  2. L'onglet Rapports montre la progression : pages crawlées / traitées / échouées.
  3. Au besoin, cliquez sur Pause — le job est persisté en base et survit à un redémarrage de l'app.
  4. Pour continuer, cliquez sur Reprendre.

3. Téléchargez les résultats

Pour un job completed, cliquez sur Télécharger JSON ou Télécharger CSV. Le fichier contient structured_data pour chaque page traitée.

4. Inspectez

  • Ouvrez une page spécifique dans le rapport — vous voyez le texte original, la réponse du LLM et le JSON résultant.
  • Réinjectez le JSON dans d'autres modules (par exemple, importez-le dans le Context Manager ou un script externe).

Étapes suivantes

  • Connectez les fournisseurs IA — sans eux, le traitement IA ne fait rien (le module peut quand même sauver le texte).
  • Pour les sites qui exigent un rendu JS, utilisez Site Audit sur Chromium.
  • Pour des contrôles de disponibilité continus, faites tourner Health Check en parallèle.

Aide et retour

Vous voulez un navigateur headless, le respect de robots.txt ou un planificateur ? Contactez-nous via le formulaire de retour.