Web Parser — Guide utilisateur | YoBench
Comment utiliser le module « Web Parser » dans YoBench : crawler de sites, traitement IA des pages, export JSON/CSV, pause/reprise, proxy et rate limit.
À quoi sert le module « Web Parser »
Le module parcourt automatiquement un site en suivant ses liens internes, extrait le texte de chaque page et (optionnellement) le passe au fournisseur IA choisi avec votre prompt — transformant le HTML en données structurées. La sortie est en JSON ou CSV, prête à être réutilisée. Utile pour les extractions ponctuelles et pour les gros parsings avec une logique d'extraction complexe.
Ce que vous obtenez :
- Crawler avec auto-découverte — vous fixez une URL de départ et une limite de pages, le module suit les liens internes lui-même.
- Traitement IA des pages — chaque page est envoyée au LLM avec votre prompt et un modèle de données ; le résultat est sauvegardé séparément.
- Export JSON/CSV — via le bouton Télécharger dans le rapport.
- Détection de spider-trap — détecteur intégré des URLs cycliques et limite de profondeur (15 segments).
- Proxy et auth — chaque modèle peut utiliser un proxy choisi et un profil d'authentification (en-têtes, cookies).
- Pause et reprise — un job peut être arrêté et repris plus tard sans perte d'avancement.
- Contrôle de débit — limite de requêtes par seconde par modèle.
- Stockage local — toutes les pages et résultats restent dans la base YoBench.
- Défilement infini sur la liste de pages — les crawls importants (centaines de pages) chargent à la demande, sans pagination.
Paramètres du modèle
Un modèle est un ensemble réutilisable de paramètres. Vous spécifiez :
- URL de départ — point d'entrée.
- Pages max. —
max_pages. Par défaut 100. Borne la taille totale du job. - Débit (req/s) —
rate_limit. Par défaut 2. Bride le débit des requêtes. - IA activée — drapeau
ai_enabled. Si désactivé, le module ne sauvegarde que le texte sans traitement IA. - Fournisseur IA — quel fournisseur du registre AI Chat utiliser.
- Prompt LLM — instructions pour extraire les données de la page.
- Modèle de données — squelette JSON que le LLM doit remplir (
data_template). - Format de sortie —
none/json/csv. - Proxy (optionnel) — fait passer le trafic par un profil proxy.
- Profil d'authentification (optionnel) — en-têtes, cookies, paramètres de requête pour s'authentifier.
Limites techniques (non exposées dans l'UI) :
- Les requêtes utilisent l'API fetch (pas de navigateur headless, pas de rendu JavaScript). Les sites JS-only se parsent mal — utilisez Site Audit avec Chromium pour ceux-là.
- User-Agent est fixe :
Mozilla/5.0 ... Chrome/120. - Délai d'attente de 30 secondes par page.
- robots.txt n'est pas respecté — soyez courtois avec les sites et utilisez le rate limit.
Réglages globaux
Le module n'a pas d'entrées dédiées dans la section centrale Réglages — tout se configure au niveau du modèle.
Actions
Sur un job :
- Démarrer — lance un job depuis le modèle : une file de pages est créée, le parseur démarre.
- Pause — sauvegarde l'état courant de la file et du traitement LLM.
- Reprendre — reprend au point de pause.
- Arrêter — annule le job et vide la file.
- Télécharger JSON / CSV — exporte les données structurées de toutes les pages traitées.
Sur une page :
- Voir le texte original, la réponse du LLM et le JSON résultant.
États
Job : queued → running → paused | completed | stopped | error.
Page : crawled → processing → processed | error.
Flux d'utilisation
1. Créez un modèle
- Ouvrez le module Web Parser depuis le menu de gauche.
- Sur l'onglet Modèles de parsing, cliquez sur Créer un modèle.
- Renseignez l'URL de départ, la limite de pages, le débit.
- Activez IA, choisissez un fournisseur, écrivez le prompt et le modèle de données.
- Choisissez le format de sortie (JSON / CSV) ou
nonepour du texte brut. - Optionnellement, choisissez un proxy et un profil d'auth.
- Enregistrez.
2. Démarrez un job
- À côté du modèle, cliquez sur Démarrer. Un nouveau job en
runningapparaît. - L'onglet Rapports montre la progression : pages crawlées / traitées / échouées.
- Au besoin, cliquez sur Pause — le job est persisté en base et survit à un redémarrage de l'app.
- Pour continuer, cliquez sur Reprendre.
3. Téléchargez les résultats
Pour un job completed, cliquez sur Télécharger JSON ou Télécharger CSV. Le fichier contient structured_data pour chaque page traitée.
4. Inspectez
- Ouvrez une page spécifique dans le rapport — vous voyez le texte original, la réponse du LLM et le JSON résultant.
- Réinjectez le JSON dans d'autres modules (par exemple, importez-le dans le Context Manager ou un script externe).
Étapes suivantes
- Connectez les fournisseurs IA — sans eux, le traitement IA ne fait rien (le module peut quand même sauver le texte).
- Pour les sites qui exigent un rendu JS, utilisez Site Audit sur Chromium.
- Pour des contrôles de disponibilité continus, faites tourner Health Check en parallèle.
Aide et retour
Vous voulez un navigateur headless, le respect de robots.txt ou un planificateur ? Contactez-nous via le formulaire de retour.