Web Parser — Guía del usuario | YoBench
Cómo usar el módulo «Web Parser» en YoBench: crawler de sitios, procesamiento IA de páginas, exportación JSON/CSV, pausa/reanudación, proxy y rate limit.
Para qué sirve el módulo «Web Parser»
El módulo recorre automáticamente un sitio siguiendo los enlaces internos, extrae el texto de cada página y (opcionalmente) lo pasa al proveedor de IA elegido con tu prompt — convirtiendo HTML en datos estructurados. La salida es JSON o CSV, lista para procesar. Útil para extracciones puntuales y para grandes parsings con lógica de extracción compleja.
Lo que obtienes:
- Crawler con auto-descubrimiento — defines una URL inicial y un límite de páginas, y el módulo sigue los enlaces internos por sí mismo.
- Procesamiento IA por página — cada página va al LLM con tu prompt y plantilla de datos; el resultado se guarda por separado.
- Exportación JSON/CSV — vía el botón Descargar del informe.
- Detección de spider-trap — detector interno de URLs cíclicas y límite de profundidad (15 segmentos).
- Proxy y auth — cada plantilla puede usar un proxy elegido y un perfil de autenticación (cabeceras, cookies).
- Pausa y reanudación — un job se puede detener y reanudar sin perder el progreso.
- Control de velocidad — límite de peticiones por segundo por plantilla.
- Almacenamiento local — todas las páginas y resultados quedan en la base de YoBench.
- Scroll infinito en la lista de páginas — los crawls grandes (cientos de páginas) cargan bajo demanda en lugar de paginar.
Parámetros de la plantilla
Una plantilla es un conjunto reutilizable de parámetros. Especificas:
- URL inicial — punto de entrada.
- Páginas máx. —
max_pages. Por defecto 100. Limita el tamaño total del job. - Velocidad (req/s) —
rate_limit. Por defecto 2. Limita la tasa de peticiones. - IA activada — bandera
ai_enabled. Si está desactivada, el módulo solo guarda el texto sin procesamiento IA. - Proveedor IA — qué proveedor del registro AI Chat usar.
- Prompt LLM — instrucciones para extraer datos de la página.
- Plantilla de datos — esqueleto JSON que el LLM debe rellenar (
data_template). - Formato de salida —
none/json/csv. - Proxy (opcional) — enrutar el tráfico por un perfil proxy.
- Perfil de autenticación (opcional) — cabeceras, cookies, parámetros de query para autenticarse.
Límites técnicos (no expuestos en la UI):
- Las peticiones usan la API fetch (sin navegador headless, sin renderizado de JavaScript). Los sitios JS-only se parsean mal — usa Site Audit con Chromium para esos.
- User-Agent fijo:
Mozilla/5.0 ... Chrome/120. - Tiempo de espera de 30 segundos por página.
- robots.txt no se respeta — sé respetuoso con los sitios y usa el rate limit.
Ajustes globales
El módulo no tiene entradas propias en la sección central Ajustes — todo se configura al nivel de plantilla.
Acciones
Sobre un job:
- Iniciar — lanza un job desde la plantilla: se crea una cola de páginas y el parser arranca.
- Pausar — guarda el estado actual de la cola y el procesamiento LLM.
- Reanudar — sigue desde el punto de pausa.
- Detener — cancela el job y limpia la cola.
- Descargar JSON / CSV — exporta los datos estructurados de todas las páginas procesadas.
Sobre una página:
- Ver texto original, respuesta del LLM y el JSON resultante.
Estados
Job: queued → running → paused | completed | stopped | error.
Página: crawled → processing → processed | error.
Flujo de uso
1. Crea una plantilla
- Abre el módulo Web Parser en el menú lateral izquierdo.
- En la pestaña Plantillas de parsing pulsa Crear plantilla.
- Rellena URL inicial, límite de páginas, velocidad.
- Activa IA, elige un proveedor, escribe el prompt y la plantilla de datos.
- Elige el formato de salida (JSON / CSV) o
nonesi solo necesitas texto crudo. - Opcionalmente elige un proxy y un perfil de autenticación.
- Guarda.
2. Inicia un job
- Junto a la plantilla, pulsa Iniciar. Aparece un nuevo job en
running. - La pestaña Informes muestra el progreso: páginas crawled / procesadas / fallidas.
- Si lo necesitas, pulsa Pausar — el job se guarda en BD y sobrevive a un reinicio de la app.
- Para continuar, pulsa Reanudar.
3. Descarga resultados
Para un job completed, pulsa Descargar JSON o Descargar CSV. El archivo contiene structured_data de cada página procesada.
4. Inspecciona
- Abre una página concreta en el informe — verás el texto original, la respuesta del LLM y el JSON resultante.
- Inyecta el JSON en otros módulos (por ejemplo, impórtalo al Context Manager o a un script externo).
Siguientes pasos
- Conecta proveedores de IA — sin ellos el procesamiento IA no funciona (el módulo aún puede guardar solo texto).
- Para sitios que requieran renderizado JS, usa Site Audit en Chromium.
- Para chequeos continuos de disponibilidad, ejecuta Health Check en paralelo.
Ayuda y comentarios
¿Quieres navegador headless, soporte de robots.txt o un planificador? Escríbenos a través del formulario de contacto.