Descargar

Web Parser — Guía del usuario | YoBench

Cómo usar el módulo «Web Parser» en YoBench: crawler de sitios, procesamiento IA de páginas, exportación JSON/CSV, pausa/reanudación, proxy y rate limit.

Para qué sirve el módulo «Web Parser»

El módulo recorre automáticamente un sitio siguiendo los enlaces internos, extrae el texto de cada página y (opcionalmente) lo pasa al proveedor de IA elegido con tu prompt — convirtiendo HTML en datos estructurados. La salida es JSON o CSV, lista para procesar. Útil para extracciones puntuales y para grandes parsings con lógica de extracción compleja.

Lo que obtienes:

  • Crawler con auto-descubrimiento — defines una URL inicial y un límite de páginas, y el módulo sigue los enlaces internos por sí mismo.
  • Procesamiento IA por página — cada página va al LLM con tu prompt y plantilla de datos; el resultado se guarda por separado.
  • Exportación JSON/CSV — vía el botón Descargar del informe.
  • Detección de spider-trap — detector interno de URLs cíclicas y límite de profundidad (15 segmentos).
  • Proxy y auth — cada plantilla puede usar un proxy elegido y un perfil de autenticación (cabeceras, cookies).
  • Pausa y reanudación — un job se puede detener y reanudar sin perder el progreso.
  • Control de velocidad — límite de peticiones por segundo por plantilla.
  • Almacenamiento local — todas las páginas y resultados quedan en la base de YoBench.
  • Scroll infinito en la lista de páginas — los crawls grandes (cientos de páginas) cargan bajo demanda en lugar de paginar.

Parámetros de la plantilla

Una plantilla es un conjunto reutilizable de parámetros. Especificas:

  • URL inicial — punto de entrada.
  • Páginas máx.max_pages. Por defecto 100. Limita el tamaño total del job.
  • Velocidad (req/s)rate_limit. Por defecto 2. Limita la tasa de peticiones.
  • IA activada — bandera ai_enabled. Si está desactivada, el módulo solo guarda el texto sin procesamiento IA.
  • Proveedor IA — qué proveedor del registro AI Chat usar.
  • Prompt LLM — instrucciones para extraer datos de la página.
  • Plantilla de datos — esqueleto JSON que el LLM debe rellenar (data_template).
  • Formato de salidanone / json / csv.
  • Proxy (opcional) — enrutar el tráfico por un perfil proxy.
  • Perfil de autenticación (opcional) — cabeceras, cookies, parámetros de query para autenticarse.

Límites técnicos (no expuestos en la UI):

  • Las peticiones usan la API fetch (sin navegador headless, sin renderizado de JavaScript). Los sitios JS-only se parsean mal — usa Site Audit con Chromium para esos.
  • User-Agent fijo: Mozilla/5.0 ... Chrome/120.
  • Tiempo de espera de 30 segundos por página.
  • robots.txt no se respeta — sé respetuoso con los sitios y usa el rate limit.

Ajustes globales

El módulo no tiene entradas propias en la sección central Ajustes — todo se configura al nivel de plantilla.

Acciones

Sobre un job:

  • Iniciar — lanza un job desde la plantilla: se crea una cola de páginas y el parser arranca.
  • Pausar — guarda el estado actual de la cola y el procesamiento LLM.
  • Reanudar — sigue desde el punto de pausa.
  • Detener — cancela el job y limpia la cola.
  • Descargar JSON / CSV — exporta los datos estructurados de todas las páginas procesadas.

Sobre una página:

  • Ver texto original, respuesta del LLM y el JSON resultante.

Estados

Job: queuedrunningpaused | completed | stopped | error.

Página: crawledprocessingprocessed | error.

Flujo de uso

1. Crea una plantilla

  1. Abre el módulo Web Parser en el menú lateral izquierdo.
  2. En la pestaña Plantillas de parsing pulsa Crear plantilla.
  3. Rellena URL inicial, límite de páginas, velocidad.
  4. Activa IA, elige un proveedor, escribe el prompt y la plantilla de datos.
  5. Elige el formato de salida (JSON / CSV) o none si solo necesitas texto crudo.
  6. Opcionalmente elige un proxy y un perfil de autenticación.
  7. Guarda.

2. Inicia un job

  1. Junto a la plantilla, pulsa Iniciar. Aparece un nuevo job en running.
  2. La pestaña Informes muestra el progreso: páginas crawled / procesadas / fallidas.
  3. Si lo necesitas, pulsa Pausar — el job se guarda en BD y sobrevive a un reinicio de la app.
  4. Para continuar, pulsa Reanudar.

3. Descarga resultados

Para un job completed, pulsa Descargar JSON o Descargar CSV. El archivo contiene structured_data de cada página procesada.

4. Inspecciona

  • Abre una página concreta en el informe — verás el texto original, la respuesta del LLM y el JSON resultante.
  • Inyecta el JSON en otros módulos (por ejemplo, impórtalo al Context Manager o a un script externo).

Siguientes pasos

  • Conecta proveedores de IA — sin ellos el procesamiento IA no funciona (el módulo aún puede guardar solo texto).
  • Para sitios que requieran renderizado JS, usa Site Audit en Chromium.
  • Para chequeos continuos de disponibilidad, ejecuta Health Check en paralelo.

Ayuda y comentarios

¿Quieres navegador headless, soporte de robots.txt o un planificador? Escríbenos a través del formulario de contacto.