Web Parser — Guia do usuário | YoBench
Como usar o módulo «Web Parser» no YoBench: crawler de sites, processamento por IA, exportação JSON/CSV, pausa/retomada, proxy e rate limit.
Para que serve o módulo «Web Parser»
O módulo percorre automaticamente um site seguindo seus links internos, extrai o texto de cada página e (opcionalmente) o passa ao provedor de IA escolhido com seu prompt — convertendo HTML em dados estruturados. A saída é JSON ou CSV, pronta para uso. Útil para extrações pontuais e para grandes parsings com lógica de extração complexa.
O que você obtém:
- Crawler com auto-descoberta — você define uma URL inicial e um limite de páginas; o módulo segue os links internos sozinho.
- Processamento por IA das páginas — cada página vai ao LLM com seu prompt e modelo de dados; o resultado é salvo separadamente.
- Exportação JSON/CSV — pelo botão Baixar no relatório.
- Detecção de spider-trap — detector interno de URLs cíclicas e limite de profundidade (15 segmentos).
- Proxy e auth — cada modelo pode usar um proxy escolhido e um perfil de autenticação (headers, cookies).
- Pausa e retomada — um job pode ser parado e retomado depois sem perder progresso.
- Controle de velocidade — limite de requisições por segundo por modelo.
- Armazenamento local — todas as páginas e resultados ficam no banco do YoBench.
- Scroll infinito na lista de páginas — crawls grandes (centenas de páginas) carregam sob demanda, sem paginação.
Parâmetros do modelo
Um modelo é um conjunto reutilizável de parâmetros. Você especifica:
- URL inicial — ponto de entrada.
- Máx. de páginas —
max_pages. Padrão 100. Limita o tamanho total do job. - Taxa (req/s) —
rate_limit. Padrão 2. Limita a taxa de requisições. - IA ativada — flag
ai_enabled. Quando desligada, o módulo só salva o texto, sem processamento por IA. - Provedor de IA — qual provedor do registro AI Chat usar.
- Prompt do LLM — instruções para extrair dados da página.
- Modelo de dados — esqueleto JSON que o LLM deve preencher (
data_template). - Formato de saída —
none/json/csv. - Proxy (opcional) — enviar o tráfego por um perfil de proxy.
- Perfil de autenticação (opcional) — cabeçalhos, cookies, parâmetros de query para autenticar.
Limitações técnicas (não expostas na UI):
- As requisições usam a API fetch (sem navegador headless, sem renderização JavaScript). Sites só-JS são parseados mal — use Site Audit com Chromium para esses.
- User-Agent fixo:
Mozilla/5.0 ... Chrome/120. - Timeout de 30 segundos por página.
- robots.txt não é respeitado — seja cordial com os sites e use o rate limit.
Configurações globais
O módulo não tem entradas próprias na seção central Configurações — tudo é configurado no nível do modelo.
Ações
Em um job:
- Iniciar — lança um job a partir do modelo: cria-se uma fila de páginas, o parser começa.
- Pausar — persiste o estado atual da fila e do processamento LLM.
- Retomar — continua do ponto de pausa.
- Parar — cancela o job e limpa a fila.
- Baixar JSON / CSV — exporta dados estruturados de todas as páginas processadas.
Em uma página:
- Ver texto original, resposta do LLM e o JSON resultante.
Estados
Job: queued → running → paused | completed | stopped | error.
Página: crawled → processing → processed | error.
Fluxo de uso
1. Crie um modelo
- Abra o módulo Web Parser no menu lateral esquerdo.
- Na aba Modelos de parsing clique em Criar modelo.
- Preencha URL inicial, limite de páginas, taxa.
- Ative IA, escolha um provedor, escreva o prompt e o modelo de dados.
- Escolha o formato de saída (JSON / CSV) ou
nonese só precisa de texto cru. - Opcionalmente escolha proxy e perfil de auth.
- Salve.
2. Inicie um job
- Ao lado do modelo clique em Iniciar. Surge um novo job em
running. - A aba Relatórios mostra o progresso: páginas crawled / processadas / falhas.
- Se necessário, clique em Pausar — o job é persistido no banco e sobrevive a um reinício do app.
- Para continuar, clique em Retomar.
3. Baixe os resultados
Para um job completed, clique em Baixar JSON ou Baixar CSV. O arquivo contém structured_data de cada página processada.
4. Inspecione
- Abra uma página específica no relatório — você vê o texto original, a resposta do LLM e o JSON resultante.
- Use o JSON em outros módulos (por exemplo, importe no Context Manager ou em um script externo).
Próximos passos
- Conecte os provedores de IA — sem eles o processamento por IA não faz nada (o módulo ainda pode salvar só o texto).
- Para sites que precisam de renderização JS, use Site Audit com Chromium.
- Para checagens contínuas de disponibilidade, rode o Health Check em paralelo.
Ajuda e feedback
Quer navegador headless, suporte a robots.txt ou um agendador? Escreva para nós pelo formulário de contato.