Download

Web Parser — Guia do usuário | YoBench

Como usar o módulo «Web Parser» no YoBench: crawler de sites, processamento por IA, exportação JSON/CSV, pausa/retomada, proxy e rate limit.

Para que serve o módulo «Web Parser»

O módulo percorre automaticamente um site seguindo seus links internos, extrai o texto de cada página e (opcionalmente) o passa ao provedor de IA escolhido com seu prompt — convertendo HTML em dados estruturados. A saída é JSON ou CSV, pronta para uso. Útil para extrações pontuais e para grandes parsings com lógica de extração complexa.

O que você obtém:

  • Crawler com auto-descoberta — você define uma URL inicial e um limite de páginas; o módulo segue os links internos sozinho.
  • Processamento por IA das páginas — cada página vai ao LLM com seu prompt e modelo de dados; o resultado é salvo separadamente.
  • Exportação JSON/CSV — pelo botão Baixar no relatório.
  • Detecção de spider-trap — detector interno de URLs cíclicas e limite de profundidade (15 segmentos).
  • Proxy e auth — cada modelo pode usar um proxy escolhido e um perfil de autenticação (headers, cookies).
  • Pausa e retomada — um job pode ser parado e retomado depois sem perder progresso.
  • Controle de velocidade — limite de requisições por segundo por modelo.
  • Armazenamento local — todas as páginas e resultados ficam no banco do YoBench.
  • Scroll infinito na lista de páginas — crawls grandes (centenas de páginas) carregam sob demanda, sem paginação.

Parâmetros do modelo

Um modelo é um conjunto reutilizável de parâmetros. Você especifica:

  • URL inicial — ponto de entrada.
  • Máx. de páginasmax_pages. Padrão 100. Limita o tamanho total do job.
  • Taxa (req/s)rate_limit. Padrão 2. Limita a taxa de requisições.
  • IA ativada — flag ai_enabled. Quando desligada, o módulo só salva o texto, sem processamento por IA.
  • Provedor de IA — qual provedor do registro AI Chat usar.
  • Prompt do LLM — instruções para extrair dados da página.
  • Modelo de dados — esqueleto JSON que o LLM deve preencher (data_template).
  • Formato de saídanone / json / csv.
  • Proxy (opcional) — enviar o tráfego por um perfil de proxy.
  • Perfil de autenticação (opcional) — cabeçalhos, cookies, parâmetros de query para autenticar.

Limitações técnicas (não expostas na UI):

  • As requisições usam a API fetch (sem navegador headless, sem renderização JavaScript). Sites só-JS são parseados mal — use Site Audit com Chromium para esses.
  • User-Agent fixo: Mozilla/5.0 ... Chrome/120.
  • Timeout de 30 segundos por página.
  • robots.txt não é respeitado — seja cordial com os sites e use o rate limit.

Configurações globais

O módulo não tem entradas próprias na seção central Configurações — tudo é configurado no nível do modelo.

Ações

Em um job:

  • Iniciar — lança um job a partir do modelo: cria-se uma fila de páginas, o parser começa.
  • Pausar — persiste o estado atual da fila e do processamento LLM.
  • Retomar — continua do ponto de pausa.
  • Parar — cancela o job e limpa a fila.
  • Baixar JSON / CSV — exporta dados estruturados de todas as páginas processadas.

Em uma página:

  • Ver texto original, resposta do LLM e o JSON resultante.

Estados

Job: queuedrunningpaused | completed | stopped | error.

Página: crawledprocessingprocessed | error.

Fluxo de uso

1. Crie um modelo

  1. Abra o módulo Web Parser no menu lateral esquerdo.
  2. Na aba Modelos de parsing clique em Criar modelo.
  3. Preencha URL inicial, limite de páginas, taxa.
  4. Ative IA, escolha um provedor, escreva o prompt e o modelo de dados.
  5. Escolha o formato de saída (JSON / CSV) ou none se só precisa de texto cru.
  6. Opcionalmente escolha proxy e perfil de auth.
  7. Salve.

2. Inicie um job

  1. Ao lado do modelo clique em Iniciar. Surge um novo job em running.
  2. A aba Relatórios mostra o progresso: páginas crawled / processadas / falhas.
  3. Se necessário, clique em Pausar — o job é persistido no banco e sobrevive a um reinício do app.
  4. Para continuar, clique em Retomar.

3. Baixe os resultados

Para um job completed, clique em Baixar JSON ou Baixar CSV. O arquivo contém structured_data de cada página processada.

4. Inspecione

  • Abra uma página específica no relatório — você vê o texto original, a resposta do LLM e o JSON resultante.
  • Use o JSON em outros módulos (por exemplo, importe no Context Manager ou em um script externo).

Próximos passos

  • Conecte os provedores de IA — sem eles o processamento por IA não faz nada (o módulo ainda pode salvar só o texto).
  • Para sites que precisam de renderização JS, use Site Audit com Chromium.
  • Para checagens contínuas de disponibilidade, rode o Health Check em paralelo.

Ajuda e feedback

Quer navegador headless, suporte a robots.txt ou um agendador? Escreva para nós pelo formulário de contato.