Скачать

Веб-парсер — руководство пользователя | YoBench

Как пользоваться модулем «Веб-парсер» в YoBench: краулер сайтов, AI-обработка страниц, экспорт в JSON/CSV, пауза/возобновление, прокси и rate limit.

Что такое модуль «Веб-парсер»

Модуль автоматически обходит сайт по внутренним ссылкам, для каждой страницы извлекает текст и (по желанию) пропускает его через выбранный AI-провайдер с вашим промптом, превращая HTML в структурированные данные. На выходе — JSON или CSV, готовые для дальнейшей обработки. Подходит для разовых выгрузок и для большого парсинга со сложной логикой извлечения.

Что вы получаете:

  • Краулер с автообходом — задаёте стартовый URL и лимит страниц, а модуль сам идёт по внутренним ссылкам.
  • AI-обработка страниц — каждая страница передаётся LLM с вашим промптом и шаблоном данных; результат сохраняется отдельно.
  • Экспорт в JSON/CSV — кнопкой «Скачать» из отчёта.
  • Защита от spider-trap — встроенный детектор циклических URL и ограничение глубины пути (15 сегментов).
  • Прокси и авторизация — каждый шаблон может пользоваться выбранным прокси и профилем авторизации (заголовки, куки).
  • Пауза и возобновление — задачу можно остановить и продолжить позже без потери прогресса.
  • Контроль скорости — rate limit в запросах в секунду на шаблон.
  • Локальное хранение — все страницы и результаты остаются в БД YoBench.
  • Бесконечная прокрутка списка страниц — большие обходы (сотни страниц) подгружаются по мере прокрутки.

Параметры шаблона

Шаблон — это переиспользуемый набор параметров для запуска парсинга. Указываете:

  • Стартовый URL — точка входа.
  • Максимум страницmax_pages. По умолчанию 100. Лимитирует общий объём задачи.
  • Скорость (req/sec)rate_limit. По умолчанию 2. Регулирует rate limit запросов.
  • AI включёнai_enabled (флаг). Если выключен — модуль сохраняет только текст страниц без AI-обработки.
  • AI-провайдер — какой провайдер из общего реестра AI Chat использовать.
  • Промпт LLM — инструкция для AI: как извлекать данные из страницы.
  • Шаблон данных — пример JSON-структуры, которую LLM должен заполнить (data_template).
  • Формат выводаnone / json / csv.
  • Прокси (опционально) — направить трафик через выбранный прокси-профиль.
  • Профиль авторизации (опционально) — заголовки, куки, query-параметры для аутентификации.

Технические особенности (нельзя поменять в UI):

  • Запросы используют fetch API (без headless-браузера, без JavaScript-рендера). Сайты, требующие JS, парсятся плохо — для них лучше Site Audit с Chromium.
  • User-Agent фиксирован: Mozilla/5.0 ... Chrome/120 (под обычный десктоп).
  • Тайм-аут запроса — 30 секунд на каждую страницу.
  • robots.txt не учитывается — будьте корректны с сайтами и используйте rate limit.

Глобальные настройки

У модуля нет специальных ключей в общем разделе Настройки — все параметры настраиваются на уровне шаблона.

Действия

На задаче (job):

  • Запустить — стартует задачу из шаблона: создаётся очередь страниц, парсер начинает работать.
  • Пауза — сохраняет текущее состояние очереди и LLM-обработки.
  • Продолжить — поднимает задачу с места остановки.
  • Остановить — отменяет задачу, очищает очередь.
  • Скачать JSON / CSV — экспортирует структурированные данные всех обработанных страниц.

На странице (page):

  • Просмотр оригинального текста, результата AI и итогового JSON.

Состояния

Задача (job): queuedrunningpaused | completed | stopped | error.

Страница (page): crawledprocessingprocessed | error.

Флоу использования

1. Создайте шаблон

  1. Откройте модуль Веб-парсер в левом меню.
  2. На вкладке Шаблоны парсинга нажмите Создать шаблон.
  3. Заполните стартовый URL, лимит страниц, скорость.
  4. Включите AI, выберите провайдера, напишите промпт и шаблон данных.
  5. Выберите формат вывода (JSON / CSV) или none, если нужны только тексты.
  6. При необходимости укажите прокси и профиль авторизации.
  7. Сохраните шаблон.

2. Запустите задачу

  1. Рядом с шаблоном — кнопка Запустить. Создастся новая задача со статусом running.
  2. На вкладке Отчёты виден прогресс: сколько страниц crawled / processed / failed, текущий статус.
  3. При необходимости нажмите Пауза — задача сохранится в БД и не пропадёт при перезапуске приложения.
  4. Чтобы продолжить — кнопка Продолжить.

3. Скачайте результаты

В готовой задаче (status completed) — кнопка Скачать JSON или Скачать CSV. Файл содержит structured_data всех обработанных страниц.

4. Анализируйте

  • Откройте конкретную страницу в отчёте — увидите оригинальный текст, ответ LLM и итоговый JSON.
  • Используйте полученный JSON в других модулях (например, импорт в Context Manager или внешний скрипт).

Что дальше

  • Подключите AI-провайдеров — без них AI-обработка не работает (модуль может сохранять только текст).
  • Если сайт требует JS-рендера — используйте Site Audit на Chromium.
  • Для регулярной проверки доступности сайта подойдёт Health Check.

Помощь и обратная связь

Хотите headless-браузер, поддержку robots.txt или планировщик расписаний? Напишите нам через форму обратной связи.