Веб-парсер — руководство пользователя | YoBench
Как пользоваться модулем «Веб-парсер» в YoBench: краулер сайтов, AI-обработка страниц, экспорт в JSON/CSV, пауза/возобновление, прокси и rate limit.
Что такое модуль «Веб-парсер»
Модуль автоматически обходит сайт по внутренним ссылкам, для каждой страницы извлекает текст и (по желанию) пропускает его через выбранный AI-провайдер с вашим промптом, превращая HTML в структурированные данные. На выходе — JSON или CSV, готовые для дальнейшей обработки. Подходит для разовых выгрузок и для большого парсинга со сложной логикой извлечения.
Что вы получаете:
- Краулер с автообходом — задаёте стартовый URL и лимит страниц, а модуль сам идёт по внутренним ссылкам.
- AI-обработка страниц — каждая страница передаётся LLM с вашим промптом и шаблоном данных; результат сохраняется отдельно.
- Экспорт в JSON/CSV — кнопкой «Скачать» из отчёта.
- Защита от spider-trap — встроенный детектор циклических URL и ограничение глубины пути (15 сегментов).
- Прокси и авторизация — каждый шаблон может пользоваться выбранным прокси и профилем авторизации (заголовки, куки).
- Пауза и возобновление — задачу можно остановить и продолжить позже без потери прогресса.
- Контроль скорости — rate limit в запросах в секунду на шаблон.
- Локальное хранение — все страницы и результаты остаются в БД YoBench.
- Бесконечная прокрутка списка страниц — большие обходы (сотни страниц) подгружаются по мере прокрутки.
Параметры шаблона
Шаблон — это переиспользуемый набор параметров для запуска парсинга. Указываете:
- Стартовый URL — точка входа.
- Максимум страниц —
max_pages. По умолчанию 100. Лимитирует общий объём задачи. - Скорость (req/sec) —
rate_limit. По умолчанию 2. Регулирует rate limit запросов. - AI включён —
ai_enabled(флаг). Если выключен — модуль сохраняет только текст страниц без AI-обработки. - AI-провайдер — какой провайдер из общего реестра AI Chat использовать.
- Промпт LLM — инструкция для AI: как извлекать данные из страницы.
- Шаблон данных — пример JSON-структуры, которую LLM должен заполнить (
data_template). - Формат вывода —
none/json/csv. - Прокси (опционально) — направить трафик через выбранный прокси-профиль.
- Профиль авторизации (опционально) — заголовки, куки, query-параметры для аутентификации.
Технические особенности (нельзя поменять в UI):
- Запросы используют fetch API (без headless-браузера, без JavaScript-рендера). Сайты, требующие JS, парсятся плохо — для них лучше Site Audit с Chromium.
- User-Agent фиксирован:
Mozilla/5.0 ... Chrome/120(под обычный десктоп). - Тайм-аут запроса — 30 секунд на каждую страницу.
- robots.txt не учитывается — будьте корректны с сайтами и используйте rate limit.
Глобальные настройки
У модуля нет специальных ключей в общем разделе Настройки — все параметры настраиваются на уровне шаблона.
Действия
На задаче (job):
- Запустить — стартует задачу из шаблона: создаётся очередь страниц, парсер начинает работать.
- Пауза — сохраняет текущее состояние очереди и LLM-обработки.
- Продолжить — поднимает задачу с места остановки.
- Остановить — отменяет задачу, очищает очередь.
- Скачать JSON / CSV — экспортирует структурированные данные всех обработанных страниц.
На странице (page):
- Просмотр оригинального текста, результата AI и итогового JSON.
Состояния
Задача (job):
queued → running → paused | completed | stopped | error.
Страница (page):
crawled → processing → processed | error.
Флоу использования
1. Создайте шаблон
- Откройте модуль Веб-парсер в левом меню.
- На вкладке Шаблоны парсинга нажмите Создать шаблон.
- Заполните стартовый URL, лимит страниц, скорость.
- Включите AI, выберите провайдера, напишите промпт и шаблон данных.
- Выберите формат вывода (JSON / CSV) или
none, если нужны только тексты. - При необходимости укажите прокси и профиль авторизации.
- Сохраните шаблон.
2. Запустите задачу
- Рядом с шаблоном — кнопка Запустить. Создастся новая задача со статусом
running. - На вкладке Отчёты виден прогресс: сколько страниц crawled / processed / failed, текущий статус.
- При необходимости нажмите Пауза — задача сохранится в БД и не пропадёт при перезапуске приложения.
- Чтобы продолжить — кнопка Продолжить.
3. Скачайте результаты
В готовой задаче (status completed) — кнопка Скачать JSON или Скачать CSV. Файл содержит structured_data всех обработанных страниц.
4. Анализируйте
- Откройте конкретную страницу в отчёте — увидите оригинальный текст, ответ LLM и итоговый JSON.
- Используйте полученный JSON в других модулях (например, импорт в Context Manager или внешний скрипт).
Что дальше
- Подключите AI-провайдеров — без них AI-обработка не работает (модуль может сохранять только текст).
- Если сайт требует JS-рендера — используйте Site Audit на Chromium.
- Для регулярной проверки доступности сайта подойдёт Health Check.
Помощь и обратная связь
Хотите headless-браузер, поддержку robots.txt или планировщик расписаний? Напишите нам через форму обратной связи.