Парсеры и сбор данных для SEO и маркетинга
Парсеры и сбор данных входят в услугу «Автоматизация процессов» в Best Boost Partners. Мы пишем парсеры, которые по расписанию собирают поисковую выдачу, цены и каталоги конкурентов, данные о ссылках и метаданные страниц, очищают данные и сохраняют их в базу или таблицу. Если у источника есть официальный API, мы работаем через него и соблюдаем условия сайта-источника и правила robots. Вы получаете код, документацию и первый собранный набор данных.
Какие парсеры мы пишем?
Поисковая выдача
Собираем выдачу по вашему списку запросов с разбивкой по регионам и устройствам: позиции, адреса, заголовки, сниппеты и специальные блоки на странице. По этим данным видно, кто реально стоит по каждому запросу и как выдача меняется со временем.
Цены и каталоги конкурентов
Парсер проходит по категориям и карточкам конкурентов и записывает названия, цены, наличие и характеристики. Интернет-магазин или каталог автозапчастей получает сравнительную таблицу, которая обновляется по расписанию.
Ссылочные данные
Получаем данные о ссылках через API ссылочных индексов, таких как Ahrefs и Majestic, по вашей подписке, и проверяем живые страницы: стоит ли ссылка, какой у неё анкор и атрибуты, какой код ответа отдаёт страница.
Метаданные страниц
Краулер считывает title, description, заголовки, canonical, коды ответа и микроразметку с ваших страниц или страниц конкурентов. Результат попадает в таблицу, которую можно фильтровать и сравнивать с прошлым запуском.
Очистка и хранение
Сырые данные очищаются от дублей, приводятся к одному формату и проверяются перед сохранением. Храним их в базе данных или в таблице: выбор зависит от объёма и от того, кто будет работать с данными.
Расписание и контроль
Каждый парсер запускается по расписанию и ведёт журнал. Если запуск вернул пустой или непривычно маленький результат, парсер присылает уведомление: обычно это значит, что источник изменил вёрстку.
Что вы получаете от парсеров и сбора данных?
- Код парсеров в вашем репозитории, настройки вынесены в отдельный конфигурационный файл.
- Базу или таблицу с описанной структурой: что значит каждое поле и откуда оно берётся.
- Расписание запусков и журнал каждого запуска.
- Документацию о том, как добавить новый источник, список запросов или поле.
- Справку по каждому источнику: API или парсинг, лимиты запросов, учтённые условия использования.
Когда нужны парсеры и сбор данных?
- Одни и те же данные регулярно копируют вручную из выдачи или с сайтов конкурентов.
- Интернет-магазину нужно каждый день видеть цены и наличие у конкурентов, а каталог слишком велик для ручной проверки.
- Купленные или размещённые ссылки нужно регулярно проверять: жива ли страница и на месте ли ссылка.
- Для решения по семантике или структуре нужны данные сразу по многим страницам конкурентов.
Частые вопросы
Можно ли парсить чужой сайт?
Это зависит от условий использования сайта-источника, типа данных и законодательства страны, поэтому каждый источник мы проверяем до начала работы. Мы используем официальный API там, где он есть, соблюдаем правила robots, держим умеренную частоту запросов и не собираем персональные данные и контент, закрытый авторизацией. Если источник запрещает автоматический сбор, мы говорим об этом и ищем другой источник тех же данных.
Что будет, если сайт-источник поменяет вёрстку?
Парсер перестанет находить нужные поля, запишет ошибку и пришлёт уведомление. Селекторы и правила для полей лежат в конфигурации отдельно от основного кода, поэтому правка обычно небольшая. Как внести такую правку, описано в документации.
Как часто можно собирать данные?
Так часто, как требует задача и позволяет источник. Цены и наличие обычно собирают ежедневно, метаданные страниц раз в неделю или после релиза, проверку ссылок в пределах лимитов API индекса. Частоту мы задаём для каждого источника отдельно и записываем в документацию.
Расскажите о проекте
Заполните то, что уже знаете. Пустые поля не страшны: остальное уточним в разговоре.
Бриф отправлен
Спасибо. Ответим в течение одного рабочего дня.
Режим предпросмотра: обработчик формы ещё не подключён, данные никуда не отправлены.