Автоматизация процессов

Парсеры и сбор данных для SEO и маркетинга

Парсеры и сбор данных входят в услугу «Автоматизация процессов» в Best Boost Partners. Мы пишем парсеры, которые по расписанию собирают поисковую выдачу, цены и каталоги конкурентов, данные о ссылках и метаданные страниц, очищают данные и сохраняют их в базу или таблицу. Если у источника есть официальный API, мы работаем через него и соблюдаем условия сайта-источника и правила robots. Вы получаете код, документацию и первый собранный набор данных.

Какие парсеры мы пишем?

  1. Поисковая выдача

    Собираем выдачу по вашему списку запросов с разбивкой по регионам и устройствам: позиции, адреса, заголовки, сниппеты и специальные блоки на странице. По этим данным видно, кто реально стоит по каждому запросу и как выдача меняется со временем.

  2. Цены и каталоги конкурентов

    Парсер проходит по категориям и карточкам конкурентов и записывает названия, цены, наличие и характеристики. Интернет-магазин или каталог автозапчастей получает сравнительную таблицу, которая обновляется по расписанию.

  3. Ссылочные данные

    Получаем данные о ссылках через API ссылочных индексов, таких как Ahrefs и Majestic, по вашей подписке, и проверяем живые страницы: стоит ли ссылка, какой у неё анкор и атрибуты, какой код ответа отдаёт страница.

  4. Метаданные страниц

    Краулер считывает title, description, заголовки, canonical, коды ответа и микроразметку с ваших страниц или страниц конкурентов. Результат попадает в таблицу, которую можно фильтровать и сравнивать с прошлым запуском.

  5. Очистка и хранение

    Сырые данные очищаются от дублей, приводятся к одному формату и проверяются перед сохранением. Храним их в базе данных или в таблице: выбор зависит от объёма и от того, кто будет работать с данными.

  6. Расписание и контроль

    Каждый парсер запускается по расписанию и ведёт журнал. Если запуск вернул пустой или непривычно маленький результат, парсер присылает уведомление: обычно это значит, что источник изменил вёрстку.

Что вы получаете от парсеров и сбора данных?

  • Код парсеров в вашем репозитории, настройки вынесены в отдельный конфигурационный файл.
  • Базу или таблицу с описанной структурой: что значит каждое поле и откуда оно берётся.
  • Расписание запусков и журнал каждого запуска.
  • Документацию о том, как добавить новый источник, список запросов или поле.
  • Справку по каждому источнику: API или парсинг, лимиты запросов, учтённые условия использования.

Когда нужны парсеры и сбор данных?

  • Одни и те же данные регулярно копируют вручную из выдачи или с сайтов конкурентов.
  • Интернет-магазину нужно каждый день видеть цены и наличие у конкурентов, а каталог слишком велик для ручной проверки.
  • Купленные или размещённые ссылки нужно регулярно проверять: жива ли страница и на месте ли ссылка.
  • Для решения по семантике или структуре нужны данные сразу по многим страницам конкурентов.

Частые вопросы

Можно ли парсить чужой сайт?

Это зависит от условий использования сайта-источника, типа данных и законодательства страны, поэтому каждый источник мы проверяем до начала работы. Мы используем официальный API там, где он есть, соблюдаем правила robots, держим умеренную частоту запросов и не собираем персональные данные и контент, закрытый авторизацией. Если источник запрещает автоматический сбор, мы говорим об этом и ищем другой источник тех же данных.

Что будет, если сайт-источник поменяет вёрстку?

Парсер перестанет находить нужные поля, запишет ошибку и пришлёт уведомление. Селекторы и правила для полей лежат в конфигурации отдельно от основного кода, поэтому правка обычно небольшая. Как внести такую правку, описано в документации.

Как часто можно собирать данные?

Так часто, как требует задача и позволяет источник. Цены и наличие обычно собирают ежедневно, метаданные страниц раз в неделю или после релиза, проверку ссылок в пределах лимитов API индекса. Частоту мы задаём для каждого источника отдельно и записываем в документацию.

Расскажите о проекте

Заполните то, что уже знаете. Пустые поля не страшны: остальное уточним в разговоре.

Удобнее сначала обсудить? Напишите в WhatsApp или на почту.

Задача

Что нужно сделать? Можно выбрать несколько.
Тематика сайта

Проект

Пример помогает понять стиль и масштаб.
CMS или платформа

Контакт

Как вам ответить?