Парсинг и сбор данных
Автоматический сбор данных из открытых источников: цены конкурентов, товарные каталоги, объявления, отзывы. На выходе таблица, база или API, которые обновляются по расписанию, вместо сотрудника с копипастом на полдня. Работаем только с открытыми данными и сразу говорим, если источник собрать нельзя или не стоит. Парсер живёт ровно столько, сколько не меняется сайт-источник, поэтому мы закладываем проверку на пустой результат и уведомление, когда данные перестали приходить. Молчаливо сломавшийся сбор данных хуже, чем его отсутствие.
смета и план - бесплатно, цена фиксируется до старта
- Свежие данные каждый день без ручного труда.
- Мониторинг конкурентов: цены и ассортимент под контролем.
- Данные в удобном виде: Excel, Google-таблица, база или API для ваших систем.
Разбор источников и правовая оценка
Сборщик под конкретные сайты
Очистка и нормализация данных
Расписание обновлений
Выгрузка в нужном формате
Поддержка при изменении источников
Типовой сборщик занимает 2-7 дней. Собираем только открытые данные и объясняем ограничения честно - на этапе брифа, а не после.
Что влияет на цену
Цена зависит от числа источников, их защиты и регулярности. Разовый сбор с открытого сайта - недорого и быстро. Ежедневный мониторинг десятка источников с очисткой данных и API - уже сервис, который мы и построим, и будем поддерживать.
Рабочий пример: сборщик вакансий со стен ВКонтакте с очисткой текста, фильтрами по стоп-словам и автопубликацией в городские Telegram-каналы.
Сколько стоит заказать парсер?
Разовый сбор с открытого сайта начинается от 7 000 ₽ и занимает два-три дня. Постоянный мониторинг с расписанием, очисткой и выгрузкой в вашу систему считается отдельно: это уже не скрипт, а сервис, который придётся чинить каждый раз, когда источник меняется. Точную цифру называем после того, как посмотрим сами источники. Два внешне похожих сайта отличаются по трудозатратам в разы.
Можно выгружать в Excel или сразу в базу данных?
Формат выбираете вы. Чаще всего просят Excel или Google-таблицу, потому что открыть их может кто угодно в компании. Если данные нужны не человеку, а вашей системе, пишем напрямую в базу или отдаём через API, и тогда выгрузки руками не нужны совсем. Один и тот же сборщик спокойно пишет сразу в оба места.
Соберёте каталог товаров или справочник организаций?
Это типовая для нас работа: каталоги с ценами и характеристиками, справочники организаций с контактами, объявления, отзывы. Но сначала мы смотрим, есть ли нужные поля в источнике вообще. Регулярно выясняется, что половины колонок, которые заказчик хочет видеть в таблице, на сайте просто нет. Лучше узнать это до оплаты, чем после.
А если сайт закрыт капчей и данные не отдаёт?
Скажем прямо, что источник дорогой или что брать его не стоит. Обходить защиту любой ценой мы не беремся: такие сборщики ломаются чуть ли не каждую неделю и в итоге обходятся дороже, чем стоят сами данные. Обычно находится путь проще - официальная выгрузка, открытый API или другой сайт с теми же сведениями.
Законно ли собирать чужие данные?
Мы работаем только с открытыми данными, теми, что сайт показывает любому посетителю без входа в личный кабинет. Персональные данные и содержимое закрытых разделов не трогаем. Если задача выходит за эти рамки, говорим об этом на брифе, а не после подписания.
Сайт-источник поменялся и парсер сломался. Что тогда?
Это нормальная жизнь парсеров. Берём на поддержку: чиним по факту изменений, обычно в течение дня. Поэтому в каждый сборщик закладываем проверку на пустой результат и уведомление - молчаливо сломавшийся сбор данных хуже, чем его отсутствие.