Задача
Агентству нужна была объективная картина зарплат в IT — по специальностям, уровням, стеку и регионам — чтобы аргументировать вилки перед клиентами и кандидатами. Наём в компании идёт по разным рынкам, и при таких объёмах удобнее иметь собственный сводный аналитический инструмент, чем опираться на разрозненные внешние обзоры.
Что делали и какие данные собирали
Мы наладили регулярный сбор вакансий с нескольких площадок: должность, зарплатная вилка, уровень, стек, город, формат работы, дата публикации. Данные приводили к единым справочникам ролей и навыков и агрегировали в метрики (медианы и динамику). Готовый слой данных выгружался в дашборд для аналитиков агентства.
Сложности и как решали
Первое — зарплата часто не указана или задана диапазоном. Мы работали с вилками и заполняли пропуски оценками на основе схожих вакансий, честно помечая, где значение расчётное.
Второе — дубли: одна вакансия висит на нескольких площадках и в нескольких городах. Мы дедуплицировали объявления, чтобы не завышать объёмы и не искажать медианы.
Третье — разнобой в названиях ролей и стеке. Свели всё к единым справочникам, иначе «PHP-программист» и «Backend-разработчик (PHP)» считались бы как разные роли.
Результат
Агентство получило живой дашборд по зарплатам в IT с разрезами по ролям, стеку и городам и регулярным обновлением — вместо разовых устаревающих отчётов.
Услуги в кейсе: Парсинг вакансий · AI-обработка данных · Исследования рынков на реальных данных · DaaS и данные по API
Полезные материалы: Нормализация данных · Парсинг динамических сайтов