Задача
У группы данные были разбросаны по нескольким десяткам источников — сайты, выгрузки, разные форматы и структуры. Нужен был один регулярно обновляемый XML-фид единого формата, который можно отдать в смежные системы без ручной пересборки.
Что делали и какие данные собирали
Мы собрали данные из всех источников — сайтов, файлов и выгрузок разных форматов — и привели их к единой схеме. Поверх настроили сборку итогового XML-фида с валидацией и регулярным обновлением, а доставку организовали как DaaS / данные по API.
Сложности и как решали
Главная сложность — разнородность. Несколько десятков источников — это десятки структур: где-то JSON, где-то таблицы и CSV, где-то документы, где-то только веб-страницы. Мы описали единую целевую схему и сопоставили с ней каждый источник.
Вторая — актуальность. Источники обновляются по-разному, поэтому сбор шёл по расписанию, а изменения подхватывались автоматически.
Третья — корректность фида. Итоговый XML мы валидировали по структуре перед публикацией и убирали дубли, чтобы потребители фида не получали битые или задвоенные записи.
Результат
Группа получила единый XML-фид, собираемый из десятков источников автоматически и по расписанию, — вместо ручного сведения разрозненных выгрузок.
Услуги в кейсе: DaaS и данные по API · Парсинг сайтов · Мониторинг изменений на сайтах и в данных
Полезные материалы: Парсинг XML · Парсинг JSON · Парсинг документов · Нормализация данных