DaaS Промышленная группа

Создание кастомного XML-фида, объединяющего несколько десятков источников

Собрали данные из десятков разных источников в один валидный XML-фид с регулярным обновлением.

Задача

У группы данные были разбросаны по нескольким десяткам источников — сайты, выгрузки, разные форматы и структуры. Нужен был один регулярно обновляемый XML-фид единого формата, который можно отдать в смежные системы без ручной пересборки.

Что делали и какие данные собирали

Мы собрали данные из всех источников — сайтов, файлов и выгрузок разных форматов — и привели их к единой схеме. Поверх настроили сборку итогового XML-фида с валидацией и регулярным обновлением, а доставку организовали как DaaS / данные по API.

Сложности и как решали

Главная сложность — разнородность. Несколько десятков источников — это десятки структур: где-то JSON, где-то таблицы и CSV, где-то документы, где-то только веб-страницы. Мы описали единую целевую схему и сопоставили с ней каждый источник.

Вторая — актуальность. Источники обновляются по-разному, поэтому сбор шёл по расписанию, а изменения подхватывались автоматически.

Третья — корректность фида. Итоговый XML мы валидировали по структуре перед публикацией и убирали дубли, чтобы потребители фида не получали битые или задвоенные записи.

Результат

Группа получила единый XML-фид, собираемый из десятков источников автоматически и по расписанию, — вместо ручного сведения разрозненных выгрузок.


Услуги в кейсе: DaaS и данные по API · Парсинг сайтов · Мониторинг изменений на сайтах и в данных

Полезные материалы: Парсинг XML · Парсинг JSON · Парсинг документов · Нормализация данных