AI/ML AI-стартап

Индексация всех информационных сайтов в национальной зоне .co.uk

Собрали чистый перечень информационных площадок зоны — блогов и новостных сайтов — и сам их контент: массив HTML-страниц в объектном хранилище S3-типа, к которому дали доступ клиенту.

Задача

Стартапу нужен был как можно более полный список информационных сайтов в зоне .co.uk — блогов, новостных и других контентных площадок — как основа для обучающего корпуса. Ценность была именно в полноте и чистоте: собрать все информационные площадки и при этом не затащить в список коммерческие сайты и мусорные домены.

Что делали и какие данные собирали

Мы прошли доменную зону, отобрали живые площадки и по каждой собрали признаки информационного сайта: структуру разделов, наличие лент и RSS, периодичность публикаций и тематику. Обязательным условием попадания сайта в список было соответствие английскому языку — иноязычные площадки в зоне мы отсекали. Новостную часть дополнительно сверяли с базой Google News — так подтверждали и добирали СМИ, которые точно относятся к новостным.

Дальше пошли от обратного — не только искали «наши» сайты, но и активно вычищали лишнее:

  • убрали из списка сайты компаний, которые есть на Google Maps по ненужным нам категориям (магазины, услуги, общепит и т.п.) — так отсеяли коммерческие площадки, которые по структуре могли бы сойти за информационный сайт;
  • отфильтровали сайты с нулевым рейтингом по SEO-сервисам — там с высокой вероятностью мусор или заброшенные домены.

Помимо самого реестра доменов (с типом — блог / новости), мы собирали и HTML-страницы этих площадок для корпуса.

Сложности и как решали

Первое — полнота зоны: публичного полного списка нет. Мы собирали перечень из нескольких источников и сверяли с базой Google News, чтобы закрыть пробелы по новостной части.

Второе, ключевое — отделить информационные сайты от коммерческих. Положительных признаков «это блог или СМИ» на таком масштабе мало, поэтому мы пошли от обратного и вычитали заведомо коммерческие домены через сопоставление с Google Maps: если домен принадлежит бизнесу из ненужной категории — это не наша площадка.

Третье — мусор и заброшенные сайты. Их отсекали по нулевому рейтингу в SEO-сервисах, чтобы в корпус не попадал шум.

Результат

Стартап получил и чистый реестр информационных доменов зоны (блоги и новостные, без коммерции и мусора), и сам контент — массив HTML-страниц, сжатых в gzip и сложенных в объектное хранилище S3-типа, к которому мы предоставили доступ. То есть на выходе готовый корпус, а не просто список сайтов.


Услуги в кейсе: База доменных имён · Парсинг новостей · База СМИ · Парсинг Google Maps · Данные для AI/ML · DaaS и данные по API

Полезные материалы: Парсинг RSS · Парсинг структуры сайта · Как собрать данные с сайтов