Задача
Стартапу нужен был как можно более полный список информационных сайтов в зоне .co.uk — блогов, новостных и других контентных площадок — как основа для обучающего корпуса. Ценность была именно в полноте и чистоте: собрать все информационные площадки и при этом не затащить в список коммерческие сайты и мусорные домены.
Что делали и какие данные собирали
Мы прошли доменную зону, отобрали живые площадки и по каждой собрали признаки информационного сайта: структуру разделов, наличие лент и RSS, периодичность публикаций и тематику. Обязательным условием попадания сайта в список было соответствие английскому языку — иноязычные площадки в зоне мы отсекали. Новостную часть дополнительно сверяли с базой Google News — так подтверждали и добирали СМИ, которые точно относятся к новостным.
Дальше пошли от обратного — не только искали «наши» сайты, но и активно вычищали лишнее:
- убрали из списка сайты компаний, которые есть на Google Maps по ненужным нам категориям (магазины, услуги, общепит и т.п.) — так отсеяли коммерческие площадки, которые по структуре могли бы сойти за информационный сайт;
- отфильтровали сайты с нулевым рейтингом по SEO-сервисам — там с высокой вероятностью мусор или заброшенные домены.
Помимо самого реестра доменов (с типом — блог / новости), мы собирали и HTML-страницы этих площадок для корпуса.
Сложности и как решали
Первое — полнота зоны: публичного полного списка нет. Мы собирали перечень из нескольких источников и сверяли с базой Google News, чтобы закрыть пробелы по новостной части.
Второе, ключевое — отделить информационные сайты от коммерческих. Положительных признаков «это блог или СМИ» на таком масштабе мало, поэтому мы пошли от обратного и вычитали заведомо коммерческие домены через сопоставление с Google Maps: если домен принадлежит бизнесу из ненужной категории — это не наша площадка.
Третье — мусор и заброшенные сайты. Их отсекали по нулевому рейтингу в SEO-сервисах, чтобы в корпус не попадал шум.
Результат
Стартап получил и чистый реестр информационных доменов зоны (блоги и новостные, без коммерции и мусора), и сам контент — массив HTML-страниц, сжатых в gzip и сложенных в объектное хранилище S3-типа, к которому мы предоставили доступ. То есть на выходе готовый корпус, а не просто список сайтов.
Услуги в кейсе: База доменных имён · Парсинг новостей · База СМИ · Парсинг Google Maps · Данные для AI/ML · DaaS и данные по API
Полезные материалы: Парсинг RSS · Парсинг структуры сайта · Как собрать данные с сайтов