SEO SEO-агентство

Построение кастомной системы обнаружения трастовых доменов

Свели дроп-листы с десятков площадок в единый поток, обогатили метриками, возрастом и историей — агентство оценивает кандидатов в одном интерфейсе вместо обхода источников вручную.

Задача

Агентству нужно было находить трастовые домены среди освобождающихся (дропающихся) — с хорошими показателями, приличным возрастом и чистой историей, чтобы затем перехватывать и использовать их. Списки дропов разбросаны по десяткам площадок, форматы разные, а объёмы огромные — вручную это не охватить.

Что делали и какие данные собирали

Мы собрали список площадок, которые публикуют списки экспайред- и дроп-доменов — GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk и другие — и наладили регулярный сбор их выгрузок в единый поток.

Дальше — обогащение. Привели даты дропа к единому времени, чтобы понимать, когда домен реально освобождается. Добрали показатели через API Ahrefs и Moz (авторитетность и ссылочный профиль), подтянули WHOIS для возраста и истории регистрации, а по интересующим доменам добрали данные из веб-архива — посмотреть, что на домене размещалось раньше и на каком языке был сайт. Поверх сделали интерфейс, в котором аналитики агентства проводят финальный ручной скоринг по уже собранным и обогащённым кандидатам.

Работа строилась как поиск и обогащение данных поверх базы доменных имён, с доставкой в удобный интерфейс/выгрузку (DaaS).

Сложности и как решали

Главная сложность — масштаб. Ежедневно дропаются сотни тысяч доменов, и прогонять по всем полный набор проверок нецелесообразно. Мы выстроили конвейер: сначала собираем и дедуплицируем дроп-листы, затем обогащаем метриками, а дорогие шаги (веб-архив) добираем только по интересующим доменам, прошедшим первичный отбор. Прогон идёт ежедневно.

Вторая — разнородность источников. У каждой площадки свой формат списка и своя подача даты и времени дропа. Мы свели всё к единой схеме и единому времени; про приведение к общему виду — в материале про нормализацию данных.

Третья, ключевая — отсеять домены с «грязным» прошлым: те, что уже когда-то дропались и на них размещали спам. По метрикам такой домен может выглядеть привлекательно, но реально он испорчен. Мы смотрели историю через веб-архив и признаки прошлых дропов, чтобы такие кандидаты не проходили дальше. Здесь пригодилась и работа с внешними API (Ahrefs, Moz, WHOIS) для быстрого обогащения.

Отдельно отмечу: защит от сбора на этих площадках нет — задача была не про обход блокировок, а про масштаб и качество данных.

Результат

Агентство получило единый ежедневный поток дроп-доменов, обогащённый показателями, возрастом и историей, с интерфейсом для ручного скоринга — оценка кандидатов идёт в одном месте вместо ручного обхода десятков площадок и ручной сверки метрик.


Услуги в кейсе: Поиск и обогащение данных · База доменных имён · DaaS и данные по API · Данные для SEO и поиска

Полезные материалы: Обогащение данных · Нормализация данных · Парсинг API