Задача
Агентству нужно было находить трастовые домены среди освобождающихся (дропающихся) — с хорошими показателями, приличным возрастом и чистой историей, чтобы затем перехватывать и использовать их. Списки дропов разбросаны по десяткам площадок, форматы разные, а объёмы огромные — вручную это не охватить.
Что делали и какие данные собирали
Мы собрали список площадок, которые публикуют списки экспайред- и дроп-доменов — GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk и другие — и наладили регулярный сбор их выгрузок в единый поток.
Дальше — обогащение. Привели даты дропа к единому времени, чтобы понимать, когда домен реально освобождается. Добрали показатели через API Ahrefs и Moz (авторитетность и ссылочный профиль), подтянули WHOIS для возраста и истории регистрации, а по интересующим доменам добрали данные из веб-архива — посмотреть, что на домене размещалось раньше и на каком языке был сайт. Поверх сделали интерфейс, в котором аналитики агентства проводят финальный ручной скоринг по уже собранным и обогащённым кандидатам.
Работа строилась как поиск и обогащение данных поверх базы доменных имён, с доставкой в удобный интерфейс/выгрузку (DaaS).
Сложности и как решали
Главная сложность — масштаб. Ежедневно дропаются сотни тысяч доменов, и прогонять по всем полный набор проверок нецелесообразно. Мы выстроили конвейер: сначала собираем и дедуплицируем дроп-листы, затем обогащаем метриками, а дорогие шаги (веб-архив) добираем только по интересующим доменам, прошедшим первичный отбор. Прогон идёт ежедневно.
Вторая — разнородность источников. У каждой площадки свой формат списка и своя подача даты и времени дропа. Мы свели всё к единой схеме и единому времени; про приведение к общему виду — в материале про нормализацию данных.
Третья, ключевая — отсеять домены с «грязным» прошлым: те, что уже когда-то дропались и на них размещали спам. По метрикам такой домен может выглядеть привлекательно, но реально он испорчен. Мы смотрели историю через веб-архив и признаки прошлых дропов, чтобы такие кандидаты не проходили дальше. Здесь пригодилась и работа с внешними API (Ahrefs, Moz, WHOIS) для быстрого обогащения.
Отдельно отмечу: защит от сбора на этих площадках нет — задача была не про обход блокировок, а про масштаб и качество данных.
Результат
Агентство получило единый ежедневный поток дроп-доменов, обогащённый показателями, возрастом и историей, с интерфейсом для ручного скоринга — оценка кандидатов идёт в одном месте вместо ручного обхода десятков площадок и ручной сверки метрик.
Услуги в кейсе: Поиск и обогащение данных · База доменных имён · DaaS и данные по API · Данные для SEO и поиска
Полезные материалы: Обогащение данных · Нормализация данных · Парсинг API