Вопрос про накрутку поведенческих факторов задают почти на каждом разборе: идёт ли она на сайт, льют ли её конкуренты, что из трафика вообще живое. Платные инструменты разметки роботности доступны не всем, а в открытом доступе по теме в основном пересказы слухов. Мы собрали метод, который работает на обычных данных сайта, и проверили его на окне, где источник трафика был известен заранее.
Почему счётчик не отвечает на этот вопрос
Счётчик показывает визиты, а не природу визитов. Метка роботности есть только в платной версии аналитики, и на большинстве счётчиков она недоступна. Отсюда типичная ошибка: владелец сайта смотрит на ровный график посещаемости и делает вывод «всё в порядке», хотя половина этого графика может не быть людьми.
Метод. Разметку добываем вычитанием: сопоставляем то, что видит поисковая система, с тем, что зафиксировал приёмник на самом сайте. Расхождение между двумя независимыми источниками и есть искомый сигнал — сессия была, а визита в аналитике за то же время нет.
Три признака, которые выдерживают проверку
- Поведение без глубины. Заход есть, а внутренней траектории нет: ни прокрутки, ни переходов, ни возврата. Мы выделили три отдельных класса такого поведения — они выглядят одинаково в сводке, но имеют разное происхождение, и лечатся по-разному.
- Расхождение двух источников. Поисковая система видит переход, приёмник на сайте — нет, или наоборот. Устойчивое расхождение на конкретной площадке — самый надёжный из трёх признаков.
- Несовпадение браузера с самим собой. То, чем посетитель представляется в заголовке запроса, и то, что о себе сообщает его же браузер при отрисовке страницы, должны совпадать. У автоматизированного трафика они расходятся регулярно.
Отдельным шагом отсекаются настоящие поисковые роботы: принадлежность робота поисковой системе проверяется по обратной записи в системе доменных имён, а не по названию, которым он представился. Без этой проверки полезные роботы попадают в отчёт как атака.
Как проверяли, что метод не врёт
Метод обкатан на контролируемом окне: было заранее известно, в какие часы через сайт шёл заведомо неорганический трафик и какого он объёма. Дальше проверялось, ловит ли его метод вслепую и не помечает ли живых посетителей.
Неудобная находка
Первая версия метода завышала долю подозрительного трафика до 94 % — то есть почти весь трафик сайта выглядел как автоматизированный. Причина оказалась в самом инструменте: сессии без данных схлопывались в один общий отпечаток и слипались в гигантский «кластер», которого в реальности не существовало. Это тот случай, когда красивый и пугающий результат означает ошибку в измерении, а не находку. После правки цифра стала на порядок скромнее и правдоподобнее.
Что это даёт
Возможность посмотреть на свой трафик и ответить, есть ли в нём мусор, без покупки отдельных сервисов. И, что важнее, возможность не принимать чужую активность за собственный рост.
