Роботы "съели" интернет, пока мы спали - и это не фигура речи
Иногда кажется, что разговоры о нашествии ботов - привычная страшилка для админов. Но свежая реальность выглядит куда жестче: на некоторых проектах люди стали статистической погрешностью. Разработчик благотворительной базы PatronView однажды заглянул в аналитику и увидел картину, от которой трудно отмахнуться: из 1,28 миллиона отданных страниц живые посетители открыли меньше шести тысяч. То есть примерно 99% аудитории - не люди. Не "подозрительный трафик", не "серые визиты", а буквальные автоматические загрузки, которые не превращаются ни в чтение, ни в пользу, ни в деньги.
Чтобы описать происходящее, он вывел простую, почти издевательскую формулу: на одну страницу, которую реально увидел человек, приходится еще около 214 загрузок, которые не увидит никто - вообще никто. И это уже не исключение, а новая "норма" открытого веба: декорации поменялись, просто не все успели поднять голову.
Если разложить эту армию по типам, то на сайты сегодня приходят как минимум четыре разные "породы" автоматических гостей. Во‑первых, относительно честные SEO‑краулеры вроде SemrushBot и AhrefsBot: они обычно не скрываются, обозначаются в User‑Agent и ползут, чтобы индексировать конкурентов. Во‑вторых, боты, которые учат модели (GPTBot, ClaudeBot): они могут прийти один раз, но выкачать все, до чего дотянулись. Дальше - тяжелая артиллерия: поисковые ИИ‑краулеры (Claude-SearchBot, Amzn-SearchBot) и агентные боты, которые шарят по сети "на лету" под чей‑то промпт. Именно эта пара превращает спокойный проект в горячую точку.
В апреле у PatronView случился настоящий шторм: 3,6 млн запросов за день от 361 844 уникальных IP, в основном из Китая. Cloudflare с управляемым чекпоинтом успел "съесть" 1,18 млн запросов за десять часов, но неприятный процент автоматов все же проходил капчу. И тогда сработало решение, которое обычно считают неприличным - но оно спасло сервис: бан целой страны на уровне edge. Потом - Вьетнам, затем Сингапур. Проект про американских меценатов, и 95,9% аудитории у него из США; в таких условиях "вычеркивание регионов" стало прагматикой. Получилась почти гротескная ситуация: чтобы не кормить ботов, обучающих Qwen3.8 Max, приходится буквально резать интернет по географии.
В обсуждениях всплыла еще более тревожная деталь: злоумышленники все чаще используют тысячи "жилых" IP, отдавая по одному запросу с каждого. Для классических фильтров это кошмар - нет привычного "шквала" с пары подсетей, нет очевидного отпечатка. Именно поэтому сегодня обнаружение и фильтрация бот трафика превращаются не в разовую настройку, а в постоянную гонку адаптаций.
Главная метрика в этой войне - даже не абсолютное число запросов, а перекос "сколько страниц бот скачивает на одного посетителя, которого он возвращает обратно". Раньше это было похоже на честную сделку открытого веба: поисковик читает сайт - и взамен присылает читателей. Теперь все чаще выглядит так, будто одна сторона забрала товар и ушла, не оставив ничего на прилавке.
Cloudflare отмечала, что краулеры Anthropic могут делать около 3000 обходов на одного приведенного посетителя. Но у автора PatronView в июне получилось еще мрачнее: 35000 к 1. Это не абстракция: за неделю Claude-SearchBot запросил 420 680 страниц, а Claude-User (когда человек просит Клода что-то найти) привел 12 человек. Двенадцать - за неделю. Ирония двойная: PatronView собирали на Claude Code, и автор использовал Клода, чтобы настроить защиту от Клода же. В итоге Claude-SearchBot заблокировали - и он "успокоился" с 60 тысяч запросов в день до примерно 25 попыток. С Amazon‑ботом, который кормит Rufus и Alexa (117 тысяч запросов в день и ноль людей в ответ), поступили аналогично.
Похожую картину - но на еще более показательной шкале - описал Брюс Нэш, основатель киношной базы The Numbers. По его данным, Google в среднем обходит порядка пяти страниц на посетителя (в зависимости от среза встречались и иные соотношения), OpenAI - больше тысячи, а Anthropic - свыше 38 тысяч. В таблицах пропорции плавают от сайта к сайту, но тренд везде одинаковый: ИИ‑краулеры потребляют на порядки больше, чем возвращают.
История The Numbers - не "сухая статистика", а кейс с реальными потерями. Нэш, математик и бывший разработчик IBM, запустил проект еще в 1997 году на Geocities, когда база охватывала около 300 фильмов. К 2026‑му разрослись масштабы: 78 396 фильмов и 236 176 персон. А статус "источника истины" для рынков предсказаний вроде Polymarket сделал ресурс особенно вкусной целью. 5 марта 2026 года сайт исчез. Неделю простоял офлайн, потом вернулся заметно "обрезанным". В логах, помимо привычного скрейпинга, нашли более прицельные попытки: кто‑то явно искал бэкдоры - вероятно, чтобы узнавать кассовые сборы раньше публикации и получать преимущество на рынках предсказаний. Поднимать старый 30‑летний сервер с ~160 тысячами legacy‑файлов не стали: слишком велик риск уронить снова в первые же минуты. К 13 марта команда с нуля подняла урезанную версию на новой инфраструктуре.
На практике это все упирается в то, что защита сайта от ботов перестала быть "дополнительной опцией" и стала базовой частью эксплуатации - как резервные копии или мониторинг. Причем одна лишь капча уже не выглядит универсальным ответом: ее научились проходить, обходить, размывать распределенным трафиком и "жилыми" IP.
Поэтому все чаще обсуждают комбинированный подход: поведенческие сигналы, лимиты на уровне edge, строгую сегментацию по маршрутам и различную политику для контента и для API. Там, где ставки высоки, подключают и WAF для защиты сайта от ботов, и отдельные правила против агентов, которые обходят сайт не как поисковик, а как "пульт управления руками": быстро, хаотично, с попытками вытащить максимум за минимум времени.
Отдельная боль - контент, который воруют массово и методично. Здесь нужна не только общая антибот‑логика, но и антискрейпинг защита сайта: замедление выборочных паттернов, ловушки для парсеров, динамические ответы, "медовые" URL, контроль глубины и частоты, защита карточек и выдач. В некоторых командах уже нормой стало иметь отдельные контурные правила именно под скрейпинг и именно под ИИ‑краулеры, потому что их "аппетит" качественно другой.
Экономика тоже меняется. Раньше трафик от индексации был частью сделки, теперь владельцы сайтов все чаще считают входящий поток "вредной нагрузкой" и пересматривают доступность. На этом фоне запрос "антибот система для сайта купить" звучит не как прихоть, а как попытка удержать расходы на инфраструктуру и не позволить ботам съедать бюджет, предназначенный для людей.
Если хотите разобраться, почему "обходы ради обучения" и "поисковые ИИ‑краулеры" стали главными пожирателями ресурсов, и как современные проекты выстраивают оборону, полезно посмотреть разбор про защиту сайта от ботов и фильтрацию бот‑трафика - он хорошо укладывается в эту новую логику: не "отловить пару подозрительных IP", а выстроить систему, которая выдержит миллионы запросов от распределенных сетей.
И главный вывод здесь даже не в цифрах. Он в том, что "открытый веб" больше не гарантирует честный обмен: ты публикуешь - и к тебе приходят люди. Теперь ты публикуешь - и к тебе в первую очередь приходит автоматизированный потребитель, который не читает, не платит, не возвращает аудиторию и еще может быть частью атаки. Значит, правила выживания меняются: сайты будут закрывать часть контента, ограничивать выдачу, усиливать барьеры и жестче выбирать, кого пускать. И чем раньше это признать, тем больше шансов, что интернет останется местом для людей - а не только столовой для роботов.
