🤖 ChatGPT-User игнорирует robots.txt на 54% страниц: почему это легально и как защититься
Исследование платформы TollBit показало, что в первой половине 2026 года агент ChatGPT-User обращался к страницам, закрытым через robots.txt, в 54% случаев. Это самый высокий показатель среди отслеживаемых ИИ-ботов в Европе. OpenAI подтверждает: этот агент создан для ответов на запросы пользователей, поэтому правила индексации к нему могут не применяться. Эксперты напоминают: robots.txt — это рекомендация, а не технический барьер.
⚙ СТАТИСТИКА И ПРИРОДА АГЕНТА Данные TollBit касаются трафика в собственной сети компании, но выявляют системную проблему:
- Сравнение с конкурентами: Показатель ChatGPT-User (54%) выше, чем у Bytespider (48%) и PerplexityBot (42%). В среднем по выборке около 15% запросов ИИ-ботов приходятся на запрещенные страницы.
- Специфика ChatGPT-User: В отличие от GPTBot (для обучения моделей) или OAI-SearchBot (для поиска), этот агент активируется вручную пользователем. OpenAI прямо указывает, что из-за пользовательского триггера robots.txt может игнорироваться.
- Ограничения данных: Статистика фиксирует факт обращения, но не всегда может отличить реальный обход от подмены User-Agent или технических ошибок.
🛡 ТЕХНИЧЕСКИЕ РЕАЛИИ ЗАЩИТЫ КОНТЕНТА Для владельцев сайтов это сигнал о необходимости пересмотра стратегии безопасности:
- Robots.txt ≠ Защита: Файл лишь передает рекомендации. Сервер обязан отдать контент по прямому запросу, если нет иных ограничений. Доверять ему как средству защиты нельзя.
- Реальные меры контроля: Для предотвращения доступа необходимы серверные механизмы: аутентификация, авторизация, IP-блокировки, WAF или CAPTCHA.
- Разделение потоков: Командам веб-ресурсов нужно отдельно настраивать видимость для поисковиков (SEO) и фактический доступ для ИИ-агентов. То, что разрешено Google, может быть запрещено для генерации ответов в чате.
#ИИ #ChatGPT #OpenAI #веббезопасность #robots.txt #контент #технологии