В первой половине 2026 года бот ChatGPT-User чаще других отслеживаемых ботов обращался к страницам, запрещённым для него в файле robots.txt. Согласно данным платформы TollBit, такие обращения составили 54% от всех зафиксированных случаев для европейских сайтов. Это был самый высокий показатель среди ботов в выборке: у Bytespider он составил 48%, у PerplexityBot — 42%. В целом, по данным TollBit, около 15% обращений ИИ-ботов на европейских и североамериканских сайтах приходились на страницы с явным запретом в robots.txt.
Важно отметить, что речь идёт не о всех сайтах в интернете, а о трафике, который TollBit наблюдала в своей сети. Компания определяет успешный обход как запрос к URL, который издатель явно запретил соответствующему боту. Таким образом, статистика фиксирует факты обращения к запрещённым страницам, но не устанавливает причины каждого запроса и не исключает возможность подмены user-agent.
Согласно документации OpenAI, ChatGPT-User может обращаться к страницам, когда пользователь задаёт вопрос, требующий получения содержимого страницы. OpenAI уточняет, что этот агент не предназначен для автоматического обхода, и что правила robots.txt могут не применяться из-за инициирования запроса пользователем. Это отличается от OAI-SearchBot, который определяет возможность использования содержимого в ответах поиска ChatGPT, и GPTBot, который предназначен для обхода страниц, используемых для совершенствования базовых моделей.
Таким образом, файл robots.txt не является технической защитой страницы от получения содержимого. Он предоставляет автоматизированным агентам указания издателя, но не запрещает серверу отдавать файл по запросу. Если ресурс действительно не должен быть доступен внешнему агенту, необходимы более строгие механизмы контроля доступа, такие как аутентификация, авторизация, сетевые правила или блокировка на уровне сервера. Это подчеркивает необходимость для команд, управляющих веб-ресурсами, отдельно контролировать видимость сайта для поисковых и ИИ-сервисов, а также фактический доступ к данным.