OpenAI предупреждает о 54% обходе robots.txt в ChatGPT

Добавь сайт в закладки нажми CTRL+D

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Среди европейских ресурсов ChatGPT-User чаще всего обращался к страницам, которым доступ запрещён в robots.txt

В первой половине 2026 года ChatGPT-User обращался к страницам, на которые ему был установлен запрет через robots.txt, в 54% зафиксированных случаев, как сообщает платформа TollBit. В выборке европейских сайтов это оказался наивысший показатель: у Bytespider он составил 48%, а у PerplexityBot — 42%. В целом, по европейским и североамериканским сайтам из выборки TollBit около 15% обращений ИИ-ботов приходилось на страницы с явным запретом в robots.txt.

При этом речь идёт не обо всех веб-сайтах в интернете, а о трафике, который TollBit фиксировала в своей сети. Компания рассматривает обход как успешный запрос к URL, который издатель явно запретил указанному боту. Таким образом, статистика демонстрирует факты обращения к запрещённым страницам, однако не устанавливает причины каждого запроса и не исключает возможность подмены user-agent.

Изображение сгенерировано: Nano Banana

Эта особенность связана с назначением ChatGPT-User. Согласно документации OpenAI, этот агент может обращаться к страницам, когда пользователь задаёт ChatGPT или пользовательскому GPT вопрос, требующий извлечения содержимого страницы. OpenAI также подчеркивает, что агент не предназначен для автоматического обхода, и что из-за инициирования запроса пользователем правила robots.txt могут не применяться. Это отличается от инструмента OAI-SearchBot, который определяет возможность использования содержимого в ответах поиска ChatGPT, и GPTBot, который предназначен для обхода страниц, которые могут быть использованы для улучшения базовых моделей.

Таким образом, robots.txt не является техническим барьером для защиты страницы от получения содержимого. Он предоставляет автоматизированным агентам инструкции от издателя, но не запрещает серверу выдавать файл по запросу. Если ресурс действительно не должен быть доступен внешнему агенту, необходимо внедрить технические механизмы контроля доступа — аутентификацию, авторизацию, сетевые правила или блокировку на уровне сервера. Для команд, управляющих веб-ресурсами, это означает необходимость отдельно контролировать видимость сайта для поисковых и ИИ-сервисов и фактический доступ к данным.

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка