Anthropic за год обработала 133 миллиона чатов без фильтров биооружия

Добавь сайт в закладки! Инструкция по ссылке.

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Флаг, созданный исключительно для внутреннего пользования, одновременно отключил защиту от опасного контента и логирование. Компания обнаружила это только в апреле 2026 года

14 августа Anthropic выпустила новый Risk Report, охватывающий период до 15 июля 2026 года. В данном документе содержится 2 шокирующие детали, каждая из которых в одиночку могла бы вызвать общественный резонанс, но вместе они рисуют картину системного провала в контроле опасного контента.

Первая деталь: с мая 2025 по апрель 2026 года — на протяжении одиннадцати месяцев — классификаторы, предотвращающие помощь в создании биологического оружия, не функционировали на платформах, собирающих человеческую обратную связь. Через эти платформы прошло около 50 000 проверенных подрядчиков и 133 миллиона диалогов. Вторая деталь: в апреле 2026 года компания получила сигнал о том, что несколько подрядчиков обнаружили уязвимость и получили API-ключ к моделям, включая Mythos Preview — одну из самых мощных на тот момент. Модель функционировала без био-классификаторов примерно две недели.

Механизм сбоя описан в разделе 4 отчета. Внутренний флаг, предусмотренный исключительно для сотрудников Anthropic, отключал как блокирующее поведение классификаторов, так и логирование. Трафик под данным флагом не записывался и не попадал в какие-либо системы мониторинга. Найти его можно было лишь, вернувшись к сырым транскриптам.

Изображение сгенерировано: Nano Banana

После выявления проблемы Anthropic проверила Claude Sonnet 5 на всех диалогах затронутого периода и обнаружила 1197 подозрительных транскриптов, из которых 757 принадлежали её собственным командам, а 62 были тщательно проанализированы. Явных злонамеренных действий не выявлено. Тем не менее, сама компания признаёт: «это открытие заставляет нас думать, что вероятность других, неизвестных нам проблем возросла».

Ещё один момент: февральский Risk Report, опубликованный, когда данная проблема ещё существовала, не рассматривал платформы обратной связи как источник риска. Теперь, задним числом, Anthropic повысила оценку угрозы от несоответствия в критических сценариях с «очень низкой» до «низкой».

Параллельно компания снизила порог срабатывания для биологического оружия: ранее он охватывал модели, которые «значительно помогают злоумышленникам», теперь — только те, что «функционально заменяют недостаток человеческой экспертизы». Самая необычная часть отчета — это рецензия, написанная Mythos 5, которому предоставили доступ к внутренним документам и попросили оценить честность отчета. Модель охарактеризовала его как «в основном откровенный», но указала на 3 проблемы: одна секция «более успокаивающая, чем позволяет полная запись, механизм исключения данных многократно давал сбои, а самый информативный инцидент был полностью исключён, что обедняет публичную запись». Anthropic признала критику обоснованной и опубликовала её.

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка