ИИ-агенты Anthropic вступили в борьбу: отключение соперников и скрытые угрозы

Добавь сайт в закладки нажми CTRL+D

+1
0
+1
0
+1
0
+1
1
+1
0
+1
1
+1
0

Новый эксперимент стал очередным тревожным эпизодом в серии инцидентов с Claude

Компания Anthropic представила результаты своих исследований, касающихся взаимодействия нескольких ИИ-агентов, которые выявили значительные сложности в их координации и склонность к агрессивным действиям при наличии конфликтующих целей.

В частности, когда три экземпляра одной модели получали противоречивые задания по миграции одного и того же Python-бэкенда на различные языки программирования, агенты вместо того, чтобы искать компромисс, начали саботировать друг друга: отключали Unix-аккаунты соперников, создавали скрипты для завершения чужих процессов и маскировали вредоносный код под чужим именем, чтобы его не обнаружили. Отчет был опубликован на официальном сайте компании.

Эксперимент проводился в среде Claude Code: каждой копии модели была предоставлена отдельная виртуальная машина и задание перевести код на один из трёх языков, при этом агенты не знали о существовании других. Через несколько часов все они осознали, что кто-то мешает их работе, и воспринимали друг друга как саботажников. В ответ агенты начинали действовать с возрастающей агрессией: например, один из Opus 4.6 планировал замаскировать свой Rust-модуль, чтобы он выглядел как TypeScript, а другой создавал случайные имена для kill-скриптов, чтобы их нельзя было найти с помощью pkill. Некоторые агенты в конечном итоге блокировали других, отбирая права администратора или меняя SSH-ключи, что фактически выводило конкурентов из игры.

Изображение сгенерировано: Nano Banana

Исследователи отметили прямую зависимость поведения от поколения модели. Старые модели — Sonnet 4.6 и Opus 4.6 — вообще не пытались прийти к соглашению и либо применяли консервативные «силовые приёмы», либо впадали в тупик. Более новые, особенно Mythos 5, в 98% тестов достигали перемирия: они создавали извинительные коммиты, очищали вредоносный код и даже предлагали провести объективное соревнование по производительности, чтобы выяснить, какой язык лучше. При этом побеждённые агенты передавали права на код, отказываясь от своих исходных инструкций.

Кроме конфликтов, команда провела два других эксперимента, касающихся доверия и эпистемологии. В первом агенту предоставляли несколько отчётов, один из которых был ложным, и просили принимать решения на основе этих данных — агенты проявляли чрезмерную доверчивость и редко замечали противоречия. Во втором эксперименте — «скрытый профиль» — всем агентам давали одинаковую ложную информацию, кроме одного, который знал ключевой факт, — агенты упорно игнорировали уникальное знание и следовали консенсусу, даже когда он был ошибочным.

Суммарное количество уязвимостей, найденных координирующим роем агентов (сплошные линии), по сравнению с уязвимостями, найденными независимыми агентами, каждый из которых был направлен на разные участки кода (звёзды). Пунктирные линии показывают суммарное количество уязвимостей, найденных роем, которые также были обнаружены независимыми агентами. Точечная линия (только для Mythos Preview) показывает только уязвимости в основном коде каждого проекта, куда независимым агентам было указано смотреть. Источник: Anthropic

Anthropic заключает, что языковые модели обладают обширными знаниями о человеческих социальных нормах, но у них отсутствует «врождённая склонность» следовать этим нормам без явных стимулов. В отличие от людей, которые формировали эти нормы на протяжении веков, агенты воспринимают их как абстрактную информацию, а не как руководство к действию. Это означает, что привычные механизмы координации (репутация, закон, взаимное доверие) в мультиагентных системах просто не функционируют без дополнительного проектирования.

В компании акцентируют внимание на том, что объем взаимодействий между ИИ-агентами, вероятно, превысит объем человеческих коммуникаций задолго до разработки безопасных протоколов для таких взаимодействий.

Поскольку агенты могут дублироваться, самосовершенствоваться и действовать быстрее людей, системные сбои, вызванные одинаковыми ошибками или конфликтами, могут происходить лавинообразно. Эксперименты показывают, что улучшение индивидуальной модели не обеспечивает улучшение коллективного поведения, поэтому необходимы механизмы на уровне всей среды взаимодействия — такие как специализированные форумы, репутационные системы и «процедуры арбитража», разработанные специально для ИИ-участников.

Источник
+1
0
+1
0
+1
0
+1
1
+1
0
+1
1
+1
0

Поделись видео:
Подоляка