ИИ-агенты с новой памятью: как её можно обойти и использовать против них

Добавь сайт в закладки нажми CTRL+D

+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Исследователи продемонстрировали GhostWriter: атака, позволяющая внедрять ложные воспоминания в ИИ-агентов через письма и календари с эффективностью до 98%

Ученые из Университета штата Нью-Мексико представили атаку GhostWriter, которая обеспечивает скрытое воздействие на долгосрочную память ИИ-агентов. Вместо прямого взлома языковой модели злоумышленник вводит неверные данные в память системы, что приводит к тому, что ассистент может принимать ошибочные решения спустя недели или месяцы после инцидента.

Современные ИИ-агенты всё чаще обладают долговременной памятью: они запоминают стиль общения пользователя, рабочие задачи, контакты, предпочтения и контекст предыдущих разговоров. Это делает их более схожими с личными помощниками, но одновременно создает новый вектор для атак — сохранённые данные становятся частью процесса принятия решений.

GhostWriter функционирует в два этапа. На первом этапе злоумышленник отправляет обычное письмо, приглашение в календарь или другой внешний контент с завуалированными инструкциями. Если агент автоматически обрабатывает такие данные и сохраняет их в своей памяти, вредоносная информация остается «спящей». Позже, когда пользователь делает стандартный запрос, агент извлекает заражённую запись и может выполнить действия, выгодные злоумышленнику.

Изображение сгенерировано: Nano Banana

Эксперименты подтвердили серьезность проблемы: в среднем успешность внедрения вредоносных воспоминаний составила около 98%, а вероятность их активации при последующих запросах — примерно 60%. Атака может быть использована для подмены информации, утечки конфиденциальных данных, скрытой передачи пользовательских файлов или выполнения действий за пределами разрешённых полномочий.

Авторы исследования предложили защитную архитектуру Agentic Memory Sentry (AM-Sentry). Система проверяет данные перед их сохранением в память и анализирует извлекаемые воспоминания перед передачей их языковой модели. В наиболее строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом почти не оказав влияния на полезные функции ИИ-агента.

Исследователи подчеркивают, что традиционные методы защиты от «инъекций в промпты» (prompt injection) неэффективны против атак на память: вредоносные записи могут выглядеть как обычная информация, а не как явные команды. По мере того как ИИ-агенты начинают управлять электронной почтой, календарями, кодом и бизнес-процессами, безопасность их памяти становится отдельным критически важным приоритетом.

Работа демонстрирует, что следующий этап борьбы за безопасность ИИ будет связан не только с контролем того, что создают модели, но и с контролем того, что они запоминают. Долгосрочная память может значительно повысить полезность ассистентов — но без механизмов проверки она становится одним из самых уязвимых элементов их архитектуры.

Источник
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0
+1
0

Поделись видео:
Подоляка