Добавь сайт в закладки нажми CTRL+D
Исследователи продемонстрировали GhostWriter: атака, позволяющая внедрять ложные воспоминания в ИИ-агентов через письма и календари с эффективностью до 98%
Ученые из Университета штата Нью-Мексико представили атаку GhostWriter, которая обеспечивает скрытое воздействие на долгосрочную память ИИ-агентов. Вместо прямого взлома языковой модели злоумышленник вводит неверные данные в память системы, что приводит к тому, что ассистент может принимать ошибочные решения спустя недели или месяцы после инцидента.
Современные ИИ-агенты всё чаще обладают долговременной памятью: они запоминают стиль общения пользователя, рабочие задачи, контакты, предпочтения и контекст предыдущих разговоров. Это делает их более схожими с личными помощниками, но одновременно создает новый вектор для атак — сохранённые данные становятся частью процесса принятия решений.
GhostWriter функционирует в два этапа. На первом этапе злоумышленник отправляет обычное письмо, приглашение в календарь или другой внешний контент с завуалированными инструкциями. Если агент автоматически обрабатывает такие данные и сохраняет их в своей памяти, вредоносная информация остается «спящей». Позже, когда пользователь делает стандартный запрос, агент извлекает заражённую запись и может выполнить действия, выгодные злоумышленнику.

Эксперименты подтвердили серьезность проблемы: в среднем успешность внедрения вредоносных воспоминаний составила около 98%, а вероятность их активации при последующих запросах — примерно 60%. Атака может быть использована для подмены информации, утечки конфиденциальных данных, скрытой передачи пользовательских файлов или выполнения действий за пределами разрешённых полномочий.
Авторы исследования предложили защитную архитектуру Agentic Memory Sentry (AM-Sentry). Система проверяет данные перед их сохранением в память и анализирует извлекаемые воспоминания перед передачей их языковой модели. В наиболее строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом почти не оказав влияния на полезные функции ИИ-агента.
Исследователи подчеркивают, что традиционные методы защиты от «инъекций в промпты» (prompt injection) неэффективны против атак на память: вредоносные записи могут выглядеть как обычная информация, а не как явные команды. По мере того как ИИ-агенты начинают управлять электронной почтой, календарями, кодом и бизнес-процессами, безопасность их памяти становится отдельным критически важным приоритетом.
Работа демонстрирует, что следующий этап борьбы за безопасность ИИ будет связан не только с контролем того, что создают модели, но и с контролем того, что они запоминают. Долгосрочная память может значительно повысить полезность ассистентов — но без механизмов проверки она становится одним из самых уязвимых элементов их архитектуры.
ИсточникПоделись видео:

