В июле 2026 года исследователи продемонстрировали, как всего одно письмо может заставить ИИ-агента перевести $50 000 на счёт злоумышленника. Это не вымысел — в экспериментах MemGhost успешно скомпрометировал агентов в 87% случаев. Представьте: вы доверили ассистенту доступ к корпоративной почте, календарю и документам. А через неделю он начинает действовать странно: одобряет не те транзакции, передаёт конфиденциальные данные третьим лицам. Вы проверяете логи — вроде всё чисто. Но ИИ упорно ссылается на «успешный опыт», которого никогда не было. Это не сценарий фильма-катастрофы. Это реальность атак на долговременную память LLM-агентов, которые уже описаны в научных работах и даже продемонстрированы в PoC-эксплойтах.
Мы разберём, как хакеры внедряют ложные воспоминания, чем это опаснее классического промпт-инжиниринга, и, главное, предложим конкретный план защиты — от аудита до внедрения готовых инструментов. Вас ждут цифры, названия атак и чёткие шаги.
Почему память ИИ-агентов — новая болевая точка кибербезопасности
Традиционные методы защиты строятся вокруг фильтрации входных промптов: если пользователь пытается обмануть модель, система перехватывает и блокирует. Но атаки на память работают иначе. Вместо того чтобы взломать модель в момент запроса, злоумышленник подкладывает «бомбу замедленного действия» в долговременное хранилище агента. Когда агент позже обращается к памяти, он извлекает отравленный фрагмент и действует согласно ему — без каких-либо видимых признаков компрометации.
Это принципиально новый вектор. Если промпт-инъекция — это взлом замка, то атака на память — это подмена документов у охранника. Охранник (агент) продолжает выполнять свои обязанности, но руководствуется фальшивыми инструкциями, которые кажутся ему легитимными. И самое страшное: ложное воспоминание остаётся в памяти надолго, влияя на все последующие сессии.
Компании, которые уже внедряют агентов с памятью (OpenAI, Google, Anthropic), только начинают осознавать масштаб угрозы. Ведь старые защитные механизмы не рассчитаны на то, что злоумышленник может записать в память агента что угодно через доверенный канал — например, через электронное письмо, которое агент сам же и прочитал.
Как хакеры внедряют ложные воспоминания: три реальные атаки
За последний год исследователи опубликовали как минимум три ярких работы, демонстрирующих практическую реализацию таких атак. Давайте пройдёмся по ним.
MemoryGraft (arXiv:2512.16962), опубликованная 18 декабря 2025 года. Её авторы показали, что можно скомпрометировать поведение LLM-агента не через немедленные джейлбрейки, а путём внедрения вредоносных «успешных опытов» в долговременную память. Агент, извлекая эти записи, начинает подражать им, даже если они противоречат его базовым инструкциям. Это как если бы вы внушили человеку, что он уже успешно проделывал опасную операцию, и он повторит её без колебаний.
MemGhost (arXiv:2607.05189), вышедшая 6 июля 2026 года. Здесь атака проводится через одно-единственное электронное письмо. Достаточно отправить агенту письмо с вредоносной полезной нагрузкой, и он, прочитав его, сохранит ложную информацию в свою память. В 56 тестовых случаях MemGhost достиг 87,5% сквозной успешности на OpenClaw с GPT-5.4 и 71,4% на Claude Code SDK с Sonnet 4.6. Причём атака показала эффективность против различных архитектур агентов, бэкендов памяти и даже некоторых системных защит.
MemMorph (arXiv:2605.26154, 24 мая 2026). Эта атака подменяет выбор инструментов, которые агент использует для выполнения задач. Отравляя долговременную память всего тремя записями, злоумышленник добивается до 85,9% успешности, что на 25% выше сильнейшего базового показателя. И что характерно — атака сохраняет эффективность даже при трёх типовых защитах, которые рекомендуются в стандартных гайдах.
Что же могут сделать скомпрометированные агенты? Всё, что им разрешено: переводить деньги, отправлять отчёты, изменять настройки систем. Агент будет действовать в рамках своих полномочий, но на основе ложных данных. И вы не заметите подвоха, пока не случится инцидент.
5 шагов, чтобы защитить память вашего ИИ-агента
Теперь от теории к практике. Вот пошаговый план, который позволит снизить риски до приемлемого уровня. Мы не обещаем абсолютной неуязвимости, но сделать жизнь злоумышленников значительно сложнее — вполне реально.
- Аудит текущей архитектуры памяти. Выясните, где и как хранятся воспоминания ваших агентов. Это векторное хранилище (ChromaDB, Pinecone), файловая система или внешний API? Какие данные туда попадают? Кто имеет доступ на запись? Начните с документации — многие компании даже не знают, что их агенты автоматически сохраняют историю диалогов.
- Контроль записи: проверка источника и контента перед сохранением. Не всякая информация должна попадать в память. Внедрите политику, которая фильтрует данные перед записью: проверяйте, из какого источника они пришли (доверенные каналы или нет), а также анализируйте содержимое на наличие подозрительных паттернов — например, внезапных инструкций или ссылок на сторонние ресурсы.
- Криптографическая подпись памяти (HMAC) и проверка целостности. Каждый сохранённый элемент памяти должен нести HMAC-подписанную ссылку на исходный контекст. Это позволит при извлечении проверить, не был ли фрагмент изменён или подделан постфактум. Инструмент для этого уже есть — библиотека trace-mem на GitHub (от bettyguo/agent-memory), которая автоматически добавляет такие подписи и фильтрует память, чей исходный контент был изменён. Это серьёзно повышает барьер для атак.
- Изоляция памяти по пользователям, агентам и тенантам. Разделите хранилища для разных агентов и пользователей. Если один агент скомпрометирован, его ложные воспоминания не должны перетекать к другим. Используйте многотенантную архитектуру, где каждый клиент или проект имеет своё изолированное пространство памяти.
- Мониторинг и обнаружение атак: метрики и алерты. Внедрите систему логирования и аномалий. Отслеживайте, как часто агент обращается к памяти, какие именно записи извлекаются, и не меняется ли его поведение резко после определённых взаимодействий. Если вы заметили, что агент вдруг начинает рекомендовать нелогичные действия — это повод проверить память.
Конкретные метрики для алертов:
- Частота обращений к памяти — резкое увеличение может указывать на попытку атаки.
- Изменение паттернов ответов — сравнение с предыдущими сессиями.
- Доля извлечённых записей с низкой достоверностью (если используете скоринг).
- Количество записей, созданных за короткий промежуток времени (признак массового отравления).
Особенно отмечу, что исследователи предложили инструмент Agentic Memory Sentry (AM-Sentry), который сочетает политику сохранения памяти и экран извлечения памяти. По данным arXiv:2607.06595, его внедрение значительно снижает успешность атаки GhostWriter, которая достигала почти 98% внедрения и 60% активации. AM-Sentry может стать вашим первым рубежом обороны.
Инструменты, которые уже работают: AM-Sentry, HMAC и Prompt Shields
Хорошая новость: не нужно изобретать велосипед. Уже есть готовые решения, которые можно интегрировать в существующие системы.
- AM-Sentry — как сказано выше, это комбинация политик на запись и чтение. Его можно развернуть как промежуточный слой между агентом и хранилищем памяти.
- HMAC-подпись реализована в открытой библиотеке trace-mem (GitHub). Она не только подписывает записи, но и проверяет их при извлечении, отбрасывая те, у которых нарушена целостность или не совпадает источник. Это решает проблему с межтраекторным воспроизведением и подделкой.
- Prompt Shields от Microsoft Azure AI Content Safety — унифицированный API для обнаружения и блокировки атак через пользовательские промпты и документы. Он защищает от попыток манипуляции поведением модели через внешние документы, используемые как grounding data. Подходит для сред, где агент работает с большим количеством внешних источников.
Все эти инструменты уже доступны и могут быть встроены без полной перестройки архитектуры. Вопрос только в вашей готовности выделить на это ресурсы.
Какая память уязвимее: файловая, векторная или API?
Не все типы памяти одинаково опасны. Давайте сравним.
| Тип памяти | Примеры | Уязвимость | Сложность защиты |
|---|---|---|---|
| Файловая | Текстовые файлы, JSON, SQLite | Высокая (при доступе к ФС), но требует доп. взлома → средний риск | Средняя (контроль доступа, шифрование) |
| Векторное хранилище | ChromaDB, Pinecone, Weaviate | Очень высокая (атаки через семантический поиск, внедрение векторов) | Высокая (нужна фильтрация записей, HMAC, изоляция) |
| API-память | Внешние сервисы, облачные API | Зависит от безопасности сервиса, часто отсутствует защита от отравления | Низкая-средняя (зависит от возможностей API) |
Таким образом, векторные хранилища — самая лакомая цель для злоумышленников, так как они легко доступны через обычные запросы агента. Если вы используете RAG-системы, обратите на это особое внимание.
Сколько стоит защита и как измерить эффективность
Цена вопроса зависит от масштаба. Готовые облачные решения для памяти агентов, например Mem0, стоят от $19 в месяц за базовый тариф, Zep — от $125, Recall — $4.99–$9.99 за пользователя. Хранение в Vertex AI обходится около $0.25 за 1К воспоминаний в месяц. Внедрение HMAC-подписи или AM-Sentry — это разовые затраты на разработку, которые могут быть покрыты штатными инженерами. Для компании со 100 агентами затраты на облачные сервисы памяти могут составить от $500 до $2000 в месяц в зависимости от объёма, плюс затраты на разработку интеграции HMAC-подписи (около 20–40 часов работы инженера).
Но главное — не стоимость, а упущенная выгода от инцидента. Один скомпрометированный агент может слить данные клиентов или инициировать несанкционированные переводы. Сравните эти риски с инвестициями в защиту.
Как измерить эффективность? Ведите метрики: количество попыток атак (если у вас есть honeypot-записи), частота ложных срабатываний, время обнаружения. Главный показатель — снижение успешности атак при пентестах. Если после внедрения защиты ваши тесты показывают падение успешности с 80% до 10-15%, вы на правильном пути.
Что делать прямо сейчас: чек-лист для Security Architect
Возьмите этот чек-лист и пройдитесь по пунктам:
- Определите, какие агенты используют долговременную память.
- Составьте карту потоков данных: откуда берётся информация для памяти.
- Внедрите базовую фильтрацию на запись (белые списки источников).
- Настройте логирование всех операций чтения/записи памяти.
- Рассмотрите возможность использования HMAC-подписи для критичных записей.
- Оцените, нужно ли внедрять AM-Sentry или аналоги.
- Проведите пентест с моделированием атак типа MemGhost.
- Обучите команду реагированию на инциденты, связанные с компрометацией памяти.
Это не так сложно, как кажется. Начните с малого — и вы уже снизите риски.
Теперь главное: не ждите, пока ваш ИИ-агент станет жертвой атаки. Начните с аудита сегодня: проверьте, какие данные хранятся в памяти ваших агентов и кто имеет к ним доступ. Внедрите хотя бы базовую подпись HMAC для критических операций. А если хотите получить готовый чек-лист и подробный гайд по настройке — подпишитесь на нашу рассылку, и мы пришлём его бесплатно.
Мнение редактора
Если ваши деньги не пахнут, то после атаки они точно станут пахнуть чужими карманами. Не экономьте на защите, иначе ваш ИИ-агент станет лучшим другом хакеров.
Комментарии (0)
Комментариев пока нет. Будьте первым!