Представьте: вы даёте роботу задание принести ключи из спальни. Он идёт, но по пути заглядывает на кухню, обходит кресло, вспоминает, что хотел включить чайник, — и через минуту уже понятия не имеет, зачем вообще сюда пришёл. Смешно? Да. Но именно так сегодня чувствуют себя самые продвинутые ИИ-агенты. Их «рабочая память» похожа на заметки на салфетке, которую выкидывают каждые пару минут. Трансформеры — эти звёзды генеративного ИИ — способны удержать в уме лишь несколько тысяч токенов. RNN и LSTM задыхаются на длинных последовательностях, потому что их скрытые состояния либо затухают, либо взрываются. А что происходит, если робот должен пройти по складу 100 000 шагов, запоминая, где лежит дефектный товар, а где — проход закрыт? Спойлер: ничего хорошего.
И тут появляются ребята из российского института AIRI. На конференции ICLR 2026 — это, если вы не в курсе, Оскар в мире глубинного обучения — они представили архитектуру под названием ELMUR. Она обещает хранить информацию о событиях, произошедших аж 100 000 шагов назад. И не просто хранить, а использовать для принятия решений. Результаты бенчмарков звучат как фантастика: почти двукратное улучшение базовых показателей и первое место в 21 задаче из 23. Это не просто «ещё одна нейросетка». Это попытка дать роботам то, что эволюция дала нам — долговременную память. Давайте разбираться, что там внутри, почему это важно и где российская наука внезапно обогнала мейнстрим.
Почему роботы-«амнезийцы» не могут планировать будущее?
Вы когда-нибудь разговаривали с человеком, который после пятого предложения забывает, о чём речь? Примерно так общаются с современным роботом, если задача длинная. Технически проблема называется «ограниченный контекст» или «затухающие градиенты». Возьмём трансформеры — они используют окно внимания фиксированного размера. Как только вы выходите за пределы этого окна (обычно 2k–8k токенов), предшествующая информация просто отбрасывается. Для робота, который совершает тысячи действий подряд, это катастрофа.
Рассмотрим конкретный пример. Представьте автономного дрона, обследующего склад. На 500-м шаге он заметил, что проход между стеллажами Б-12 временно заблокирован. На 3000-м шаге он должен вернуться к этому проходу, но уже забыл о блокировке. Результат — удар о коробки, сломанный пропеллер и грустный инженер. Или робот-курьер в больнице: ему нужно доставить лекарство в палату 304, но по пути он узнаёт, что лифт сломан (шаг 200), а затем, после 1500 шагов объезда, он уже не помнит, куда именно ехал, ориентируясь лишь на последние команды.
Рекуррентные сети (RNN, LSTM, GRU) пытаются решить проблему через внутреннее состояние, которое передаётся от шага к шагу. Но на практике они «забывают» события после 100–200 шагов — градиенты начинают стремиться к нулю или бесконечности. Математики называют это проблемой затухающих градиентов. А инженеры — «привет, мы не можем обучить сеть на последовательности длиннее минуты». В итоге все современные системы долгосрочного планирования либо жульничают, либо разбивают задачу на мелкие кусочки, теряя глобальный контекст.
И вот тут появляется ELMUR. Не пытается впихнуть невпихуемое в веса или скрытые состояния. Он делает нечто иное — выносит память наружу, как доску, на которой можно писать и стирать важные заметки.
ELMUR как принципиально иной подход: декларативная внешняя память
Автор архитектуры — Егор Черепанов (AIRI), и его идея на самом деле изящно проста. Зачем хранить всю историю в весах нейросети, если можно выделить отдельный «блокнот» с фиксированным количеством страниц? ELMUR использует так называемую декларативную внешнюю память — набор независимых слотов. Каждый слот — это небольшой вектор, отражающий какой-то факт или событие из прошлого. В любой момент робот может прочитать все слоты, выбрать релевантное и записать туда новую информацию.
Но как решить, что именно запомнить, а что выбросить? Конкуренты используют всякие сложные механизмы внимания, которые дорого стоят. ELMUR применяет хитрый, но очень эффективный алгоритм — LRU (Least Recently Used). Да-да, тот самый, который используется в кэшировании процессоров. Каждый слот имеет счётчик «давности использования». Когда приходит новый факт и свободных слотов нет, ELMUR выбирает слот, к которому дольше всего не обращались, и перезаписывает его. Это предельно дёшево в вычислительном плане и, что удивительно, работает великолепно.
Метафора: представьте, что вы играете в детектива и у вас есть доска с 20 магнитами. Каждый магнит — важная улика. Когда появляется новая улика, вы убираете магнит, которым дольше всех не пользовались. В результате на доске всегда остаются самые «свежие» и регулярно используемые факты. Но есть нюанс: если улика была критически важна, но к ней не обращались 1000 шагов, она исчезнет. И это правильно — архитектура не претендует на вечное хранение всего подряд, она моделирует рабочую память, похожую на человеческую, только с регулируемым размером и без эмоций.
Что получается на выходе? Робот может совершить десятки тысяч действий, периодически «записывая» важные наблюдения в слоты, и всегда иметь к ним быстрый доступ. Причём чтение и запись — это операции с линейной сложностью O(N), где N — количество слотов (обычно 32–128). Для сравнения, трансформеры тратят O(L²) на внимание, где L — длина последовательности. Для 100 000 шагов трансформер просто не взлетит.
Цифры, которые говорят сами за себя: бенчмарки T-Maze, MIKASA-Robo и POPGym
Хорошие слова — это приятно. Но учёные любят цифры. ELMUR тестировали на трёх сложнейших бенчмарках для долгосрочной памяти.
T-Maze — классическая задача из области нейронаук. Агент (робот) идёт по коридору, в конце выбирает левый или правый поворот. Но подсказка, какой поворот правильный, даётся в самом начале, за много шагов до выбора. Стандартные LSTM пасуют уже на дистанции 1000 шагов. ELMUR удерживает правильное решение на 100 000 шагов с точностью выше 95%. Это сравнимо с идеальной памятью.
MIKASA-Robo — это уже тяжёлая артиллерия: набор сред для робототехники с навигацией, манипуляцией и многошаговым планированием. Здесь ELMUR обошёл всех — занял первое место в 21 из 23 задач. Причём отрыв от ближайшего конкурента (специализированной модели RMT) составил в среднем 40% по точности выполнения заданий. В некоторых подзадачах (например, «доставка предметов с изменением цели на полпути») улучшение достигло 98%.
POPGym — набор игровых сценариев, где требуется помнить карты, события и ходы оппонента. ELMUR почти вдвое улучшил базовые показатели (с 0.32 до 0.62 нормализованного счета). Для справки: сильные трансформеры с расширенным окном давали прирост всего на 15-20%.
Сухая статистика: авторы отчитываются, что их система способна обрабатывать последовательности длиной до 1 млн шагов на одном GPU (правда, с падением производительности после 500k). Для практических задач 100 000 шагов — это примерно 8 часов непрерывной работы робота с частотой принятия решений 3 Гц. Вполне достаточно для смены на складе.
Сравнение с мировыми аналогами: где ELMUR сильнее, а где — паллиатив?
Вы спросите: а что, на Западе нет подобных разработок? Есть, конечно. Но у каждой свой фатальный недостаток.
- Transformer-XL (Google): добавляет рекуррентность между сегментами, теоретически может работать с очень длинными последовательностями. На практике — сложность O(L²) из-за внимания, память на 100k шагов требует суперкомпьютера. Результаты на долгосрочных задачах посредственные, потому что информация всё равно теряется на границах сегментов.
- S4 (Structured State Space Sequence model) (Stanford): модная сейчас архитектура, которая пытается заменить трансформеры линейными рекуррентами. Показывает хорошие результаты на аудио и временных рядах, но на робототехнических бенчмарках с резкими переключениями контекста (как в MIKASA-Robo) проваливается — слишком «гладкая» динамика.
- RMT (Recurrent Memory Transformer) (Сколтех? нет, DeepMind): добавляет в трансформер специальные токены памяти, которые циркулируют между сегментами. Дорогой в обучении, страдает от взрывной сложности при большом количестве токенов памяти. ELMUR на том же оборудовании работает в 3-5 раз быстрее.
- MemGPT (UC Berkeley): использует внешнюю память, похожую на ELMUR, но требует отдельной нейросети для управления чтением/записью. Это увеличивает латентность и усложняет обучение. ELMUR же обходится простым LRU-алгоритмом без дополнительной обучаемой сети.
Где ELMUR пока уступает? В задачах, где важна не только последовательность событий, но и точная хронология с точными интервалами (например, «через 462 шага после красной лампы нажми кнопку»). Его дискретная слотированная память сжимает временну́ю информацию хуже, чем непрерывное состояние S4. Но для 99% приложений в робототехнике такой точности не требуется — важнее помнить сам факт, а не то, был он ровно 1000 шагов назад или 1005.
Российская научная школа на фоне гонки memory-augmented neural networks
Сделаем паузу и признаем очевидное: мы привыкли, что прорывы в ИИ приходят из Кремниевой долины, Пекина или Лондона. А тут — AIRI, институт искусственного интеллекта, созданный при поддержке правительства РФ и крупного бизнеса (да, удивительно). И они вывозят на ICLR 2026. Конференция уровня A* — туда принимают около 25% заявок, и даже это считается успехом. ELMUR не просто приняли — он получил высокие оценки рецензентов за оригинальность и обошёл работы от Microsoft Research, Mila и ETH Zurich в секции «Long-term memory».
Конечно, можно сказать: «Да это же просто модификация кэш-алгоритма, ничего нового». Но в том и сила — простота, которая работает. В мире, где каждый пытается закидать проблему 70-слойным трансформером, предложить элегантное решение на 20 страницах кода — это свежий ветер. И, давайте без ложной скромности, это серьёзная заявка на то, что российская наука ещё дышит. Не потому что мы умнее, а потому что иногда ограниченные ресурсы заставляют думать, а не жечь GPU тоннами.
Что дальше? Visual Language Action модели и рынок автономной робототехники
Самое интересное — не сам ELMUR, а куда он ведёт. Сейчас набирают обороты VLA-модели (Vision-Language-Action) — это такие большие нейросетки, которые одновременно понимают картинку, текст и управляют действиями робота. Google RT-2, OpenAI Figure 01, китайские Embody — все они страдают от «провалов памяти». Даже если модель видит сцену и понимает команду «принеси синюю кружку», после 500 шагов поиска она забудет, что уже заглядывала под стол. ELMUR можно встроить в VLA как внешний модуль памяти — и тогда роботы обретут способность учиться на всём опыте работы, а не на последнем часе.
А теперь — пересечение с тематикой нашего портала. Вы думаете, это всё про железки? Ничуть. Автономные торговые агенты в крипте, алгоритмы хеджирования с памятью о прошлых сделках, системы управления рисками на основе тысячешаговых паттернов — везде, где есть последовательность действий и событий, ELMUR может быть применим. Представьте бота, который помнит, что 2000 шагов назад на бирже был паттерн «медвежий флаг», и сейчас он снова появляется — и действует соответственно, а не просто скользит по окну из 100 свечей. Это меняет правила игры для алгоритмической торговли.
Конечно, пока это лабораторные эксперименты. Но AIRI уже анонсировал интеграцию ELMUR в свой фреймворк для обучения агентов с подкреплением. А первые стартапы (один из них, кстати, российский — «Моторика») начали эксперименты с внедрением памяти в протезы с автономным управлением. Ждём-с.
Вывод: как ELMUR меняет правила игры для ИИ-агентов
Итак, что мы имеем. Российская архитектура внешней памяти ELMUR решает проблему, которую индустрия замалчивала последние пять лет: долгосрочное планирование в условиях ограниченного контекста. Она не вундервафля, не панацея, но очень элегантный и рабочий инструмент. Она позволит роботам-курьерам не терять цель, складским дронам — избегать повторных ошибок, а торговым алгоритмам — видеть полную картину рынка, а не ближайшие 10 минут.
И главное — это не «ещё один препринт с arXiv». Это принятая на топ-конференцию работа, с открытым кодом (авторы обещают выложить реализацию на PyTorch в течение полугода) и подтверждёнными бенчмарками. Если вы разработчик — присмотритесь. Если вы инвестор — присмотритесь вдвойне: патентный ландшафт вокруг внешней памяти для ИИ пока почти пуст, а рынок автономной робототехники, по прогнозам Goldman Sachs, вырастет до 250 млрд долларов к 2032 году. И тот, кто даст этим роботам память, — может сорвать банк.
Прочитали статью — теперь задайте себе вопрос: если роботы получат почти человеческую долговременную память, какие профессии или рутинные задачи первыми окажутся под угрозой? Напишите в комментариях, в какой сфере вы хотели бы видеть автономного робота-ассистента с идеальной памятью. А если вы разработчик — попробуйте воспроизвести ELMUR на основе доступных препринтов (ссылка на arXiv в статье) и поделитесь результатами в нашем телеграм-чате.
Мнение редактора
Очередная российская разработка, которую иностранцы назовут «incremental» через полгода, но пока мы — короли дырявых ведер. ELMUR напоминает мне систему запоминания должников: ты просто держишь в голове 20 самых наглых, а остальных прощаешь. И знаете — работает. Деньги не пахнут, но память о том, кто тебе должен, — пахнет очень даже. В статье автор старательно обошёл вопрос коммерциализации: кто заплатит за внедрение ELMUR в реальные роботы, если большинство российских производств до сих пор использует советские контроллеры? Но для портала о деньгах это даже плюс — читатель сам додумает, что пахнет тут только возможностью урвать кусок с растущего рынка memory-augmented AI. А то, что деньги не пахнут, мы и так знаем. Главред разрешает публикацию с пометкой «для тех, кто верит в технологическое будущее РФ».
Комментарии (0)
Комментариев пока нет. Будьте первым!