Дозировка памяти для ИИ-агентов: исследование IBM Research
Исследование IBM Research показывает, что объем контекстной памяти для ИИ-агента должен калиброваться в зависимости от мощности самой модели.
Исследование IBM Research показывает, что объем контекстной памяти для ИИ-агента должен калиброваться в зависимости от мощности самой модели.
2 мин

IBM Research опубликовала исследование о том, сколько контекстной памяти нужно ИИ-агентам для эффективной работы. Выяснилось, что больше не всегда значит лучше. Оптимальный объем памяти напрямую зависит от базовых возможностей самой языковой модели.
Идея агентной памяти звучит логично: модель анализирует свой прошлый опыт, извлекает уроки и использует их в будущих задачах. Инструмент ALTK-Evolve позволяет делать это без изменения весов модели и без участия человека. Однако при масштабировании тестов на восемь разных моделей исследователи столкнулись с неравномерными результатами.
Модели разделились на три категории. Сильные модели (например, DeepSeek-V3.2) способны усвоить полный набор инструкций, улучшая свои показатели на 9.5 процентных пунктов. Более слабые модели (например, gpt-oss-120b) теряются в большом объеме текста.
Для слабых моделей лучше всего работает компактное ядро правил плюс выборка под конкретную задачу. Это дает прирост в 16.1 пункта при увеличении числа токенов всего на 5 процентов. Третья категория — насыщенные модели (например, GLM-5), которые вообще не показали измеримых улучшений.
Главный вывод исследования заключается в том, что память агента нужно калибровать, а не просто накапливать. Для слабых моделей выборочное извлечение оказывается не только самым точным, но и самым дешевым методом. Для сильных моделей полный набор инструкций становится экономически оправданным благодаря кэшированию промптов (prompt caching).
Обучение происходит вокруг модели, а не внутри нее. В будущем исследователи планируют разработать обучаемый селектор, который будет точнее предсказывать, какие именно инструкции помогут в конкретной задаче. Это сделает автономных агентов еще более эффективными и масштабируемыми.
Объем добавляемой в контекст памяти должен калиброваться под конкретную модель: сильным нужен полный контекст, слабым — строго выборочный.
Самый дешевый подход к памяти агента (выборочное извлечение) оказывается самым эффективным для менее мощных моделей, исключая необходимость переплачивать за лишние токены.