Двенадцать исследователей во главе с командой Юргена Шмидхубера систематизировали 239 научных работ о том, как AI-агенты улучшают себя без участия человека. Разбираем главные идеи обзора и объясняем, что из этого бизнес может применить уже сегодня.
Обновлено: июль 2026 - 14 минут чтения

Аналитический разбор оригинального обзора. Zhe Ren, Yimeng Chen, Dandan Guo, Jurgen Schmidhuber и ещё 8 соавторов - Jilin University, KAUST, University of Alberta, Swiss AI Lab IDSIA. Июль 2026, 97 страниц, 12 иллюстраций.
Начинайте с обвязки, а не с модели
Две трети науки о самосовершенствовании (166 работ из 239) - про промпты, память и инструменты, потому что это быстро, дёшево и обратимо. Для компании это готовый порядок действий: сначала память и инструменты агентов, дообучение моделей - потом.
Опыт агента - актив, стройте маховик данных
Ядро самосовершенствования - замкнутый контур, где результаты работы агента становятся материалом для его улучшения. Решите заранее, кому принадлежит этот маховик - вам или вендору: от этого зависит, у кого накапливается преимущество.
Скиллы и память Claude Code - это уже самосовершенствование
Продукты, где агент накапливает инструкции, помнит контекст между сессиями и пишет себе инструменты, реализуют ось обвязки из обзора в промышленном виде. Внедрять можно сегодня, эффект измерим за недели.
Без регламента самоулучшение опасно
Авторы обзора называют нерешёнными проблемами забывание навыков, нестабильность самомодификации и обман агентом собственных оценок. Практический вывод: каскад проверок перед закреплением изменений и полный лог самоулучшений - обязательные условия внедрения.
Определите судью до запуска петли
Правило из обзора: явно фиксировать, кто и по каким метрикам оценивает прогресс агента, и следить, чтобы агент не подстраивался под проверяющего. Метрики, назначенные постфактум, измеряют не улучшение, а умение агента нравиться.
В июле 2026 года на arXiv вышел обзор Self-Improvements in Modern Agentic Systems - 97 страниц, 239 проанализированных работ, 12 авторов из Jilin University, KAUST, University of Alberta и швейцарской лаборатории IDSIA. Среди соавторов - Юрген Шмидхубер, один из отцов современных нейросетей, который ещё в 2000-х описал теоретическую "машину Гёделя" - программу, способную переписывать собственный код. Обзор подводит итог тому, как эта старая идея превратилась в практику: агенты на базе больших языковых моделей перестают быть статичными исполнителями инструкций и начинают накапливать способности из собственного опыта.
Чтобы разговор был предметным, авторы обзора предлагают простую системную рамку. Современный AI-агент - это связка из двух частей. Первая - базовая модель (foundation model): сама нейросеть вроде GPT или Claude, обученная на огромных массивах данных. Вторая - обвязка (scaffolding): всё, что окружает модель в рабочей системе, - промпты (текстовые инструкции), память, подключённые инструменты и управляющая логика. Агент - это конфигурация "модель плюс обвязка", и улучшать можно любую из частей.
Самосовершенствование в этой рамке - не любое обучение, а строго определённый процесс: агент сам инициирует, получает и закрепляет обновления своих параметров или компонентов обвязки. Ключевое слово - "сам": человек либо участвует минимально, либо не участвует вовсе. Это отличает предмет обзора от обычного дообучения, где какие данные собрать и когда переобучить модель решают инженеры. По формулировке авторов, цель - управляемая эволюция: система должна становиться лучше от опыта, но предсказуемым и контролируемым образом.
Центральная идея обзора, вокруг которой построена вся классификация, - различие двух мишеней улучшения. Первая ось - улучшение самой базовой модели: агент так или иначе меняет веса нейросети, то есть дообучает сам себя. Авторы подчёркивают: такие изменения медленные, дорогие и требуют вычислительной инфраструктуры, зато они устойчивы - новая способность "вшивается" в модель и остаётся с ней. Вторая ось - улучшение обвязки: агент переписывает свои промпты, реорганизует память, создаёт или дорабатывает инструменты. Это быстро, дёшево и, что важно для практики, обратимо: неудачное изменение промпта можно откатить одной операцией, неудачное дообучение модели - нет.
Расстановка сил в науке говорит сама за себя. Из 239 работ, вошедших в обзор, 73 посвящены улучшению модели и 166 - улучшению обвязки. Центр тяжести исследований смещён в сторону обвязки более чем вдвое, и причина прозрачна: экспериментировать с промптами и памятью может любая лаборатория и любой стартап, а самодообучение больших моделей доступно немногим. Для читателя из бизнеса это полезный ориентир: передний край практических результатов сегодня - именно в обвязке.
Если переводить на язык управления, различие двух осей похоже на разницу между переобучением сотрудника и улучшением его рабочего окружения. Отправить человека на длительную переподготовку - долго и дорого, но навык останется. Дать ему лучшие регламенты, чек-листы, базу знаний и инструменты - быстро и дёшево, и эффект виден сразу, хотя он и держится на этих внешних опорах. Обзор показывает, что зрелая система самосовершенствования со временем задействует обе оси, но начинается почти всегда с обвязки.
Медленно, дорого, но фундаментально: агент дообучает собственные веса
Быстро и обратимо: агент меняет промпты, память и инструменты вокруг модели
Внутри первой оси авторы обзора выделяют три источника сигнала, из которых агент добывает материал для дообучения самого себя. Первый - собственные демонстрации: агент синтезирует обучающие примеры для самого себя - инструкции, решения задач, цепочки рассуждений - и затем дообучается на этом самодельном датасете. Классический пример, который приводит обзор, - метод Self-Instruct 2023 года, где модель сама генерирует тысячи учебных заданий с ответами. По данным обзора, этому направлению посвящено 20 работ.
Второй источник - собственная оценка: агент вырабатывает внутренние сигналы вознаграждения и критики и учится на них без внешнего судьи (21 работа). Хрестоматийный пример - Constitutional AI от Anthropic: модель сама критикует свои ответы по списку принципов - "конституции" - и переписывает их, а на этих само-исправлениях затем дообучается. Человек здесь задаёт только правила игры, а не оценивает каждый ответ.
Третий источник - опыт из среды, и он делится на две ветви. В первой агент учится в настоящих исполняемых средах: пишет код и видит результаты тестов, ходит по реальным сайтам, играет в игры, управляет роботами в симуляторах (17 работ; показательный пример - WebRL, где веб-агент учится с подкреплением на постепенно усложняющихся заданиях). Во второй ветви агент строит генеративную модель мира - собственный "воображаемый" симулятор среды - и тренируется на прогнозах и проигранных в воображении сценариях, не тратя дорогие реальные попытки (15 работ).
Общий знаменатель всех трёх механизмов - маховик данных: результаты работы агента становятся сырьём для его следующего цикла обучения. Авторы обзора отмечают, что именно этот замкнутый контур отличает самосовершенствование от классического конвейера, где данные для обучения собирают и размечают люди.
Вторая ось - 166 работ - разбита в обзоре на четыре направления. Первое - оптимизация промптов (37 работ): агент итеративно переписывает собственные инструкции, добиваясь лучших результатов. Авторы различают четыре техники: подбор по числовой метрике качества; доработка по развёрнутой текстовой критике - как в методе Self-Refine, где модель сама рецензирует и улучшает свой ответ; эволюционный отбор, когда конкурируют целые популяции вариантов промпта; и "текстовые градиенты" - подход TextGrad, переносящий логику математической оптимизации нейросетей на работу с обычным текстом: критика ответа играет роль градиента, указывающего направление правки.
Второе и самое населённое направление - память, 61 работа. Здесь исследователи отвечают на три вопроса: что хранить - факты, эпизоды, выученные навыки (16 работ); как организовать хранение и поиск - от простых списков до графов знаний (23 работы, среди примеров - архитектура долговременной памяти MemoryBank); и как память сопровождать - создавать записи, обновлять устаревшие, сжимать разросшиеся (22 работы). Память - это то, что превращает серию разовых сессий агента в накопление опыта.
Третье направление - инструменты, 50 работ. Три сюжета: динамическая маршрутизация, когда агент учится выбирать подходящий инструмент под задачу (24 работы); итеративная доработка уже имеющихся инструментов (11 работ); и самое интересное - автономное создание новых инструментов, когда агент сам пишет код недостающей ему функции (15 работ). Икона этого направления - Voyager, агент в игре Minecraft, который с нуля написал себе целую библиотеку навыков и постоянно её пополнял.
Четвёртое направление - самое радикальное: переписывание всей обвязки целиком, включая собственную управляющую логику и код (18 работ). Флагманский пример из обзора - Darwin Godel Machine 2025 года: агент, который модифицирует собственную программу, проверяет, стала ли новая версия лучше на тестах, и оставляет удачные мутации. Это прямой наследник теоретической машины Гёделя Шмидхубера - только теперь работающий, а не гипотетический.
Отдельный раздел обзора посвящён неудобному вопросу: как понять, что агент действительно стал лучше, а не просто научился нравиться проверяющему. Авторы выделяют два способа измерения. Первый - прямые метрики: доля прошедших тестов в коде, процент успешно завершённых сценариев на сайте. Это надёжно, но улавливает не всё. Второй - оценка судьёй, обычно другой языковой моделью. Здесь обзор формулирует два практических правила: всегда явно указывать, кто судья и сколько ресурсов выделено на судейство, и следить, чтобы агент не переоптимизировался под судью - иначе система учится обманывать экзаменатора, а не решать задачу.
Бенчмарки - стандартизированные наборы задач для сравнения систем - авторы делят на два уровня. Механизменные изолируют вклад отдельного компонента: что именно дало прирост - дообучение модели, новый промпт или память. Доменные проверяют агента целиком в шести прикладных областях, которые обзор рассматривает и как главные сферы применения: разработка софта, веб-навигация, игры и стратегические рассуждения, научные открытия, робототехника и общее управление компьютером. У каждой области свой естественный контур обратной связи: в программировании - тесты, в играх - победы в самоигре, в науке - исход эксперимента, в робототехнике - дорогие, но честные сигналы физического мира.
Главный вывод раздела - фундаментальная асимметрия измерений. Быстрые улучшения обвязки легко проверить: заменил промпт, прогнал бенчмарк, сравнил цифры. А вот устойчивые приросты самой модели требуют длительных наблюдений на разнообразных задачах, и стандартных протоколов для этого, по признанию авторов обзора, пока не существует. Иными словами, отрасль умеет хорошо мерить именно тот тип улучшений, который проще и дешевле делать.
Финальный раздел обзора - список открытых проблем, и он отрезвляет. Первая - катастрофическое забывание: дообучаясь на новых задачах, модель может растерять ранее освоенные навыки. Для самосовершенствующегося агента это особенно коварно - он обновляет себя постоянно, и каждый цикл несёт риск незаметной деградации того, что вчера работало. Вторая - стабильность при рекурсии: когда система меняет саму себя, под удар попадают и её собственные механизмы самопроверки. Испорченный внутренний критик начнёт одобрять плохие изменения, и ошибки покатятся лавиной; как вовремя это обнаружить - вопрос, по оценке авторов, пока скорее теоретический.
Третья проблема - безопасность самомодификации. Авторы обзора предлагают принцип многослойных шлюзов: прежде чем изменение агента вступит в силу, оно должно пройти каскад независимых проверок. Идея понятна, но стандартной архитектуры таких шлюзов в отрасли нет - каждая команда строит свою. Сюда же примыкает проблема подделки вознаграждения: агент, оценивающий сам себя, имеет соблазн "взломать" собственную систему оценок вместо честного улучшения. Создание защищённой инфраструктуры критики авторы прямо называют центральной нерешённой задачей направления.
Наконец, две проблемы поскромнее, но практически важные. Атрибуция: в системе, где одновременно меняются модель, промпты, память и инструменты, трудно понять, что именно дало прирост, - а без этого нельзя осознанно управлять улучшением. И обобщение: по данным обзора, самосовершенствование пока плохо переносится между областями - агент, наловчившийся в веб-задачах, не становится от этого лучше в анализе документов. Плюс базовое напряжение всей области: как совмещать быструю адаптацию на лету с медленным закреплением навыков в модели, не ломая ни того ни другого. Честная фиксация этих пробелов - возможно, самая ценная часть обзора.
Теперь наша аналитика поверх обзора. Главная практическая ценность рамки "модель против обвязки" в том, что она снимает ложную дилемму "ждать сильного AI или внедрять сейчас". Самосовершенствование через обвязку уже продаётся в готовых продуктах. Скиллы и память в Claude Code - это ровно оно: агент накапливает инструкции по вашему проекту, помнит договорённости между сессиями и может написать себе недостающий скрипт. То же по смыслу делают память ChatGPT и корпоративные агентские платформы. Когда вендор говорит "агент обучается на вашей работе", в 9 случаях из 10 речь именно об оси обвязки - и это хорошая новость: такие улучшения дёшевы, прозрачны и обратимы.
Что внедрять уже сейчас. Во-первых, память агентов: переведите регламенты, стиль и типовые решения компании в форму, которую агент накапливает и переиспользует, - это превращает разовые сессии в растущий актив. Во-вторых, контур оптимизации промптов: даже простая петля "метрика - критика - правка инструкции" даёт измеримый прирост без единого рубля на дообучение моделей. В-третьих, инструменты: разрешите агенту создавать и дорабатывать скрипты под ваши рутинные операции - опыт Voyager из обзора показывает, что библиотека навыков растёт быстро. Всё это - нижний, дешёвый и обратимый этаж самосовершенствования.
За чем следить на горизонте года-двух. Ось модели - самодообучение - будет дешеветь, и первыми её принесут вендоры: появятся продукты, где модель действительно закрепляет опыт вашей компании в весах. Это даст устойчивое преимущество, но и новый тип зависимости: маховик данных, который обзор называет ядром самосовершенствования, работает на того, кто им владеет. Компании стоит уже сейчас решить, чей это будет маховик - ваш или поставщика. Второй сигнал для наблюдения - работы уровня Darwin Godel Machine: агенты, переписывающие собственный код, из экзотики становятся инженерной практикой.
И про управление рисками. Список нерешённых проблем из обзора читается как готовый чек-лист корпоративной политики: не давайте агенту закреплять изменения без каскада проверок - тот самый принцип многослойных шлюзов; логируйте каждое самоулучшение, чтобы была атрибуция "что именно помогло"; и определяйте судью с метриками до запуска петли улучшения, а не после - иначе агент будет оптимизироваться под ваше невнимание. Самосовершенствующийся агент - это сотрудник, который сам меняет свою должностную инструкцию. Польза огромна ровно до тех пор, пока у этого процесса есть регламент.
Полный каталог исследований из обзора - по направлениям, категориям и годам, со ссылками на статьи и код. Данные - из открытого репозитория авторов (лицензия MIT). Записей больше, чем работ в обзоре: часть исследований входит сразу в несколько категорий, как у авторов.
Найдено: 244 из 244
Это система на базе языковой модели, которая сама делает себя лучше по итогам собственного опыта: дообучает модель на своих же результатах или улучшает "обвязку" - промпты, память, инструменты. Ключевое отличие от обычного агента - обновления инициирует и закрепляет сама система, а не инженеры.
Улучшение модели меняет веса самой нейросети: это медленно, дорого, требует инфраструктуры, зато результат устойчив. Улучшение обвязки меняет то, что вокруг модели, - инструкции, память, инструменты: это быстро, дёшево и обратимо. По данным обзора, из 239 работ 73 посвящены модели и 166 - обвязке: практический центр тяжести сегодня во втором.
Авторы обзора осторожны: они говорят об управляемой эволюции, а не о неограниченном саморазвитии. Главные риски они называют прямо - катастрофическое забывание навыков, нестабильность при рекурсивной самомодификации и подделка агентом собственной системы оценок. Предлагаемый ответ - многослойные проверки перед закреплением любых изменений; стандартной архитектуры таких защит пока нет.
Да, по оси обвязки - без исследовательских бюджетов. Память агента, накапливающая знания о компании, петли автоматической доработки промптов, создание агентом собственных скриптов - всё это доступно в готовых продуктах вроде Claude Code со скиллами и памятью. Самодообучение моделей пока остаётся уделом крупных лабораторий, но придёт в продукты через вендоров.
Статья Self-Improvements in Modern Agentic Systems: A Survey опубликована на arXiv (2607.13104) в июле 2026 года: 97 страниц, 12 авторов из Jilin University, KAUST, University of Alberta и Swiss AI Lab IDSIA, включая Юргена Шмидхубера. У обзора есть сайт selfimproving-agent.github.io с интерактивной таксономией и постоянно пополняемый список работ на GitHub.
Russian-language analytical review of the Self-Improving Agents survey (SI-Agents Survey, 2026) by researchers from Jilin University, KAUST, University of Alberta and the Swiss AI Lab IDSIA, including Juergen Schmidhuber. Covers the two-axis taxonomy of agent self-improvement - foundation model improvement versus scaffolding improvement (prompts, memory, tools) - mechanisms, evaluation, open risks, and business implications. Includes an interactive library of 244 papers sourced from the authors' MIT-licensed repository with attribution. Original survey: https://selfimproving-agent.github.io/, paper: https://arxiv.org/abs/2607.13104. This page is an original analytical retelling in Russian, not a translation.