Суть
Команда IBM Research опубликовала исследование, посвященное проблеме скрытой ненадежности автономных ИИ-агентов. Оказывается, способность модели успешно выполнить задачу один раз не гарантирует, что она повторит этот успех при идентичном запросе. Для решения этой проблемы исследователи представили новый диагностический инструмент и метод генерации инструкций, который стабилизирует поведение агентов.
Это важное открытие для индустрии. В корпоративной среде, будь то сверка финансовых транзакций или проверка контрактов, непредсказуемость является критическим препятствием для внедрения технологий на базе больших языковых моделей (LLM).
Контекст
Большинство современных бенчмарков оценивают агентов по метрике Mean@k. Она показывает средний процент успешных выполнений задачи за k попыток. Если мы видим в новостях заголовок «Агент точен на 77%», речь идет именно об этом показателе.
Однако эта метрика не отвечает на главный вопрос бизнеса: можно ли доверять системе при каждом запуске? Для оценки реальной надежности IBM предлагает использовать метрику Pass^k — долю задач, в которых агент добился успеха во всех k попытках без исключения. Разницу между средним успехом и абсолютной стабильностью исследователи назвали «разрывом согласованности» (consistency gap).
Детали
В ходе тестов на бенчмарке AppWorld агент на базе модели GPT-4.1 показал впечатляющий средний результат Mean@5 на уровне 77.4%. Однако показатель стабильности Pass^5 составил всего 53.0%. Почти четверть задач агент решал нестабильно, меняя правильный ответ на ошибочный при повторных запусках.
Причина кроется в архитектуре вероятностного выбора токенов. В некоторых точках принятия решений модель имеет «плоское» распределение вероятностей, где несколько вариантов ответа почти равнозначны. В таких случаях малейший системный шум, такой как особенности вычислений на графических процессорах (GPU) или группировка запросов, может изменить выбор модели и направить агента по ложному пути.
Анализ
Для борьбы с этой уязвимостью IBM разработала инструмент Consistency Analyzer. Он работает без доступа к внутренним параметрам модели (в режиме черного ящика). Инструмент берет один записанный путь решения задачи и многократно перепроверяет каждую точку принятия решений, выявляя те шаги, где агент был близок к ошибке.
Затем система ALTK-Evolve превращает найденные слабые места в четкие текстовые инструкции. Например, если агент путался при подсчете символов в тексте, система генерирует правило использовать конкретный метод поиска. Применение таких инструкций сократило разрыв в надежности вдвое — с 24.4 до 12.0 процентных пунктов, повысив показатель абсолютной стабильности до 69.0% без потери средней точности.
Перспектива
Подход IBM демонстрирует смещение фокуса в исследованиях ИИ. Индустрия начинает понимать, что масштабирование моделей и наращивание их пиковых возможностей — это лишь часть пути.
В ближайшем будущем инструменты для автоматической диагностики и стабилизации поведения агентов станут обязательным стандартом при разработке корпоративных решений. Предсказуемость и надежность становятся важнее способности модели изредка демонстрировать выдающиеся, но неповторяемые результаты.