Модели

Партнерство с Ironclad: обучение ИИ-агентов сложным корпоративным процессам

Как совместное исследование помогает тренировать и оценивать модели для работы со специализированным программным обеспечением и сложными контрактами.

Обновлено:
3 мин чтения
Партнерство с Ironclad: обучение ИИ-агентов сложным корпоративным процессам

Суть

Разработчики искусственного интеллекта переходят от создания универсальных чат-ботов к обучению агентов, способных работать со специализированным программным обеспечением. Недавнее сотрудничество с компанией Ironclad, специализирующейся на ИИ для работы с контрактами, направлено на обучение моделей пониманию бизнес-правил, выполнению многоэтапных рабочих процессов и проверке соответствия результатов первоначальным требованиям. Первые тесты показывают существенный прогресс новой модели GPT-6 Astra в решении этих задач.

Контекст

Ранее была представлена модель GPT-6 Astra, которая продемонстрировала способность использовать компьютер для профессиональной работы — от подготовки документов до тестирования веб-сайтов. Следующая цель исследователей состоит в том, чтобы сделать агентов более способными и эффективными в решении сложных бизнес-задач. Для ускорения этого процесса формируются партнерства с разработчиками программного обеспечения, которые лучше всего понимают внутренние рабочие процессы. Ironclad стал первым таким партнером.

Детали

Atlassian partnership card — official white SVGs on Neutral 088

Atlassian partnership card — official white SVGs on Neutral 088

Сотрудники Ironclad и пользователи их платформы помогли выделить 11 задач, охватывающих юридическую, коммерческую и закупочную деятельность. Среди них — настройка соглашений о неразглашении, создание процессов утверждения закупок и обновление юридических оговорок в зависимости от юрисдикции. По оценкам, у опытного пользователя выполнение одной такой задачи занимает в среднем от 30 до 40 минут.

Каждая задача оценивалась по 8–50 критериям в зависимости от ее сложности. Для обучения моделей использовались синтетические задачи, созданные на основе публичных контрактов из базы данных SEC EDGAR, а также методы обучения с подкреплением в специальных средах, предоставленных Ironclad.

Результаты тестирования показали следующее:

  • Модель GPT-6 Astra (с настройкой Max reasoning) достигла среднего балла 55,0% по критериям оценки.
  • Предыдущая модель GPT-5.6 Sol (с настройкой High reasoning) показала результат 41,6%.
  • Таким образом, средний балл Astra оказался на 32% выше.
  • Расчетное среднее время на одну попытку снизилось с 37,0 минут у Sol до 19,2 минут у Astra (снижение на 48%).
  • Внутренняя модель, используемая при разработке Astra, достигла еще более высокого результата — 63,7%.

В одном из видеопримеров, приведенных в исследовании, Astra выполнила около 94% критериев задачи за расчетные 20 минут, тогда как GPT-5.6 Sol — около 85% за 32 минуты.

Анализ

Albertsons | How Albertsons Companies is reimagining retail from the inside out | Cover

Albertsons | How Albertsons Companies is reimagining retail from the inside out | Cover

Главная сложность корпоративных процессов заключается в необходимости удерживать контекст и соблюдать строгие правила на протяжении всей задачи. Например, если для закупки требуется одобрение финансового отдела при превышении определенной суммы, агент должен не просто настроить этот шаг, но и убедиться, что система корректно обрабатывает запросы как выше, так и ниже этого порога.

Как отмечает главный технический директор Ironclad Сунита Верма, для того чтобы ИИ был действительно полезен, ему необходимо понимать полный жизненный цикл контрактов и сохранять элементы контроля, на которые полагаются команды. Правильное выполнение отдельных действий недостаточно, если нарушается общая логика процесса.

Перспектива

Поскольку агенты пока могут терять контекст правил в середине выполнения задачи, потребность в человеческом контроле и полноценных платформах для работы с контрактами сохраняется. Тем не менее, по мере роста возможностей моделей, программное обеспечение сможет делегировать ИИ все больше рутинных действий.

Исследовательская группа уже приглашает другие компании-разработчики программного обеспечения к сотрудничеству. Ожидается, что интеграция реальных бизнес-задач в процесс обучения передовых моделей станет стандартной практикой для повышения их надежности в профессиональной среде.

DevDay 2026 Recap — cover image (1:1)

DevDay 2026 Recap — cover image (1:1)

TL;DR

Главное

Обучение моделей на реальных бизнес-процессах в партнерстве с разработчиками ПО позволяет создавать ИИ-агентов, способных быстрее и точнее выполнять сложные многоэтапные задачи в корпоративных системах.

Ключевые факты

  • /Средний балл модели GPT-6 Astra на 11 тестовых задачах составил 55,0%, что на 32% выше результата GPT-5.6 Sol.
  • /Расчетное среднее время выполнения задачи агентом снизилось на 48% — с 37,0 до 19,2 минут.
  • /Для оценки точности выполнения каждой задачи использовалось от 8 до 50 критериев.
  • /Внутренняя модель в разработке уже демонстрирует результат в 63,7% на аналогичных задачах.

Инсайт

Успех ИИ-агента в корпоративной среде зависит не от правильности выполнения отдельных кликов, а от способности удерживать в памяти сложную систему бизнес-правил и исключений на протяжении всего процесса.

Источник:Openai

Читайте также