Как Asana снизила затраты на ИИ-агента в 76 раз с помощью автоматизированного тестирования
Используя модель GPT-6 Astra в среде Codex, компания Asana за неделю оптимизировала работу своего браузерного агента. Это позволило сократить оценочные расходы в 76 раз и ускорить выполнение задач в 5 раз.

Суть
Компания Asana добилась значительного снижения оценочных затрат на работу своего браузерного агента — в 76 раз, при этом ускорив его работу в 5 раз. Таких результатов удалось достичь благодаря использованию модели GPT-6 Astra в среде Codex. ИИ-ассистент провел масштабное исследование и оптимизировал рабочие процессы для запуска на новой модели GPT-6.1 Sol.
Контекст
Asana помогает клиентам автоматизировать работу в бизнес-приложениях через платформу StackAI. С ее помощью пользователи могут создавать рабочие процессы, которые самостоятельно перемещаются по сайтам, заполняют формы и собирают информацию без написания программного кода.

White Asana logo over a blue layered-paper texture.
На масштабах Asana даже небольшие неэффективности в таких процессах приводят к высоким затратам. Технический директор StackAI Фрэнк Идальго поставил цель сделать браузерного агента быстрее и дешевле. Вместо ручного поиска проблем он поручил модели GPT-6 Astra проанализировать агента, протестировать улучшения и сравнить результаты. По оценкам Идальго, работа, которая заняла бы у человека один-два месяца, была выполнена примерно за неделю.
Детали
В ходе анализа GPT-6 Astra выяснила, что агент кэшировал фиксированные инструкции, но не сохранял постоянно растущую историю текста страниц и скриншотов. Из-за этого каждый запрос отправлял всю историю заново по полной стоимости.
Был проведен эксперимент из 144 запусков, в котором тестировались модель GPT-6.1 Sol и три другие передовые модели (обозначенные как Модели A, B и C). Тестировались бюджеты истории в 120 000 и 480 000 символов, а также шесть политик кэширования и работы со скриншотами. Задача заключалась в сборе шести полей для каждой из 32 книг из публичного демо-каталога.

Oracle — Cover
Оптимальная конфигурация позволила накапливать до 20 скриншотов перед удалением старых. На модели GPT-6.1 Sol средняя оценочная стоимость запуска составила 0,47 доллара, а время выполнения — около четырех минут. Для сравнения, исходная настройка на Модели B стоила как минимум 36,21 доллара и занимала не менее 22,5 минут. Снижение стоимости было достигнуто в том числе за счет того, что 89% входных данных стало поступать из кэша, стоимость которого составляет 5% от цены некэшированных данных. Кроме того, увеличение бюджета истории позволило повысить долю успешных запусков с 3 из 18 до 18 из 18.
Анализ
Данный случай наглядно демонстрирует, как ИИ-модели могут применяться для оптимизации других ИИ-систем. Роль человека сводится к постановке целей и проверке результатов, в то время как рутинная работа по рефакторингу кода и проведению десятков параллельных тестов делегируется агентам. Снижение операционных расходов позволяет компаниям предлагать клиентам доступ к более сложным и производительным моделям без ущерба для рентабельности.
Перспектива
Asana уже внедрила изменения в StackAI и разрабатывает инструменты, чтобы сделать подобные эксперименты легко воспроизводимыми. В дальнейшем компания планирует использовать GPT-6 Astra для тестирования функций продукта до их релиза: ИИ будет осуществлять навигацию по платформе, пробовать различные вводы и сообщать об ошибках. Это может стать основой для нового жизненного цикла разработки программного обеспечения, где скорость выпуска обновлений будет зависеть не от написания кода, а от человеческого внимания при управлении парком агентов.
TL;DR
Главное
Применение ИИ для рефакторинга и тестирования собственного кода позволяет кратно снизить стоимость эксплуатации больших языковых моделей и ускорить их работу.
Ключевые факты
- /Оценочные затраты на работу агента снижены в 76 раз (до 0,47 доллара за запуск).
- /Время выполнения задач сократилось с 22,5 до 4 минут.
- /89% входных данных теперь поступает из кэша за 5% от базовой цены.
- /Исследование из 144 запусков заняло неделю вместо 1-2 месяцев ручной работы.
Инсайт
Увеличение объема сохраняемой истории не только удешевило процесс за счет правильного кэширования, но и повысило надежность агента — доля успешных выполнений задачи выросла до 100%.





