Бизнес и продуктивность

Как Asana снизила затраты на ИИ-агента в 76 раз с помощью автоматизированного тестирования

Используя модель GPT-6 Astra в среде Codex, компания Asana за неделю оптимизировала работу своего браузерного агента. Это позволило сократить оценочные расходы в 76 раз и ускорить выполнение задач в 5 раз.

Обновлено:
3 мин чтения
Как Asana снизила затраты на ИИ-агента в 76 раз с помощью автоматизированного тестирования

Суть

Компания Asana добилась значительного снижения оценочных затрат на работу своего браузерного агента — в 76 раз, при этом ускорив его работу в 5 раз. Таких результатов удалось достичь благодаря использованию модели GPT-6 Astra в среде Codex. ИИ-ассистент провел масштабное исследование и оптимизировал рабочие процессы для запуска на новой модели GPT-6.1 Sol.

Контекст

Asana помогает клиентам автоматизировать работу в бизнес-приложениях через платформу StackAI. С ее помощью пользователи могут создавать рабочие процессы, которые самостоятельно перемещаются по сайтам, заполняют формы и собирают информацию без написания программного кода.

White Asana logo over a blue layered-paper texture.

White Asana logo over a blue layered-paper texture.

На масштабах Asana даже небольшие неэффективности в таких процессах приводят к высоким затратам. Технический директор StackAI Фрэнк Идальго поставил цель сделать браузерного агента быстрее и дешевле. Вместо ручного поиска проблем он поручил модели GPT-6 Astra проанализировать агента, протестировать улучшения и сравнить результаты. По оценкам Идальго, работа, которая заняла бы у человека один-два месяца, была выполнена примерно за неделю.

Детали

В ходе анализа GPT-6 Astra выяснила, что агент кэшировал фиксированные инструкции, но не сохранял постоянно растущую историю текста страниц и скриншотов. Из-за этого каждый запрос отправлял всю историю заново по полной стоимости.

Был проведен эксперимент из 144 запусков, в котором тестировались модель GPT-6.1 Sol и три другие передовые модели (обозначенные как Модели A, B и C). Тестировались бюджеты истории в 120 000 и 480 000 символов, а также шесть политик кэширования и работы со скриншотами. Задача заключалась в сборе шести полей для каждой из 32 книг из публичного демо-каталога.

Oracle — Cover

Oracle — Cover

Оптимальная конфигурация позволила накапливать до 20 скриншотов перед удалением старых. На модели GPT-6.1 Sol средняя оценочная стоимость запуска составила 0,47 доллара, а время выполнения — около четырех минут. Для сравнения, исходная настройка на Модели B стоила как минимум 36,21 доллара и занимала не менее 22,5 минут. Снижение стоимости было достигнуто в том числе за счет того, что 89% входных данных стало поступать из кэша, стоимость которого составляет 5% от цены некэшированных данных. Кроме того, увеличение бюджета истории позволило повысить долю успешных запусков с 3 из 18 до 18 из 18.

Анализ

Данный случай наглядно демонстрирует, как ИИ-модели могут применяться для оптимизации других ИИ-систем. Роль человека сводится к постановке целей и проверке результатов, в то время как рутинная работа по рефакторингу кода и проведению десятков параллельных тестов делегируется агентам. Снижение операционных расходов позволяет компаниям предлагать клиентам доступ к более сложным и производительным моделям без ущерба для рентабельности.

Перспектива

Asana уже внедрила изменения в StackAI и разрабатывает инструменты, чтобы сделать подобные эксперименты легко воспроизводимыми. В дальнейшем компания планирует использовать GPT-6 Astra для тестирования функций продукта до их релиза: ИИ будет осуществлять навигацию по платформе, пробовать различные вводы и сообщать об ошибках. Это может стать основой для нового жизненного цикла разработки программного обеспечения, где скорость выпуска обновлений будет зависеть не от написания кода, а от человеческого внимания при управлении парком агентов.

1Password > Card image > Fiber ridge close-up

1Password > Card image > Fiber ridge close-up

loveholidays customer story art card v4

loveholidays customer story art card v4

TL;DR

Главное

Применение ИИ для рефакторинга и тестирования собственного кода позволяет кратно снизить стоимость эксплуатации больших языковых моделей и ускорить их работу.

Ключевые факты

  • /Оценочные затраты на работу агента снижены в 76 раз (до 0,47 доллара за запуск).
  • /Время выполнения задач сократилось с 22,5 до 4 минут.
  • /89% входных данных теперь поступает из кэша за 5% от базовой цены.
  • /Исследование из 144 запусков заняло неделю вместо 1-2 месяцев ручной работы.

Инсайт

Увеличение объема сохраняемой истории не только удешевило процесс за счет правильного кэширования, но и повысило надежность агента — доля успешных выполнений задачи выросла до 100%.

Источник:Openai

Читайте также