Компания Cognition, разработчик автономного программного инженера Devin, начала использовать модель GPT-6 Astra от OpenAI. Главная цель этого шага — научить систему самостоятельно тестировать написанный код и предоставлять наглядные доказательства его работы. По замыслу создателей, это должно радикально сократить время, которое разработчики-люди тратят на проверку кода (code review), и ускорить выпуск новых продуктов.
По мере того как ИИ-агенты вроде Devin становятся все более самостоятельными и пишут все больше строк кода, в процессе разработки возникает серьезное узкое место. Этим узким местом становится человек. Если агент генерирует тысячи строк сложных алгоритмов, но инженер должен вручную вычитывать каждую из них, общая эффективность процесса стремительно падает. В Cognition осознали, что для реального масштабирования разработки ИИ должен сам доказывать работоспособность своих решений.
Perplexity customer story art card
Модель GPT-6 Astra применяется во всей линейке продуктов Cognition: от базового облачного агента Devin до интерфейса командной строки и настольных приложений. Соучредитель компании Уолден Ян отмечает, что ключевое преимущество новой модели заключается в ее способности проверять и подтверждать, что функции работают именно так, как ожидалось.
В качестве примера приводится процесс тестирования мобильной игры для iPhone. Devin самостоятельно запускает написанную игру в симуляторе, записывает видео игрового процесса и формирует подробный отчет. В этом документе указано, какие именно проверки были успешно пройдены, а какие участки кода остались без внимания. Кроме того, при получении скриншота с ошибкой от клиента, система с помощью Astra способна проанализировать визуальные данные, исправить баг и прислать ответный скриншот с уже решенной проблемой.
Scaling Storage for 1 Billion ChatGPT Users (Part I) card image
Этот шаг знаменует важный переход в индустрии: от ИИ как простого «генератора текста и кода» к ИИ как «достоверному исполнителю». Способность системы предоставить визуальные и документальные доказательства своей работы меняет саму парадигму взаимодействия человека и машины. Инженеру больше не нужно вчитываться в логику каждой функции — достаточно оценить итоговый отчет о тестировании и просмотреть видеозапись симуляции. Это элегантно решает фундаментальную проблему доверия к сгенерированному коду.
Уолден Ян ожидает, что в обозримом будущем объем ручной проверки кода продолжит неуклонно снижаться, а скорость доставки готового программного обеспечения возрастет. Если эта тенденция закрепится, роль программиста окончательно сместится от написания и построчной проверки кода к архитектурному надзору и управлению автономными агентами. Время покажет, насколько надежными окажутся такие автоматизированные тесты в действительно сложных корпоративных системах, однако вектор развития отрасли уже совершенно очевиден.