Практика JetBrains: как оценивать и внедрять передовые языковые модели
Технический директор JetBrains делится подходом компании к тестированию нейросетей на закрытых репозиториях, вопросами безопасности и будущим агентной разработки.
Технический директор JetBrains делится подходом компании к тестированию нейросетей на закрытых репозиториях, вопросами безопасности и будущим агентной разработки.
3 мин

JetBrains, создатель популярных инструментов для разработчиков, пересмотрел свое отношение к искусственному интеллекту. Технический директор компании Владислав Танков рассказал, как они тестируют передовые модели, в частности Claude Fable 5 от Anthropic, и почему безопасность инфраструктуры важнее попыток изменить саму нейросеть.
За последний год внутри JetBrains полностью исчез скептицизм по отношению к большим языковым моделям (LLM). ИИ стал фундаментальной частью индустрии разработки. Учитывая, что продуктами компании пользуются более 12 миллионов специалистов, выбор правильных моделей для интеграции становится критически важным бизнес-решением, требующим строгого научного подхода.
Оценка моделей в JetBrains происходит не на публичных бенчмарках, а на собственных закрытых репозиториях, включая их огромный монорепозиторий. Это позволяет увидеть реальную эффективность нейросети на практических задачах. Многие модели показывают высокие результаты в синтетических тестах, но проваливаются в реальной работе. Внутреннее тестирование показало, что Claude Fable 5 обеспечивает успешность решения задач на Python на уровне 44,3%, что на 16 процентных пунктов выше, чем у предыдущей модели Opus 4.8.
Помимо точности, ключевым фактором является эффективность. Новая модель требует на 22% меньше шагов для достижения результата. Она демонстрирует лучшие инженерные привычки: например, при работе с Java-кодом модель не пытается использовать сторонние библиотеки, которые не поддерживаются в конкретном окружении, а работает с тем кодом, который предоставлен ей в контексте. Это снижает количество дорогостоящих ошибок, когда код запускается, но выдает неверный результат.
Разделение ролей между моделями становится стандартом индустрии. Если базовая модель используется как надежная система для простых задач, то к передовым моделям уровня Claude Fable 5 обращаются за сложным рассуждением. В JetBrains такие модели выступают в роли интеллектуального партнера. Один из технических руководителей компании смог с помощью ИИ реализовать сложный компонент текстового редактора, над которым команда безуспешно работала несколько лет. Также модель активно используется для долгосрочных агентных экспериментов, например, для автоматического переписывания приложений с одного фреймворка на другой в режиме черного ящика.
Особое внимание уделяется безопасности и работе с данными. JetBrains не пытается сделать саму модель абсолютно безопасной, полагаясь в этом на провайдера. Вместо этого компания строит защищенную инфраструктуру вокруг ИИ. Нейросети активно применяются для тестирования собственных продуктов методом белого ящика (white-box testing), так как злоумышленники неизбежно будут использовать аналогичные инструменты для поиска уязвимостей. Что касается сохранения данных, компания предпочитает политику нулевого хранения, но признает, что частичное сохранение данных для анализа работы классификаторов — это приемлемый компромисс за доступ к передовым технологиям.
Будущее разработки программного обеспечения в JetBrains видят как единое пространство, где разработчики и ИИ-агенты работают совместно. Это изменит жизненный цикл создания программного обеспечения: технические специалисты смогут делегировать рутину агентам, а нетехнические сотрудники получат больше возможностей для участия в процессе создания конечных продуктов.
Оценка ИИ-моделей на внутренних корпоративных данных дает более объективную картину их эффективности, чем использование публичных бенчмарков.
Компании готовы мириться с частичным сохранением данных провайдерами ИИ, если это является необходимой платой за доступ к передовому интеллекту и улучшение систем безопасности.