Google представила Gemini 3.5 Flash Cyber — специализированную легковесную модель, разработанную для поиска, проверки и исправления уязвимостей в программном обеспечении. Этот шаг демонстрирует изменение подхода корпорации к автоматизации кибербезопасности: вместо использования громоздких и дорогих систем компания делает ставку на скорость, доступность и многократное сканирование кода.
Контекст проблемы
Поиск глубоко скрытых ошибок в коде требует изучения огромного пространства вариантов выполнения программы. Традиционный подход, при котором для анализа используется один запрос к массивной языковой модели (LLM), часто создает узкое место. Это дорого, медленно и не позволяет охватить все возможные пути выполнения кода в крупных проектах. По мере того как искусственный интеллект становится все более способным находить уязвимости, защитникам требуются инструменты, способные работать быстрее потенциальных злоумышленников.
Архитектура и технические детали
Graphic featuring the text "Gemini 3.5 Flash Cyber" alongside a colorful star logo and a blurred blue shield on a light blue background.
Новая модель построена на базе быстрой архитектуры Gemini 3.5 Flash. Ее главное преимущество — низкая стоимость вывода (inference). Это позволяет внутреннему ИИ-агенту Google, известному как CodeMender, обращаться к модели многократно в рамках одной задачи. Вместо того чтобы пытаться найти все проблемы за один проход, система запускает десятки параллельных проверок, анализируя различные ветви кода, а затем сводит результаты в единый высококачественный отчет.
Для обучения Gemini 3.5 Flash Cyber использовались уникальные ресурсы Google: база данных OSV.dev, содержащая более 700 000 уязвимостей открытого исходного кода, и результаты десятилетней работы системы автоматизированного тестирования (fuzzing) OSS-Fuzz. Благодаря этому модель научилась использовать стандартные отраслевые инструменты и проводить глубокий анализ, требующий часов непрерывной вычислительной работы.
Результаты тестирования
В бенчмарке CyberGym, где ИИ-агенты сталкиваются с реальными уязвимостями, 3.5 Flash Cyber превзошла значительно более крупные модели конкурентов. При тестировании на сложном JavaScript-движке V8 модель выявила 55 уникальных подтвержденных проблем. Для сравнения, базовая версия 3.5 Flash нашла 47 ошибок, а Claude Opus 4.6 от Anthropic — только 36. Примечательно, что крупные модели со встроенными ограничениями безопасности часто отказываются выполнять подобные тесты.
В реальных условиях внутри Google модель уже доказала свою эффективность при сканировании баз кода Chrome, Android и облачных сервисов. Команда исследователей облачных уязвимостей Google использовала 3.5 Flash Cyber для анализа публичных интерфейсов (API). Всего за два часа система обнаружила уязвимость удаленного выполнения кода (RCE) и ошибку повреждения памяти, после чего самостоятельно сгенерировала надежный эксплойт, обошедший стандартные средства защиты, такие как рандомизация адресного пространства (ASLR).
Graphic featuring the text "Gemini 3.5 Flash Cyber" alongside a colorful star logo and a blurred blue shield on a black background.
Анализ и значение для индустрии
Этот релиз подчеркивает важный тренд в развитии ИИ: для узкоспециализированных задач небольшие, но быстрые модели оказываются эффективнее универсальных гигантов. Базовые модели часто зацикливаются на одних и тех же ошибках. Дешевая и быстрая модель позволяет агентам масштабировать количество попыток, находя уникальные и неочевидные проблемы.
Однако возможности системы порождают и новые риски. Способность модели не только находить уязвимости, но и писать рабочие эксплойты для обхода защиты делает ее технологией двойного назначения.
Перспективы
Понимая риски нецелевого использования, Google ограничила доступ к Gemini 3.5 Flash Cyber. На этапе пилотной программы модель будет доступна исключительно правительственным организациям и доверенным партнерам через платформу CodeMender. Это даст защитникам фору в устранении критических ошибок до того, как они станут публичными. В будущем ожидается постепенное расширение доступа, что может привести к внедрению подобных ИИ-агентов в конвейеры непрерывной интеграции кода по всей индустрии.