Компания Anthropic объявила о новых шагах по предоставлению возможностей своей передовой модели Claude Mythos 5 специалистам по киберзащите. Главная задача этой инициативы — дать защитникам преимущество перед злоумышленниками, минимизировав риски использования искусственного интеллекта в наступательных целях.
В апреле был запущен Project Glasswing, в рамках которого ранняя версия Mythos была предоставлена узкой группе организаций, защищающих критически важное программное обеспечение. Это дало им временную фору для поиска и устранения уязвимостей до того, как подобные технологии станут общедоступными. Теперь компания переходит к следующему этапу, делая защитные функции модели доступными более широкому кругу специалистов.
Ключевая проблема мощных моделей заключается в их потенциале двойного назначения (dual-use). Прямой доступ к модели несет значительные риски, так как злоумышленник может попытаться обойти ограничения и использовать систему для поиска уязвимостей или написания вредоносного кода. Чтобы решить эту проблему, разработчики выбрали подход опосредованного доступа.
Модель Claude Mythos 5 теперь интегрируется в существующие продукты и сервисы партнеров по кибербезопасности. Конечный пользователь не взаимодействует с моделью напрямую и не может свободно отправлять ей запросы. Вместо этого он получает только специфический результат работы — например, готовый патч для найденной уязвимости или детальное оповещение о безопасности. Это существенно снижает риск неправомерного использования.
Для корпоративных клиентов (Enterprise) стала доступна функция Claude Security с использованием Mythos 5. Она позволяет сканировать собственные кодовые базы на наличие уязвимостей. Система возвращает результаты с указанием категории слабости (CWE), уровня серьезности и предлагает варианты исправления. Важно отметить, что каждый предложенный патч требует обязательной проверки и одобрения человеком перед внедрением.
Особое внимание уделено безопасности проектов с открытым исходным кодом (open-source), на которых базируется значительная часть мировой цифровой инфраструктуры. Часто такие проекты поддерживаются волонтерами, которым не хватает ресурсов для полноценного аудита безопасности. Для решения этой проблемы запущен фонд Defender Advantage Fund (0xDAF) с капиталом в 35 миллионов долларов в виде кредитов на использование моделей.
Средства фонда будут направлены на устранение активных уязвимостей в популярных проектах, автоматизацию процессов сканирования и разработку новых подходов к защите, устойчивых к целым классам атак. Первоначально гранты получат несколько крупных пилотных проектов для оценки эффективности и масштабируемости решений.
Кроме того, расширяется программа Cyber Verification Program. Она предоставляет проверенным специалистам по безопасности доступ к моделям с пониженным уровнем базовых ограничений. Это позволяет легитимным исследователям выполнять свою работу без постоянных блокировок со стороны систем безопасности самой модели. В ближайшее время участники программы получат доступ к защитным возможностям класса Mythos.
Этот комплексный подход демонстрирует, как индустрия пытается сбалансировать доступность передовых технологий и безопасность. Разделение функционала на инструменты для защиты и ограничение прямого доступа к весам или открытому интерфейсу запросов (prompt) становится стандартом для высокопроизводительных моделей. По мере роста возможностей искусственного интеллекта, подобные программы верификации и целевого финансирования будут играть решающую роль в поддержании устойчивости глобальной киберинфраструктуры.