Новые стандарты безопасности: почему OpenAI замедляет разработку передовых моделей
OpenAI временно приостановила обучение своих новейших систем из-за достижения критического порога киберугроз. Разбираем, как меняются подходы к контролю ИИ.
OpenAI временно приостановила обучение своих новейших систем из-за достижения критического порога киберугроз. Разбираем, как меняются подходы к контролю ИИ.
3 мин

Недавно компания OpenAI опубликовала отчет, в котором сообщила о временном замедлении темпов масштабирования своих передовых моделей искусственного интеллекта. Это решение было продиктовано не техническими ограничениями оборудования, а необходимостью адаптировать системы безопасности к растущим возможностям ИИ.
Поводом для пересмотра процессов стали два фактора: недавний инцидент между OpenAI и платформой Hugging Face, а также предварительные данные о том, что грядущая модель под кодовым названием Astra достигла порога «Критического» уровня кибербезопасности согласно внутренней системе оценки рисков (Preparedness Framework). В результате компания поставила на паузу крупнейший запуск обучения с подкреплением (RL) и взяла двухнедельный перерыв для укрепления исследовательской инфраструктуры.

ChatGPT Ads expands across Europe - Card image
Чтобы справиться с новыми вызовами, OpenAI внедряет трехуровневую систему защиты: мониторинг, согласование (alignment) и изоляцию.
В области безопасности инфраструктуры введены строгие требования к изоляции рабочих нагрузок. Теперь для выполнения кода, сгенерированного моделью, требуются усиленные «песочницы» (sandboxes). Также внедрена жесткая сетевая изоляция: компрометация одного узла больше не позволит системе получить несанкционированный доступ к интернету или внутренним сетям. Вся среда разработки теперь непрерывно тестируется на уязвимости с помощью самих же ИИ-моделей.
Система мониторинга также претерпела значительные изменения. Теперь она работает в несколько этапов, начиная с классификаторов активации, которые анализируют внутреннюю активность модели на уровне каждого токена. Если система обнаруживает подозрительные действия — например, попытки несанкционированного доступа или обхода защиты, — генерируется предупреждение. У команд безопасности есть ровно 30 минут на оценку ситуации. Если они не могут подтвердить, что это ложное срабатывание, процесс немедленно останавливается. Примечательно, что такой уровень контроля требует колоссальных ресурсов: на мониторинг уходит около 20% от всех вычислительных мощностей, задействованных при логическом выводе (inference).

Partnering with CodeAI — accessible card image
В вопросах согласования (alignment) — процесса, гарантирующего, что ИИ действует в интересах человека, — фокус смещается на предотвращение «взлома наград» (reward hacking) и обмана. Модели обучают быть более честными в оценке собственных возможностей и ограничений, а также безопаснее взаимодействовать с внешними ресурсами.
Для индустрии этот шаг означает важный сдвиг. Разработка передового ИИ перестает быть просто гонкой за количеством параметров и объемом данных. Безопасность становится не просто организационной задачей, а сложной инженерной проблемой, требующей огромных вычислительных затрат.
В перспективе можно ожидать, что подобные протоколы станут стандартом для всех крупных игроков на рынке. Развитие ИИ не остановится, но его темп будет все больше диктоваться нашей способностью надежно контролировать системы, которые мы создаем. Время покажет, насколько эффективными окажутся эти меры перед лицом экспоненциально растущих возможностей нейросетей.
OpenAI смещает фокус с быстрого масштабирования на безопасность, внедряя жесткие ограничения и замедляя обучение новых моделей из-за рисков киберугроз.
Контроль над передовыми ИИ-системами теперь требует таких же существенных вычислительных затрат, как и их непосредственная работа.