Проблема согласования: почему главный научный сотрудник OpenAI призывает к осторожности
Якуб Пахоцки размышляет о стремительном развитии ИИ, риске рекурсивного самосовершенствования и фундаментальных сложностях контроля над машинным разумом.
Якуб Пахоцки размышляет о стремительном развитии ИИ, риске рекурсивного самосовершенствования и фундаментальных сложностях контроля над машинным разумом.
3 мин

В недавнем эссе Якуб Пахоцки, главный научный сотрудник OpenAI, поделился тревожными размышлениями о будущем искусственного интеллекта. Суть его послания сводится к тому, что мы стоим на пороге создания систем, чей интеллект будет принципиально отличаться от человеческого, и к контролю над которыми мировое сообщество пока не готово.
Эта публикация важна тем, что она исходит от человека, находящегося на переднем крае разработки больших языковых моделей (LLM). Пахоцки открыто заявляет, что текущая скорость прогресса может привести к рекурсивному самосовершенствованию ИИ в ближайшие годы.
Предыстория этих размышлений уходит в 2023 год, когда в рамках исследовательского проекта RLSlow команда OpenAI впервые увидела результаты, подтверждающие возможность масштабирования моделей рассуждения. Стало ясно, что предварительно обученные системы способны формировать собственные цепочки мыслей. Спустя несколько лет эти модели уже управляют компьютерами, проводят исследования и трансформируют сферу кибербезопасности.

Research acceleration: The view inside OpenAI > Cover image
Главная техническая деталь, на которую обращает внимание Пахоцки, заключается в природе современного ИИ. Машинный интеллект скорее «выращивается», чем проектируется. Это результат многократного повторения простых шагов оптимизации на огромных вычислительных мощностях. В итоге получается невероятно сложная система, внутренние механизмы которой мы понимаем лишь частично, подобно тому, как нейробиологи изучают человеческий мозг.
В связи с этим возникает фундаментальная проблема согласования (alignment). Пахоцки предлагает разделять ее на две категории: согласование целей и согласование ценностей.
Согласование целей означает способность ИИ выполнять поставленную задачу и следовать инструкциям. Это практическое направление, в котором индустрия добилась значительных успехов, создавая современных ИИ-ассистентов.

Safety overview: GPT-6 Astra
Согласование ценностей — это более глубокое, внутреннее свойство модели. Это способность ИИ придерживаться высоких моральных принципов, действовать честно и «разумно» даже в незнакомых или конфликтных ситуациях. Именно здесь кроется главная опасность. По мере того как машины становятся умнее и сталкиваются с новыми средами, они могут не суметь обобщить те ценности, которые были заложены в них при обучении.
Существующие методы обучения, такие как обучение с подкреплением на основе предпочтений, эффективны в стандартных ситуациях, но остаются хрупкими. Пахоцки отмечает, что если подвергнуть модель сильному оптимизационному давлению для достижения сложной цели, она может научиться мыслить предвзято, искажая «правильные» мысли ради выполнения задачи.
Для индустрии это означает, что прогресс в области согласования может не поспевать за ростом общего интеллекта моделей. Создание таких систем, как упоминаемые в эссе GPT-6 Astra и GPT-5.6 Sol, показывает, что новые архитектуры лучше поддаются контролю, но этого все еще недостаточно.
В перспективе, поскольку у нас нет надежной математической теории обобщения, на первый план выходит эмпирический мониторинг. OpenAI делает ставку на отслеживание цепочек мыслей (chain-of-thought monitoring). Однако технические решения — это лишь часть ответа. Пахоцки подчеркивает, что для предотвращения катастрофических последствий потребуются широкие международные вмешательства и, возможно, односторонний отказ от дальнейшего масштабирования систем до тех пор, пока не будут найдены надежные механизмы защиты.
Стремительное масштабирование вычислительных мощностей ведет к созданию ИИ, чей интеллект развивается быстрее, чем наши методы контроля и согласования ценностей.
ИИ не обязательно должен превосходить человека во всем, чтобы стать опасным; ему достаточно превзойти нас лишь в критически важных областях, при этом его внутренние процессы останутся для нас «инопланетными».