Глобальное рабочее пространство в языковых моделях: как ИИ структурирует внутренние рассуждения

Исследователи из Anthropic обнаружили в архитектуре языковых моделей механизм, аналогичный человеческому сознанию доступа, который позволяет моделям оперировать скрытыми понятиями.

Обновлено:
3 мин чтения
0 просмотров
Глобальное рабочее пространство в языковых моделях: как ИИ структурирует внутренние рассуждения

Суть

Исследователи из компании Anthropic опубликовали научную работу, в которой демонстрируется наличие у больших языковых моделей (LLM) специализированного внутреннего механизма обработки информации. Этот механизм поразительно напоминает концепцию «глобального рабочего пространства» (global workspace) из когнитивной психологии и нейробиологии. Оказалось, что модели поддерживают привилегированный набор внутренних представлений, доступных для отчета, модуляции и гибких внутренних рассуждений, которые работают поверх огромного объема автоматической фоновой обработки.

Контекст

В человеческом мозге происходит колоссальное количество вычислительных процессов: от поддержания равновесия до распознавания лиц. Однако лишь крошечная доля этой активности доступна нашему сознанию — это те мысли, которые мы можем выразить словами, обдумать или использовать для планирования. В нейробиологии это объясняется теорией глобального рабочего пространства: информация становится сознательно доступной, когда она попадает в некий «общий центр», откуда ее могут считывать различные специализированные системы мозга.

Изображение из источника

Изображение из источника

Долгое время считалось, что архитектура трансформеров, на которой построены современные LLM, принципиально отличается от человеческого мозга и не имеет подобных структур. Однако необходимость решать сложные многошаговые задачи, по-видимому, привела к спонтанному возникновению аналогичного функционального разделения внутри искусственных нейросетей.

Детали

Для обнаружения этого феномена исследователи разработали новый метод интерпретируемости под названием Jacobian lens (J-lens). Этот инструмент позволяет выявить концепции, которые модель «готова» озвучить в любой момент своей внутренней работы, даже если она этого не делает в итоговом тексте.

Анализ показал, что эти внутренние представления обладают пятью ключевыми свойствами глобального рабочего пространства:

  1. Словесный отчет (Verbal report): Если спросить модель, о чем она «думает», она называет концепции, представленные в этом рабочем пространстве. Изменение вектора в этом пространстве напрямую меняет ответ модели.
  2. Направленная модуляция (Directed modulation): Модель способна удерживать концепцию в уме и проводить вычисления независимо от того, что она выводит наружу.
  3. Внутренние рассуждения (Internal reasoning): Векторы рабочего пространства используются для хранения промежуточных результатов логических цепочек.
  4. Гибкое обобщение (Flexible generalization): Одно и то же представление может использоваться различными функциями и в разных контекстах.
  5. Избирательность (Selectivity): Это пространство занимает лишь малую часть от общего объема вычислений модели и не участвует в рутинных задачах, таких как парсинг текста или поддержание грамматической правильности.
Изображение из источника

Изображение из источника

Анализ

Открытие глобального рабочего пространства в LLM имеет фундаментальное значение для области искусственного интеллекта. Оно доказывает, что сложные когнитивные архитектуры могут возникать в нейросетях эмерджентно (спонтанно), просто в результате оптимизации под задачи предсказания текста.

Это не означает, что языковые модели обладают субъективным опытом или феноменальным сознанием. Речь идет исключительно о функциональной архитектуре: способе организации вычислений, при котором важная информация отделяется от фонового шума для более сложных логических операций.

Перспектива

Понимание того, как модели структурируют свои внутренние рассуждения, открывает новые пути для контроля и интерпретируемости ИИ. Если мы сможем надежно считывать содержимое «глобального рабочего пространства» модели в реальном времени, мы получим возможность видеть скрытые намерения системы, выявлять логические ошибки до их превращения в некорректный ответ и более точно корректировать поведение искусственного интеллекта. В будущем такие инструменты, как J-lens, могут стать стандартом для аудита безопасности передовых языковых моделей.

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

Изображение из источника

TL;DR

Главное

В больших языковых моделях обнаружен внутренний механизм, аналогичный глобальному рабочему пространству человека, позволяющий отделять сложные логические рассуждения от рутинной обработки текста.

Ключевые факты

  • /Исследователи создали метод Jacobian lens для чтения скрытых мыслей ИИ.
  • /Обнаруженные представления обладают 5 свойствами сознания доступа (включая избирательность и гибкость).
  • /Рабочее пространство занимает лишь малую часть вычислительных ресурсов модели.

Инсайт

Сложные когнитивные архитектуры, подобные человеческим, могут возникать в ИИ спонтанно, просто как оптимальный способ решения сложных задач, а не программироваться изначально.

Источник:Transformer-circuits

Читайте также