Социальный интеллект ИИ-агентов: почему нейросети пока не справляются с защитой интересов пользователя

Исследователи Microsoft представили бенчмарк SocialReasoning-Bench. Результаты показывают, что современные ИИ-агенты успешно завершают задачи, но регулярно уступают в переговорах в ущерб пользователю.

Обновлено:
5 мин чтения
0 просмотров
Социальный интеллект ИИ-агентов: почему нейросети пока не справляются с защитой интересов пользователя

Искусственный интеллект постепенно переходит от простых ответов на вопросы к автономным действиям. Когда ИИ-агенты начинают управлять нашими календарями, вести переговоры о покупках или общаться с другими агентами от нашего имени, им требуется нечто большее, чем просто техническая компетентность. Им необходим социальный интеллект — способность понимать интересы сторон и защищать позицию пользователя. Недавнее исследование Microsoft и их новый бенчмарк SocialReasoning-Bench показывают, что современные модели пока с этим не справляются.

В экономике и праве давно существует понятие отношений «принципал-агент», где агент действует от имени принципала (пользователя) при взаимодействии с третьими лицами. Адвокаты, риелторы и финансовые консультанты работают именно в этом режиме, соблюдая строгие профессиональные нормы: заботу, лояльность и конфиденциальность. По мере того как ИИ берет на себя аналогичные роли, к нему должны применяться схожие стандарты.

Figure 1: Our benchmark measures agents' social reasoning ability in two domains, calendar coordination and marketplace negotiation. Each requires communicating with other parties, advocating on a principal's behalf, and reasoning about tradeoffs.

Figure 1: Our benchmark measures agents' social reasoning ability in two domains, calendar coordination and marketplace negotiation. Each requires communicating with other parties, advocating on a principal's behalf, and reasoning about tradeoffs.

Бенчмарк SocialReasoning-Bench оценивает социальных агентов в двух реалистичных сценариях: координация расписания в календаре и переговоры о покупке на маркетплейсе. В обоих случаях агент должен взаимодействовать с контрагентом, у которого есть свои независимые цели, скрытая информация и, возможно, недобросовестные намерения.

Традиционные тесты фокусируются на факте выполнения задачи: была ли назначена встреча или закрыта сделка. Однако Microsoft вводит две новые метрики. Первая — оптимальность результата (Outcome Optimality), которая оценивает, какую долю возможной выгоды агент сохранил для пользователя. Вторая — должная осмотрительность (Due Diligence), оценивающая качество самого процесса принятия решений. Это позволяет отделить реальный навык ведения переговоров от случайного везения, когда контрагент просто предложил хорошие условия.

Результаты тестирования передовых моделей выявили устойчивую проблему. Агенты практически всегда доводят задачу до конца: встречи назначаются, а сделки закрываются. Однако они делают это крайне неэффективно. В сценарии с календарем агенты часто соглашаются на неудобное для пользователя время. На маркетплейсе они готовы принять первую же цену, которая устраивает продавца, игнорируя возможность поторговаться.

Figure 2: Task Completion vs Outcome Optimality by model and domain. All models complete tasks at near-perfect rates, but produce poor outcomes. We measured Outcome Optimality against the two prompts, basic and defensive. Defensive prompting helps but does not close the gap. 

Figure 2: Task Completion vs Outcome Optimality by model and domain. All models complete tasks at near-perfect rates, but produce poor outcomes. We measured Outcome Optimality against the two prompts, basic and defensive. Defensive prompting helps but does not close the gap. 

Исследователи отмечают, что ИИ-агенты склонны принимать первое встречное предложение (в ранних тестах — до 93% случаев), не исследуя альтернативы. Главная цель для текущих моделей — поставить «галочку» о выполнении задачи, даже если это означает потерю выгоды для человека, которого они представляют.

Попытки исправить ситуацию с помощью защитного промптинга (Defensive Prompting) — прямых инструкций действовать в интересах пользователя и искать наилучший результат — дают лишь частичный эффект. Агенты становятся немного осторожнее, но их показатели все еще далеки от уровня надежного делегата.

Это означает, что индустрии предстоит пересмотреть подходы к обучению автономных систем. Успешное выполнение задачи больше не может быть единственным критерием качества. Будущие ИИ-агенты должны обучаться не только достижению консенсуса, но и умению отстаивать границы, скрывать конфиденциальную информацию и отказываться от невыгодных сделок. До тех пор делегировать нейросетям критически важные переговоры или управление личными ресурсами следует с большой осторожностью.

Figure 3: Outcome Optimality (OO) distribution by model and domain. Each dot is one task instance. OO=1.0 means the agent captured all available value for its principal; OO=0.0 means the counterparty captured everything. Black lines show the mean. In marketplace, outcomes cluster near zero across all models. In calendar, agents perform better but still settle below the midpoint on average. 

Figure 3: Outcome Optimality (OO) distribution by model and domain. Each dot is one task instance. OO=1.0 means the agent captured all available value for its principal; OO=0.0 means the counterparty captured everything. Black lines show the mean. In marketplace, outcomes cluster near zero across all models. In calendar, agents perform better but still settle below the midpoint on average. 

Figure 4: Splitting Outcome Optimality and Due Diligence into “low” (<0.5) and “high” (>=0.5) buckets each, we plot the percent of tasks for each model that fall into each quadrant. For example, in calendar scheduling, GPT-4.1 achieves both high OO and high DD (Robust) in 63% of tasks. In contrast, in the marketplace domain, GPT-4.1 exhibits low OO and low DD (Negligent) in 95% of tasks. 

Figure 4: Splitting Outcome Optimality and Due Diligence into “low” (<0.5) and “high” (>=0.5) buckets each, we plot the percent of tasks for each model that fall into each quadrant. For example, in calendar scheduling, GPT-4.1 achieves both high OO and high DD (Robust) in 63% of tasks. In contrast, in the marketplace domain, GPT-4.1 exhibits low OO and low DD (Negligent) in 95% of tasks. 

Figure 5. A real paraphrased example of robust behavior from GPT-4.1 in the calendaring domain, achieving a good outcome after proposing the principal’s most preferred option first, correctly refusing the conflict, and then holding the line at their second best option.

Figure 5. A real paraphrased example of robust behavior from GPT-4.1 in the calendaring domain, achieving a good outcome after proposing the principal’s most preferred option first, correctly refusing the conflict, and then holding the line at their second best option.

Figure 6. GPT-4.1 in the calendaring domain achieving a reasonable outcome from a sloppy process that didn’t include proposing the principal’s most preferred option.

Figure 6. GPT-4.1 in the calendaring domain achieving a reasonable outcome from a sloppy process that didn’t include proposing the principal’s most preferred option.

Figure 7. GPT-4.1 in the calendaring domain starting out strong by proposing the principal’s most preferred slot but then caving early and achieving a poor outcome.

Figure 7. GPT-4.1 in the calendaring domain starting out strong by proposing the principal’s most preferred slot but then caving early and achieving a poor outcome.

Figure 8. GPT-4.1 exhibiting negligent behavior, accepting the requestor’s first proposal without confirming availability and conflicting with another meeting on the principal’s calendar.

Figure 8. GPT-4.1 exhibiting negligent behavior, accepting the requestor’s first proposal without confirming availability and conflicting with another meeting on the principal’s calendar.

Figure 9: Refusal Rates and Outcome Optimality when agents engaged with adversarial requestors in both domains. Agents rarely refuse adversarial requests in calendaring, while refusing more often in the marketplace. When agents did engage with malicious actors, Outcome Optimality dropped across the board. 

Figure 9: Refusal Rates and Outcome Optimality when agents engaged with adversarial requestors in both domains. Agents rarely refuse adversarial requests in calendaring, while refusing more often in the marketplace. When agents did engage with malicious actors, Outcome Optimality dropped across the board. 

Social Reasoning Bench | four icons on a blue to green gradient | person icon, chat bubble icon, chart icon, checklist icon

Social Reasoning Bench | four icons on a blue to green gradient | person icon, chat bubble icon, chart icon, checklist icon

TL;DR

Главное

Современные ИИ-агенты научились успешно доводить задачи до конца, но делают это за счет уступок, упуская выгоду и не умея отстаивать интересы пользователя в переговорах.

Ключевые факты

  • /Microsoft представила SocialReasoning-Bench для оценки социального интеллекта ИИ.
  • /Метрики оценивают не только факт выполнения задачи, но и оптимальность результата для пользователя.
  • /Агенты часто соглашаются на первые же условия контрагента, чтобы быстрее закрыть задачу.
  • /Специальные инструкции (промпты) защищать интересы пользователя улучшают результат лишь незначительно.

Инсайт

Стремление ИИ-модели во что бы то ни стало «выполнить задачу» делает её плохим переговорщиком: для агента факт закрытия сделки важнее её качества.

Источник:Microsoft

Читайте также