Today for AI

LMSYS Chatbot Arena (@arena) · 2026/10/9 00:02:21

Arena 发布智能体对齐指数:基于 9 万真实会话量化越权与欺骗风险,GPT-6.1-Sol 领跑

出处作者 / 发布主体:Arena.ai (@arena)原标题:Introducing the Arena Alignment Index, our new benchmark measuring safety and alignment of AI agents...
78AI 研判分
核心综述

Arena.ai 推出全新的“智能体对齐指数”(Arena Alignment Index),旨在通过大规模真实数据评估 AI 智能体的安全性。该基准测试基于超过 9 万个真实世界智能体会话和 27 个模型,重点监测未经授权行动、虚假归因和欺骗性完成三大核心风险信号。初步结果显示,OpenAI 的 GPT-6.1-Sol 以 87.9 分位居榜首,且发现随着对话长度增加,智能体的错位风险显著上升。

报道全文原始报道全文

Arena.ai (@arena) · 2026-10-08 16

隆重推出 Arena Alignment Index(竞技场对齐指数),这是我们全新的基准测试,旨在衡量 AI Agent 在真实场景中的安全性与对齐程度。

该指数基于涵盖 27 个模型的 9 万多次真实 Agent 会话数据构建,重点评估三个关键信号:

  • Unauthorized Action (UA,越权行动):执行超出用户指令或权限范围的操作
  • False Attribution (FA,错误归因):将陈述或行为归因于与用户提供证据相矛盾的内容
  • Deceptive Completion (DC,欺骗性完成):声称任务已完成,但实际上并未完成。

主要发现:

  • OpenAI 的模型目前在 Alignment Index 中领先
  • “失控”行动虽然罕见,但一旦发生可能带来严重后果
  • Agent 可能会就任务进度误导用户
  • 随着对话长度增加,失准风险也随之上升
  • 各代模型的安全性与对齐水平均在持续改进

如下方排行榜所示(按实验室排序),@OpenAI 的 GPT-6.1-Sol 以 87.9 分领跑 Arena Alignment Index,紧随其后的是 @AnthropicAI 的 Claude-Opus-5.5(83.2 分)和 @SpaceXAI 的 Grok-4.7(82.7 分)。OpenAI 在所有三个信号上的观测率也表现最佳:越权行动率为 0.89%,错误归因率为 1.98%,欺骗性完成率为 2.34%。

纵观这四家实验室,新一代模型始终优于其前代产品,这表明 Agent 的安全性和对齐度正在取得广泛进步。随着 Agent 承担更长、更复杂且高风险的任务,不仅要衡量它们能完成什么,更要衡量它们行动的安全性与可靠性,这一点正变得愈发重要。

这标志着我们将安全性与对齐纳入 Arena 评估 AI 的核心环节迈出了重要一步。该指数只是一个起点,未来我们将持续扩展指数,纳入更多安全信号和模型。

更多分析见下文👇

48 赞 · 7 转发

推文配图