Today for AI

Artificial Analysis · 2026/10/8 08:00:00

Harvey 发布 LAB-AA v1.1 基准:引入幻觉门控全通过率以评估法律智能体

出处作者 / 发布主体:Artificial Analysis原标题:Announcing Harvey LAB-AA v1.1: adding hallucination checks to raise the bar for agentic legal work
68AI 研判分
核心综述

Harvey 与 Artificial Analysis 合作推出 Harvey LAB-AA v1.1,升级了针对真实世界法律工作的 AI 智能体评分方法。新版本核心引入了“幻觉门控全通过率”(Hallucination-Gated All-Pass Rate)作为主要指标,要求交付物在满足所有评分标准的同时不得包含实质性幻觉。该基准基于 120 个由 Harvey 团队构建的私有法律任务(涵盖并购、资本市场、税务等),通过三法官面板对每项标准进行评级,旨在提高法律领域智能体应用的可靠性门槛。

报道全文原始报道全文

本文目录34 个章节

Artificial Analysis

所有文章

2026 年 10 月 8 日

发布 Harvey LAB-AA v1.1:引入幻觉检测,提升智能体法律工作的标准

我们与 Harvey 合作推出了 Harvey LAB-AA v1.1,更新了针对执行真实世界、智能体式法律工作的 AI 代理的“法律智能体基准测试”(Legal Agent Benchmark, LAB)评分方法。现在,每一项交付成果都会对照其源文档进行幻觉检查;由三位评委组成的小组对每项评分标准进行打分;新的核心指标——“幻觉门控全通过率”(Hallucination-Gated All-Pass Rate),仅在交付成果满足所有评分标准且不含实质性幻觉时,才认定任务通过。

每个模型需完成由 Harvey 团队构建的 120 项私有法律任务,涵盖公司并购与资本市场、税务、诉讼及破产等领域。这是增强 Harvey LAB-AA 方法论的第一步。在未来的更新中,我们将继续与 Harvey 合作,以更全面地考量律师所重视的各项因素,包括风格与语气等可用性特征。

得分

Harvey LAB-AA v1.1:幻觉门控全通过率

在所有任务上,评委小组认定每项评分标准均通过的份额的平均值 · 若出现任何实质性幻觉,该任务得分为零 · 由 Artificial Analysis 独立基准测试

Grok 4.7 (xhigh) 以 9.4% 的幻觉门控全通过率在 Harvey LAB-AA v1.1 中领先,略微超过 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%。随后是 GPT-6.1 Sol (max),得分为 6.9%;接着是 Claude Fable 5.1 (max, 启用回退机制) 为 6.4%,Kimi K3 (max) 为 5.3%,以及 Claude Opus 5.5 (max, 启用回退机制) 为 4.2%。Claude 系列模型启用了 Anthropic 的回退机制,但从未实际触发使用。

考虑幻觉因素改变了 Harvey LAB-AA 的排名。若不设幻觉门槛,Muse Spark 1.3 将以 26.7% 的全通过率明显领先,但其三分之二的通过案例包含实质性幻觉。GPT-6 Astra 保留了几乎全部的通过案例(从 8.9% 降至 8.6%),并在全通过率并列第 10 名跃升至幻觉门控全通过率第 3 名。GPT-6.1 Sol 的降幅相对较小,从 7.5% 降至 6.9%。在所测试的所有模型中,超过 60% 原本通过的测试结果包含实质性幻觉,且若干模型在计入幻觉因素后得分为 0%。

大多数模型能够完成绝大部分评分标准:16 个模型的评分标准通过率为 85.6% 至 96.0%。这些评分标准从整体角度评估每项交付成果,而非仅关注那些被特意选为高难度的标准。我们在幻觉门槛(hallucination gate)之前报告“标准通过率”(Criterion Pass Rate),并列出每个任务中的实质性幻觉数量,以分别展示评分标准的覆盖情况和事实依据性。

如需获取最新结果,请参阅 Harvey LAB-AA 评估页面。本文展示的是截至 2026 年 10 月 8 日的数据。

Harvey LAB-AA v1.1 的变化

我们与 Harvey 合作,将 Harvey LAB-AA 更新至 v1.1 版本。此次更新改变了基准测试的评分和计分方式,因此 v1.1 的结果不能直接与先前发布的 v1.0 数据进行比较:

  • 幻觉审计。 现在,模型提交的每一项交付成果都会对照任务的源文档进行两阶段检查;若某任务没有可用的提交内容,则得分为零且不进行审计。第一阶段的评审员会在三个类别中标记候选幻觉——与源材料相矛盾、捏造源内容以及缺乏源支持的特定断言——随后同一位评审员在第二阶段根据该任务的源文档重新核查每个标记,剔除不成立的标记,并将剩余标记归类为实质性或轻微幻觉。
  • 幻觉门槛全通过率作为主要指标。 主要指标现为“幻觉门槛全通过率”(Hallucination-Gated All-Pass Rate):只有当交付成果满足所有评分标准且不含实质性幻觉时,该任务才计入统计。
  • 标准通过率与实质性幻觉。 我们报告在应用幻觉门槛之前的评分标准通过比例,该数据由三位评审员的平均值计算得出,并对所有标准进行汇总,同时列出每个已检查任务中实质性幻觉的平均数量。散点图直接对比了这两项指标。
  • 三评审员评分小组。 评分标准现由一个包含三位 LLM 评审员的小组进行评定——GPT-6 Sol、Grok 4.7 和 Claude Opus 5.5——其裁决结果取小组平均值,取代了 v1.0 版本中使用的单一评审员。我们审查了这些评审员,发现它们对自己所属模型家族表现出极少的自我偏好,而对三者结果取平均可以缓解任何可能出现的偏差。
  • 数据集更新。 v1.1 使用来自 Harvey 的最新私有数据集(v1.1.0),其中包含对任务和评分标准的改进。

Harvey LAB-AA 与 Harvey LAB 的区别

Harvey LAB-AA 是我们对 Harvey 评估体系的独立重新实现,与原始版本存在以下几个关键差异:

  • 模型在我们的 Stirrup 智能体框架上运行,支持上下文压缩等功能,从而避免在达到上下文限制时直接失败;同时使用了由 Artificial Analysis 编写的简化版智能体和评判提示词
  • 我们未包含 Harvey 的自定义工具和文档生成技能脚本(例如 pptx、docx),而是提供一个简单的代码执行工具,以反映模型的原始能力
  • 交付物必须严格匹配指定的确切文件名,而非在模型生成错误文件名时进行模糊匹配

幻觉问题

在 Harvey 开展的人类偏好研究中,人类专家将幻觉列为决定两个全面回答中哪一个更受偏好的主要因素。我们的幻觉检查聚焦于可能对实际法律工作产生实质性影响的错误,并采用保守方法进行标记。该检查区分了缺乏依据的任务特定主张与一般法律知识,并将后者排除在范围之外,因此不会因模型引用源文件之外的判例法或法规而对其进行惩罚。

模型提交的每一项交付物都会根据任务的源文档进行幻觉审计。若某任务没有可用的提交内容,则得分为零,且不进行审计,也不纳入每任务幻觉率的计算。幻觉是指工作成果中源文档无法支持的主张,每种幻觉均属于以下三类之一:

  • 与源材料相矛盾的内容。
  • 虚构的源内容。
  • 记录中无任何支持的特定断言。

每项幻觉均被评定为“重大”或“轻微”。重大幻觉会在实质要点上误导读者,例如错误的合同规定日期。轻微幻觉则是真实存在的错误,但不太可能显著影响交付物的法律解释。只有重大幻觉会影响评分:在“幻觉门控全通过率”中,只要存在一项或多项重大幻觉,该任务得分即为零。“标准通过率”衡量的是在应用幻觉门控之前的评分标准覆盖情况。重大和轻微幻觉的数量按已执行检查的任务分别报告;轻微幻觉不影响评分。

幻觉检查的工作原理

每项交付物均按照三个步骤对照任务的源文档进行检查。

查找可能的幻觉

法官将提交内容与任务源文件进行比对,并标记出需要审查的陈述。随后,法官对照所有源文档重新核查每个被标记的部分,最终予以确认(附带严重程度评级)或驳回。只有经确认的实质性幻觉才会影响评分。

税务合规审查 · 提交内容摘录3 个示例2 项确认 · 1 项未获支持

任务源文件 · 合伙企业报税表草稿摘录

2023 年期间安排了 6,000,000 美元的主债务摊销,使未偿余额从年初的 220,000,000 美元(包含归类为流动负债的 6,000,000 美元)降至年末的 214,000,000 美元(在第 15 行中包含归类为流动负债的 6,000,000 美元)。

提交内容 · 讨论列表

“债务明细表:2.2 亿美元定期贷款 + 2.14 亿美元票据”

可能存在债务重复计算

同一份提交内容 · 敞口明细表

“6,400,000∗293/3656,400,000 *293/365 5,136,986”

按比例计算可能存在错误

另一份提交内容,相同任务 · 问题备忘录

“960,000 美元的超额付款已计入 2024 年”

声称 960,000 美元已经入账,但源文件要求在申报前进行确认。

证据

确认存在幻觉(实质性)提交内容

“债务明细表:2.2 亿美元定期贷款 + 2.14 亿美元票据”

合伙企业报税表草稿 · 源文件摘要

在 2023 年期间,一笔 600 万美元的本金偿还使同一笔贷款从 2.2 亿美元降至 2.14 亿美元。

一笔贷款,两个余额

2.2 亿美元和 2.14 亿美元的数值分别是同一笔贷款的期初和期末余额。法官认定该矛盾具有实质性。

证据

确认存在幻觉(轻微)提交内容

“6,400,000∗293/3656,400,000 *293/365 5,136,986”

亏损限制明细表 · 源文件摘录

6.4M×(293/365)≈6.4M × (293/365) ≈ 5,138,000。

轻微算术错误

所述计算结果约为 5,137,534,而非5,137,534,而非 5,136,986。法官认定此算术错误为轻微级别。

证据

未获支持:有源文件佐证提交内容 · 针对同一任务的不同回复

“960,000 美元的超额付款已计入 2024 年”

公司报税表草稿 · 源文件摘录

应用于 2024 年预估税款 $960,000

标记未获支持

虽然源文件要求在申报前进行确认,但报税表草稿也明确显示 $960,000 已用于抵扣 2024 年的预估税款。法官驳回了该标记。

评分标准与幻觉检查评估的是提交内容的不同方面。在本示例任务的各次提交中,三个被标记的声明展示了不同的结果:一个实质性幻觉、一个轻微幻觉,以及一个经复核后未被确认的案例。任何已确认的实质性幻觉都会使该任务的“幻觉门控全通过率”降至 0%。“单项标准通过率”仍基于评分标准计算;实质性幻觉单独报告。

1 个实质性案例 · 1 个轻微案例 · 1 个未确认案例

示例评分说明

全通过率幻觉门控全通过率
定义所有评审员均通过每项标准的比例
数值67%0%
备注3 位评审员中有 2 位通过了所有标准存在任何实质性幻觉即导致结果为 0%
单项标准通过率
定义评审员判定为“通过”的比例
数值90%
备注30 项评审判定中有 27 项为“通过”;不受幻觉影响

来自同一税务任务的三个已验证示例。实质性案例和轻微案例源自同一份提交内容;被驳回的案例则来自另一份提交内容。这些摘录并非完整的任务审计。

GPT-6 系列模型的幻觉率最低:GPT-6 Astra 平均每个任务产生 0.03 次实质性幻觉(在全部 120 个任务中共出现 4 次),GPT-6 Sol 为 0.07 次(在全部 120 个任务中共出现 8 次);而在发布模型集中,Gemini 3.8 Flash 的平均幻觉率最高,达到每个任务 13.96 次。满足评分标准且不产生幻觉是两种不同的能力:Muse Spark 1.3 通过的单项标准最多(96.0%),但平均每个任务产生 1.68 次实质性幻觉,相比之下 GPT-6 Astra 仅为 0.03 次。所有开源权重模型平均每个任务至少产生 2.09 次实质性幻觉。模型的幻觉率更多取决于模型本身,而非具体的法律实践领域。

Harvey LAB-AA v1.1:每任务幻觉次数

按严重程度划分的每任务已确认幻觉标记数 · 实质性标记会在关键问题上误导读者,轻微标记则是不太可能影响法律解释的真实错误,且只有实质性标记会影响主要得分指标 · 数值越低越好

Harvey LAB-AA 已检查任务中,平均每任务已确认幻觉标记数,按严重程度划分。当标记会在关键问题上误导读者时——例如错误的当事人、金额、日期或义务,或改变结论的事实——视为实质性标记;当标记为真实错误但不太可能对交付成果的法律解释产生有意义的影响时,视为轻微标记。只有实质性标记会作为主要得分的门控条件;轻微标记仅予报告,不计入评分。

我们如何选择幻觉检查器

我们使用 GPT-6 Sol(高推理强度)进行幻觉检查的两个独立阶段,这与三评委评分小组是分开的。我们比较了六个候选幻觉评判模型:GPT-6 Sol、GPT-6 Luna、Grok 4.7、Claude Opus 5.5、Claude Sonnet 5.5 和 Gemini 3.8 Flash,均在相同的高推理强度设置下,针对来自八个被评估模型的同一组 20 项任务和交付成果进行测试。

在该任务子集中,GPT-6 Sol 和 GPT-6 Luna 通常识别出更多实质性幻觉,而 Claude Sonnet 5.5 和 Gemini 3.8 Flash 识别出的数量则少得多。在每一行模型数据中,Claude Opus 5.5 的表现介于 Grok 4.7 和 Claude Sonnet 5.5 之间。总计而言,Opus 确认了 99 个实质性幻觉,相比之下,Grok 为 219 个,Sonnet 为 57 个,GPT-6 Sol 为 470 个。尽管该检查在标记错误时采取了保守策略(排除了源文档中未包含的一般性法律知识),GPT-6 Sol 仍识别出了更多的实质性幻觉。

所有六个检查器均未在 GPT-6 Astra 的输出中发现实质性幻觉,而 GPT-6 Sol 的每项任务平均发现量在 0 到 0.20 之间。在所有检查器的评估下,这两者都是实质性幻觉最少的模型之一。

Harvey LAB-AA v1.1: 幻觉评判模型对比

每项任务平均确认的实质性幻觉数 · 20 项任务和 8 个模型的子集 · 数值越低越好 每项任务平均实质性幻觉数 0 4 8 12 17

被检查模型幻觉评判模型
GPT-6 Sol (high)GPT-6 Luna (high)
GPT-6 Astra (max)
GPT-6 Sol (max)
Grok 4.7 (xhigh)
Claude Opus 5.5 (max with fallback)
Claude Fable 5.1 (max with fallback)
Muse Spark 1.3 (max)
Kimi K3 (max)
Gemini 3.8 Flash (high)
每项任务总实质性幻觉数23.50

在固定的 20 项任务和八个模型子集上对六个幻觉评判模型进行比较。单元格显示每项任务平均确认的实质性幻觉数。此子集比较不会改变完整的 120 项任务排行榜,后者使用 GPT-6 Sol (high) 作为幻觉检查器。

幻觉门控接近通过率

在标准上允许“接近通过”(near misses)的情况下,GPT-6 Astra 和 GPT-6.1 Sol 表现领先。GPT-6 Astra 的“幻觉门控全通过率”为 8.6%,当允许漏掉一项标准时,“幻觉门控近通过率”升至 20.3%,允许漏掉两项标准时进一步升至 31.7%;GPT-6.1 Sol 则从 6.9% 分别升至 20.3% 和 29.6%。相比之下,Grok 4.7 对应数值为 15.3% 和 23.1%。提升幅度次之的是 GPT-6 Sol(从 3.6% 升至 18.1%)和 Claude Sonnet 5.5(从 2.8% 升至 16.9%)。那些因幻觉导致原本通过的案例被清零的模型获益甚微,因为只要存在实质性幻觉,无论在哪一档位中该任务得分均为零:GLM-5.3 即使允许漏掉两项标准也仅达到 2.2%,而 Gemini 3.8 Flash 仍保持 0%。

Harvey LAB-AA v1.1: 幻觉门控近通过率

各任务中评审小组漏掉 0 项、≤1 项和 ≤2 项标准的比例平均值 · 包含至少 1 处实质性幻觉的任务计为 0% · 数值越高越好 · 按漏掉的标准数排序

成本

得分最高的模型并非最昂贵。Grok 4.7 以每任务约 9.50的成本位居榜首,不到最昂贵模型ClaudeFable5.1(约9.50 的成本位居榜首,不到最昂贵模型 Claude Fable 5.1(约 21.70)的一半。Muse Spark 1.3 在其成本下表现出强劲性能,以每任务约 $4.20 的成本位列第二。

Harvey LAB-AA v1.1: 每任务成本

每任务的平均成本(美元),按输入、缓存命中、缓存写入、推理和答案 token 细分

评估中的每任务平均成本。在可获得规范 token 计数的情况下,成本按输入、缓存命中、缓存写入、推理和答案 token 定价进行拆分。

Token 用量

生成更多输出 token 并不一定意味着更高的得分。GPT-6 Astra 在每任务约 8.1 万输出 token 的情况下得分为 8.6%,不到 Grok 4.7 约 18 万输出 token 的一半;而三款 Claude 模型生成的输出 token 最多(每任务约 20.2 万至 56.2 万),得分却在 2.8% 到 6.4% 之间。

Harvey LAB-AA v1.1: 每任务输出 Token 数

运行一个任务所使用的输出 token 数,按推理和答案 token 细分

本次评估中每个基准任务产生的答案和推理 token 的平均数量。

速度

更强的模型往往耗时更长。Grok 4.7 和 Claude Fable 5.1 的估计解码时间均为每任务约 33 分钟。Muse Spark 1.3 以每任务约 12 分钟的成绩排名第二。这些估算不包括首 token 延迟(TTFT)及其他开销时间。

Harvey LAB-AA v1.1: 每任务耗时

每任务的加权平均解码时间(分钟);不含 TTFT 和开销时间 · 数值越低越好

加权平均估算解码时间(分钟/任务)。每个任务的输出 token 数除以输出速度,并将秒转换为分钟。此数据不包括首 token 生成时间及其他开销。

轮次

得分最高的模型并非运行循环最长的模型。Grok 4.7 平均每任务约 63 轮,GPT-6 Astra 约 54 轮。Claude Sonnet 5.5 运行轮次最长,约 179 轮,但得分仅为 2.8%。

Harvey LAB-AA v1.1:每任务平均轮次

Harvey LAB-AA v1.1 每任务模型平均轮次数 · 越低越好

该图表展示了代理每任务所采取的平均轮次数。这大致反映了代理完成基准测试任务时所使用的动作、工具调用和迭代周期的数量。

模型规模(仅限开放权重模型)

Harvey LAB-AA v1.1:幻觉门控全通过率 vs. 计算量代理指标

Harvey LAB-AA v1.1 幻觉门控全通过率 · 计算量代理指标最具吸引力象限帕累托前沿线

计算使用量的相对指数,计算公式为:活跃参数(十亿)× (输入 Token / 5 + 输出 Token) / 1,000,000。对输入 token 进行降权处理以反映预填充相比生成阶段更低的计算成本。数值越低表示模型计算效率越高。图表左上角的模型以更少的计算量实现了更高的得分。

得分 vs. 发布日期

Harvey LAB-AA v1.1:幻觉门控全通过率 vs. 发布日期

最具吸引力区域

示例任务与提交结果

在 GitHub 上查看任务集

浏览公开任务集中的代表性 Harvey LAB 任务、提供给每个模型的参考文件以及模型生成的交付成果。

并购交易

指令

审查附件中的收购数据室合同及内部备忘录中关于控制权变更和转让条款的内容,并准备一份全面的交易团队报告。

输出:coc-analysis-report.docx

交付成果

模型必须生成的预期输出

  • coc-analysis-report.docx一份全面的交易团队报告,分析目标公司重大合同中的控制权变更和转让条款。

参考文件

提供给模型的文件

打开打开打开打开打开打开打开打开打开打开打开打开打开[打开](https://artificialanalysiscdn.com/harvey-lab-e

xample-files/corporate-ma/analyze-change-of-control-provisions-across-targets-material-contracts/documents/ridgeline-10k-excerpt.docx)打开打开打开打开打开

模型提交结果

各模型生成的交付物

Claude Opus 5.5(最大配置含回退机制) - coc-analysis-report.docx打开

Harvey LAB-AA 资源

阅读最新动态

[

Anthropic 发布 Claude Haiku 5.5

Claude Haiku 5.5 在 Artificial Analysis 智能指数中得分为 43,较上一代 Haiku 发布一年后提升了 26 分

2026年10月7日](https://artificialanalysis.ai/articles/claude-haiku-5-5)[![](https://cdn.sanity.io/images/6vfeftx9/articles/79dd3c53ad29c497246b44c24f1b3b860ab98e65-1254x1254.png?w=240&auto=format)

Mistral 发布 Mistral Large 4,使法国成为拥有美国和中国以外最智能模型的国家

Mistral 发布了 Mistral Large 4,在 Artificial Analysis 智能指数中得分为 38;法国重新拥有了来自美国和中国以外的最智能模型

2026年10月6日](https://artificialanalysis.ai/articles/mistral-large-4-france-ai)[![](https://cdn.sanity.io/images/6vfeftx9/articles/685ca541b78a2cb65a31978cb18d102536df6222-1024x1024.svg?w=240&auto=format)

韩国 AI 实验室 Upstage 发布 Solar Mini 4

韩国 AI 实验室 Upstage 发布了 Solar Mini 4,其在 Artificial Analysis 智能指数中得分为 24。尽管单 token 价格与 GPT-6 Luna(最大配置)相近,但其每任务成本约为后者的 5 倍

2026年9月30日](https://artificialanalysis.ai/articles/korean-ai-lab-upstage-releases-solar-mini-4)