Today for AI
返回热点榜
llm热度 10.4°

AI 聚簇研判事件 · 2026/10/8

Harvey 发布 LAB-AA v1.1 基准:引入幻觉门控全通过率以评估法律智能体

Harvey Releases LAB-AA v1.1 Benchmark: Introducing Hallucination-Gated All-Pass Rate for Legal Agents

1 篇报道存证1 家独立信源交叉印证持续跟踪至 2026/10/8 08:00:00
全景综述与最新动态
1 家信源交叉印证

Harvey 与 Artificial Analysis 合作推出 Harvey LAB-AA v1.1,升级了针对真实世界法律工作的 AI 智能体评分方法。新版本核心引入了“幻觉门控全通过率”(Hallucination-Gated All-Pass Rate)作为主要指标,要求交付物在满足所有评分标准的同时不得包含实质性幻觉。该基准基于 120 个由 Harvey 团队构建的私有法律任务(涵盖并购、资本市场、税务等),通过三法官面板对每项标准进行评级,旨在提高法律领域智能体应用的可靠性门槛。

最新动向/Harvey 与 Artificial Analysis 合作推出 Harvey LAB-AA v1.1,升级了针对真实世界法律工作的 AI 智能体评分方法。新版本核心引入了“幻觉门控全通过率”(Hallucination-Gated All-Pass Rate)作为主要指标,要求交付物在满足所有评分标准的同时不得包含实质性幻觉。该基准基于 120 个由 Harvey 团队构建的私有法律任务(涵盖并购、资本市场、税务等),通过三法官面板对每项标准进行评级,旨在提高法律领域智能体应用的可靠性门槛。

TIMELINE报道时间线

共 1 篇 · 最新优先
  1. Artificial AnalysisT1·68 分

    Harvey 发布 LAB-AA v1.1 基准:引入幻觉门控全通过率以评估法律智能体

    原文标题:Announcing Harvey LAB-AA v1.1: adding hallucination checks to raise the bar for agentic legal work

    • Harvey LAB-AA v1.1 引入新指标“幻觉门控全通过率”,只有无幻觉且满足所有标准的任务才计分。
    • 基准测试包含 120 个私有法律任务,覆盖并购、税务、诉讼等多个专业领域。
    • 采用三法官面板机制对每个评分标准进行独立评级,以提升评估的一致性和准确性。