Today for AI

TechCrunch AI · 2026/10/9 02:19:45

AI 评测平台 Arena 获 2 亿美元 B 轮融资,估值十个月内翻倍至 31 亿美元

出处作者 / 发布主体:Julie Bort原标题:Popular AI leaderboard Arena nearly doubles valuation to $3.1B valuation in 10 months
68AI 研判分
核心综述

源自 UC Berkeley 的 AI 模型众包评测平台 Arena 宣布完成由 Lightspeed 和 Khosla Ventures 领投的 2 亿美元 B 轮融资,估值达到 31 亿美元。该估值较其 10 个月前 A 轮时的 17 亿美元几乎翻倍,主要驱动力是其年化收入从 3000 万美元激增至 1 亿美元。Arena 通过让用户对大模型输出进行盲测排名来构建权威榜单,目前已成为开发者评估模型能力的关键基础设施。

报道全文原始报道全文

Arena 起源于 2023 年,最初是加州大学伯克利分校的一个研究项目,旨在通过众包方式对 AI 模型进行排名。该公司于周四宣布完成 2 亿美元的 B 轮融资,估值达到 31 亿美元。

此前,该公司曾表示其年化经常性收入(ARR)在 6 月已突破 1 亿美元。

本轮融资由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalyst、a16z、Felicis 等机构跟投。Arena 此前曾在 1 月宣布完成 1.5 亿美元的 A 轮融资,投后估值为 17 亿美元。当时,其年化收入为 3000 万美元。这意味着在大约 10 个月内,其估值几乎翻了一番。

Arena 提供一个面向消费者免费使用的众包平台。用户输入提示词或请求“氛围编程”(vibe-coded)项目,然后对哪个模型表现更好进行评分。Arena 声称其每月拥有数千万访客。

去年 9 月,该公司推出了其商业产品 AI Evaluations,这是一项基于社区反馈为模型实验室和企业提供详细性能分析的服务。这一时机堪称完美。今年,AI 实验室发现他们的模型正在钻基准测试的空子,即在不真正提升能力的情况下获取高分。与此同时,企业希望获得帮助,以确定哪种模型最适合其内部需求,而不是仅依赖标准化基准测试。

Arena 在其融资公告中表示:“AI 的发展速度超过了我们的评估能力,而一旦模型意识到自己正在被测试,静态基准就会失效。”该公司补充道:“世界需要一个中立的第三方来衡量当 AI 交到真实用户手中时,它实际上有多安全、多对齐。Arena 今天正承担起这一角色。”

为此,Arena 还在其排行榜中新增了一个类别:对齐。该类别根据未经授权行动(执行未被要求的操作)、错误归因(将陈述或事实错误地归于不正确的来源)以及所谓的“欺骗性完成”(谎称已完成实际未执行的任务)等问题对模型进行排名。

目前,OpenAI 的一系列模型在其初步对齐排行榜上位居前列,其中 Claude Opus 5.5 和 Claude Fable 分别位列第六和第九。