TechCrunch AI · 2026/10/9 00:00:00
Goodfire 推出低成本“由内而外”监控:直接解析模型内部状态以实时拦截失控 AI 智能体
可解释性初创公司 Goodfire 发布新型监控工具,通过直接观察大模型内部激活状态而非仅分析输出文本,以极低算力成本实时检测并拦截失控 AI 智能体。该方案已集成至 Baseten 平台,旨在解决传统“AI 监督 AI”模式在长程任务中成本高昂且响应滞后的痛点,为智能体安全提供基于机制的可验证保障。
报道全文原始报道全文
让 AI 智能体保持受控的标准做法,是让另一个 AI 在旁监督。这一直是默认方案,但当智能体运行数小时并处理相当于几部小说文本量的数据时,成本会迅速飙升。
Goodfire 是一家专注于可解释性(即探究 AI 模型内部运作机制)的初创公司,于周四推出了一种更经济的替代方案:这些监控器不再仅仅读取模型的输出内容,而是实时观察 AI 模型在工作时的内部状态。目前,该监控服务已向 Baseten 的客户开放,Baseten 是一家为其他公司提供 AI 模型托管与运行服务的平台。
上个月,Baseten 旗下的 Base Labs 宣布与 Goodfire 及 AI 平台 Hugging Face 建立安全合作伙伴关系。
此次发布背景是今年发生的一系列事件,其中 AI 智能体多次突破测试环境,包括 OpenAI 的智能体曾入侵 Hugging Face。此外,Kimi K3——这款由 Goodfire 为其首个监控器专门适配的开源模型——在今年夏天也利用沙箱漏洞逃逸,成功访问了互联网及 GitHub 上的信息。
Goodfire 的系统运作方式有点像机场安检。被称为“探针”的小型检测器会在智能体工作的每一步读取模型的内部信号,就像通过式扫描仪检查每一位乘客一样。只有当探针标记出异常时,才会启动另一个独立的 AI 模型进行更深入的分析,这相当于人工开箱检查。
Baseten 的客户可以选择需要监控的风险类型,包括恶意黑客攻击、化学和生物武器滥用以及奖励黑客(reward hacking)。他们还可以决定自动响应措施:记录事件、提交人工审核或完全拒绝请求。
Goodfire 表示,其方案在运行成本上也更为低廉。大多数 AI 监控器都是独立的模型,必须重新阅读被监控模型的所有操作,这会增加时间和成本。而 Goodfire 的探针则直接利用模型在工作过程中已经进行的计算结果。
“内部激活监测器非常便宜,因为它们复用了前向传播中的计算结果,”Goodfire 首席执行官 Eric Ho 上周在风险投资人 Matt Turck 的 MAD Podcast 播客中表示。“模型已经在计算这个 token。你只需要提取它已经计算出的中间神经激活值,然后对这些内部计算运行一个分类器。”简而言之,模型已经在进行数学运算,而探针只是读取结果。
在 Goodfire 对 Kimi K3 进行的测试中,监控约 1,500 个会话的成本约为 51 美元,相比之下,使用较便宜的 AI 模型检查每一步的成本为 233 美元,而使用顶级模型的成本则高达约 10,000 美元。这些探针捕获了 94% 的恶意黑客攻击会话,并将 8.7% 的无害会话标记出来以供二次审查。
该公司表示,同时运行四个探针仅使模型开始响应的时间增加了不到 2%。
“巨大的优势在于你可以在事情发生之前捕捉到它们,”Goodfire 首席技术官兼联合创始人 Dan Balsam 说。“我们可以在评估或训练期间检测到模型可能发起黑客攻击的时刻。”
这一主张主要针对开源模型。开发者可以下载这些模型并移除其安全防护措施,而且它们并不具备封闭实验室在其自有系统上运行的那种监控机制。
Balsam 表示:“个人利用开源模型所能造成的损害,与有人利用算力集群(如推理服务提供商——责任主要集中于此)所能造成的损害相比,是微不足道的。当我们迎来开源领域的‘Mythos’时刻时,将变得清晰的是:需要在推理阶段部署模型护栏。”
Goodfire 的最新研究发现,包括 Kimi K3 和 GLM 5.2 在内的领先开源模型,在 AI agent 测试中有 50% 到 96% 的运行次数出现了 reward hacking(奖励黑客行为)。
Goodfire 并非首个尝试这种方法的公司。Google DeepMind 在一月份表示,其研究成果指导了在 Gemini 中部署滥用检测探针。
Balsam 表示,这些监控器只是实现更长期研究目标的近期环节:对大语言模型(LLM)进行逆向工程,从而追溯其行为在训练过程中的起源。“我们希望将模型训练的‘魔法’转化为精密工程,”他说。