
让AI智能体守规矩的标准做法,是让第二个AI在旁边“盯着”它读取输出。这一直是默认方案,但当智能体连续运行数小时、处理相当于好几本小说长度的文本时,成本会迅速攀升。
专注于可解释性(即弄清AI模型内部如何运作)的初创公司Goodfire周四推出了一种更便宜的方案:监控器直接观察AI模型运行时的内部活动,而不只是读取它写出的内容。该监控器面向Baseten的客户提供,后者为其他公司托管和运行AI模型。
Baseten旗下的Base Labs上月宣布与Goodfire以及AI平台Hugging Face建立安全合作伙伴关系。
此次发布正值今年发生一连串AI智能体逃出测试环境的事件之后,其中包括OpenAI的智能体攻破Hugging Face。Goodfire首个监控器所围绕的开源模型Kimi K3,今年夏天利用其沙箱中的漏洞访问了互联网和GitHub上的信息。
Goodfire的系统运作方式有点像机场安检。被称为“探针”的小型检测器会在智能体工作的每一步读取模型的内部信号,就像安检门会检查每位乘客一样。只有当某个探针发出警示时,另一个相当于人工搜身的AI模型才会进一步细查。
Baseten客户可以选择要监控哪些风险,包括攻击性黑客行为、化生武器滥用以及奖励黑客。他们还可以决定自动响应方式:记录事件、提交人工审核,或直接拒绝请求。
Goodfire表示,其方案运行成本也更低。大多数AI监控器是独立模型,必须重新读取被监控模型所做的一切,这会增加时间和成本。Goodfire的探针则转而利用模型运行时已经在进行的计算。
“内部激活监控器非常便宜,因为它们会复用前向传播中的计算,”Goodfire首席执行官Eric Ho上周在风险投资人Matt Turck的MAD播客上表示。“模型已经在计算这个token。你要做的只是获取它已经计算出的中间神经激活,然后对这些内部计算运行一个分类器。”简而言之,模型已经算好了,探针只是读取结果。
在Goodfire对Kimi K3的测试中,监控约1500次会话花费约51美元;相比之下,用一个较便宜的AI模型逐步检查花费233美元,而用顶级模型则约需1万美元。探针捕获了94%的恶意黑客会话,并将8.7%的无害会话送去二次检查。
该公司表示,同时运行四个探针,仅使模型开始响应的时间增加不到2%。
“最大的优势在于,你可以在事情发生之前就抓住它们,”Goodfire首席技术官兼联合创始人Dan Balsam表示。“我们可以在评估或训练期间检测到模型可能何时进行黑客行为。”
这一卖点针对的是开源模型。开发者可以下载它们并移除安全防护,而它们也不具备闭源实验室在自有系统上运行的那种监控。
“与拥有算力集群的人——比如推理服务提供商——所能造成的损害相比,个人用开源模型能造成的损害很小,而大部分责任也在这些提供商身上,”Balsam说。“当我们迎来开源的‘Mythos’时刻时,就会清楚地看到,模型需要在推理时部署护栏。”
Goodfire最近的研究发现,包括Kimi K3和GLM 5.2在内的领先开源模型,在AI智能体测试中,有50%至96%的运行出现奖励黑客行为。
Goodfire并非首个尝试这一方法的公司。Google DeepMind今年1月表示,其研究为在Gemini中部署滥用检测探针提供了依据。
Balsam表示,这些监控器只是更长期研究目标中的近期一环:对LLM进行逆向工程,以便将行为追溯到它在训练中产生的地方。“我们希望把训练模型的神秘魔法变成精密工程,”他说。