跳到正文
热点事件持续更新

Goodfire推出低成本AI内部监控探针

2 篇报道2 个报道来源3 小时前更新

先了解这件事

AI 综述

可解释性初创公司 Goodfire 推出一套监控 AI 模型内部信号的探针系统,做法是复用模型前向传播中已计算的中间激活,再运行分类器判断风险,而不是只读取模型的输出文本。Goodfire 称这是更便宜的方案。 该探针通过 Baseten 面向其客户提供,Baseten 为其他公司托管和运行 AI 模型。客户可自行选择监控哪些风险,包括攻击性黑客行为、生化武器滥用和 reward hacking,响应方式可选记录、人工审查或拒绝请求。 Goodfire Research 称,其已为 Kimi K3 和 GLM 5.3 构建基于激活探针加 LLM judge 的监控级联并部署到生产推理栈,相比每轮都运行 judge,该级联成本约为其五十分之一、每百万次交互低于 200 美元,保持基线推理吞吐且不增加延迟,在 5.5% 误报率下召回率达 93%,并在独立评估方的静态红队攻击集上将通用越狱降至 0%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. TechCrunch:AI
    Goodfire 推出监控模型内部信号的探针,低成本捕捉失控 AI 智能体

    可解释性初创公司 Goodfire 推出监控 AI 模型内部信号的探针系统,复用模型前向传播中已计算的中间激活再运行分类器,通过 Baseten 面向客户提供,可选监控攻击性黑客、生化武器滥用和 reward hacking 等风险,响应方式可选记录、人工审查或拒绝请求。

10月8日
  1. Goodfire Research精选
    Goodfire 为 Kimi K3 和 GLM 5.3 训练并部署生产级网络安全监控器

    Goodfire Research 为 Kimi K3 和 GLM 5.3 构建基于激活探针加 LLM judge 的监控级联,并部署到生产推理栈。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。