跳到正文
热点事件持续更新

Jev 能否成为更好的智能体评测器?

4 篇报道3 个报道来源14 小时前更新

先了解这件事

AI 综述

2026 年 9 月 20 日,LangChain 发文测试 Jev 与 LLM 评委在智能体评测中的表现,围绕准确率、可重复性、延迟和成本四个维度,验证 System One 模型能否提供新思路,当时未给出结果。9 月 22 日,LangChain 称 LangSmith 已上线 Jev-as-a-Judge 评估功能,可对智能体 trace 做结构化反馈评估,覆盖生产运行、数据集与回归测试,官方称更快更便宜。同日 HuggingFace Daily Papers 收录的论文给出数据:JEV 以仅做决策的评审模型做低成本初筛,在普通偏好与证据支撑的事实性任务上与最强 SOTA LLM 评审差距在 3 个百分点以内,费用仅为其 0.36%;需检查推导过程或抵御精心编写的错误答案时差距扩大,且集中在低置信度决策上;冻结的级联流程接受高置信度判定、升级不确定判定,以更低成本保留对比模型 99% 的准确率。9 月 24 日,DAIR.AI 介绍该论文称,在 510 个保留偏好对上,级联接受 JEV 置信判定、其余上升至 GPT-6 Astra,保留 GPT-6 约 99% 的准确率,费用约为其 57%。

AI 根据报道生成 · 10 小时前更新

事件进展

3 个进展
  1. 9月22日 08:00 · 2 篇报道
    JEV-as-a-Judge:置信时接受,不确定时升级
    HuggingFace Daily Papers(社区热门论文):JEV-as-a-Judge:置信时接受,不确定时升级
  2. 9月22日 00:57 · 1 篇报道
    LangSmith 上线 Jev-as-a-Judge 评估功能
    LangChain:Blog:LangSmith 上线 Jev-as-a-Judge 评估功能
  3. 9月20日 07:09 · 1 篇报道
    Jev 能否成为更好的智能体评测器?
    LangChain:Blog:Jev 能否成为更好的智能体评测器?

报道时间线

沿着报道,了解事件的不同侧面。

9月24日
  1. X:DAIR.AI (@dair_ai)
    Jev-as-a-Judge 论文:廉价裁判置信时接受、不确定时上升至 GPT-6,保留 99% 准确率并省约 43% 费用

    论文介绍 JEV-as-a-Judge,发现多数评测可用廉价裁判,仅把不确定判定交给前沿模型。在 510 个保留偏好对上,级联接受 JEV 置信判定、其余上升至 GPT-6 Astra,保留 GPT-6 约 99% 的准确率,费用约为其 57%。

9月22日
  1. HuggingFace Daily Papers(社区热门论文)
    JEV-as-a-Judge:置信时接受,不确定时升级

    JEV-as-a-Judge 用仅做决策的评审模型做低成本初筛,在普通偏好与证据支撑的事实性任务上,与最强对比的 SOTA LLM 评审差距在 3 个百分点以内,费用仅为其 0.36%。当判断需要检查推导过程或抵御精心编写的错误答案时,差距会扩大,且 JEV 与对比模型的差距集中在低置信度决策上。一个冻结的级联流程接受高置信度判定、升级不确定判定,以更低成本保留了对比模型 99% 的准确率。

  2. LangChain:Blog
    LangSmith 上线 Jev-as-a-Judge 评估功能

    LangSmith 现已支持将 Jev 用作评估裁判(Jev-as-a-Judge),可对智能体 trace 进行结构化反馈评估,覆盖生产运行、数据集与回归测试场景。官方称该方式更快、更便宜。

9月20日
  1. LangChain:Blog
    Jev 能否成为更好的智能体评测器?

    LangChain 测试了 Jev 与 LLM 评委在准确率、可重复性、延迟和成本四个维度的表现,以验证 System One 模型能否为智能体评测提供新思路。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。

关联事件