Jev 能否成为更好的智能体评测器?
先了解这件事
2026 年 9 月 20 日,LangChain 发文测试 Jev 与 LLM 评委在智能体评测中的表现,围绕准确率、可重复性、延迟和成本四个维度,验证 System One 模型能否提供新思路,当时未给出结果。9 月 22 日,LangChain 称 LangSmith 已上线 Jev-as-a-Judge 评估功能,可对智能体 trace 做结构化反馈评估,覆盖生产运行、数据集与回归测试,官方称更快更便宜。同日 HuggingFace Daily Papers 收录的论文给出数据:JEV 以仅做决策的评审模型做低成本初筛,在普通偏好与证据支撑的事实性任务上与最强 SOTA LLM 评审差距在 3 个百分点以内,费用仅为其 0.36%;需检查推导过程或抵御精心编写的错误答案时差距扩大,且集中在低置信度决策上;冻结的级联流程接受高置信度判定、升级不确定判定,以更低成本保留对比模型 99% 的准确率。9 月 24 日,DAIR.AI 介绍该论文称,在 510 个保留偏好对上,级联接受 JEV 置信判定、其余上升至 GPT-6 Astra,保留 GPT-6 约 99% 的准确率,费用约为其 57%。
AI 根据报道生成 · 10 小时前更新
事件进展
- 9月22日 08:00 · 2 篇报道JEV-as-a-Judge:置信时接受,不确定时升级HuggingFace Daily Papers(社区热门论文):JEV-as-a-Judge:置信时接受,不确定时升级
- 9月22日 00:57 · 1 篇报道LangSmith 上线 Jev-as-a-Judge 评估功能LangChain:Blog:LangSmith 上线 Jev-as-a-Judge 评估功能
- 9月20日 07:09 · 1 篇报道Jev 能否成为更好的智能体评测器?LangChain:Blog:Jev 能否成为更好的智能体评测器?
报道时间线
沿着报道,了解事件的不同侧面。
- X:DAIR.AI (@dair_ai)Jev-as-a-Judge 论文:廉价裁判置信时接受、不确定时上升至 GPT-6,保留 99% 准确率并省约 43% 费用
论文介绍 JEV-as-a-Judge,发现多数评测可用廉价裁判,仅把不确定判定交给前沿模型。在 510 个保留偏好对上,级联接受 JEV 置信判定、其余上升至 GPT-6 Astra,保留 GPT-6 约 99% 的准确率,费用约为其 57%。
- HuggingFace Daily Papers(社区热门论文)JEV-as-a-Judge:置信时接受,不确定时升级
JEV-as-a-Judge 用仅做决策的评审模型做低成本初筛,在普通偏好与证据支撑的事实性任务上,与最强对比的 SOTA LLM 评审差距在 3 个百分点以内,费用仅为其 0.36%。当判断需要检查推导过程或抵御精心编写的错误答案时,差距会扩大,且 JEV 与对比模型的差距集中在低置信度决策上。一个冻结的级联流程接受高置信度判定、升级不确定判定,以更低成本保留了对比模型 99% 的准确率。
- LangChain:BlogLangSmith 上线 Jev-as-a-Judge 评估功能
LangSmith 现已支持将 Jev 用作评估裁判(Jev-as-a-Judge),可对智能体 trace 进行结构化反馈评估,覆盖生产运行、数据集与回归测试场景。官方称该方式更快、更便宜。
- LangChain:BlogJev 能否成为更好的智能体评测器?
LangChain 测试了 Jev 与 LLM 评委在准确率、可重复性、延迟和成本四个维度的表现,以验证 System One 模型能否为智能体评测提供新思路。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。