跳到正文
热点事件持续更新

Harvey LAB-AA v1.1 新增幻觉门控评分

4 篇报道4 个报道来源41 分钟前更新

先了解这件事

AI 综述

Artificial Analysis 与 Harvey 联合发布法律智能体基准 LAB 的评分方法更新版 Harvey LAB-AA v1.1,新增幻觉检查:被判定为正确的回答不得包含重大错误陈述,并推出新指标 Hallucination-Gated All-Pass Rate。该更新改变的是 LAB 的评分口径,即正确性判定需同时通过幻觉门控。 据 Artificial Analysis 介绍,幻觉被分为矛盾源材料、捏造源内容和无记录支持的具体断言三类,并区分重大与轻微,只有重大幻觉会触发 Hallucination-Gated All-Pass Rate 清零。 按新指标,Grok 4.7 (xhigh) 以 9.4% 居首,领先 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%;测试模型中超过 60% 的原通过结果含重大幻觉。OpenAI 的 Sherwin Wu 在 X 上称,Astra 在该基准中的幻觉率最低,并称此前的 LAB 结果令人摸不着头脑。

AI 根据报道生成 · 刚刚更新

最新进展10月9日 03:18
OpenAI 的 Astra 在 LAB 幻觉率最低

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Sherwin Wu
    OpenAI 的 Astra 在 LAB 幻觉率最低

    很高兴看到 LAB 的更新版本!原来的 LAB 结果让我们摸不着头脑。 Astra 的幻觉率是最低的——这在法律实践中尤为重要。

  2. Elon Musk
    Grok 4.7 在 Harvey 法律智能体基准上以 9.4% 幻觉门控通过率居首

    Artificial Analysis 与 Harvey 合作发布 Harvey LAB-AA v1.1,新指标 Hallucination-Gated All-Pass Rate 要求交付物无重大幻觉。Grok 4.7 (xhigh) 以 9.4% 居首,领先 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%;测试模型中超过 60% 的原通过结果含重大幻觉。Grok 4.7 每任务约 $9.50,GPT-6 Astra 每任务平均仅 0.03 次重大幻觉。

  3. Artificial Analysis
    Harvey LAB-AA v1.1 引入幻觉门控评分

    Artificial Analysis 与 Harvey 联合发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 新增幻觉检查,要求正确回答不含重大错误陈述,并推出新指标 Hallucination-Gated All-Pass Rate。

10月8日
  1. Artificial Analysis 完整文章
    Harvey LAB-AA v1.1 发布:为智能体法律工作加入幻觉检查

    Harvey LAB-AA v1.1 新增幻觉检查,将幻觉分为矛盾源材料、捏造源内容和无记录支持的具体断言三类,并区分重大与轻微,仅重大幻觉会触发 Hallucination-Gated All-Pass Rate 清零。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。