跳到正文
热点事件持续更新

MerchantBench 评测:八款 LLM 长周期任务远逊人类

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,X 用户 Rohan Paul(@rohanpaul_ai)发布消息称,MerchantBench 评测显示八款 LLM 智能体在长周期任务上的表现远逊于人类,表现最好的模型仅达到人类水平的 27.3%。该评测使用 365 天电商模拟环境,考察智能体在长期连贯性方面的表现,参评模型包括 GPT-5.6 Sol 和 Claude Opus 4.8。报道未披露各模型的具体得分、评测的具体任务设置及人类基准的确定方式,也未说明评测的发布机构与完整结果。目前该消息仅来自单一来源,尚无其他主报道或跟进报道对上述数字与结论进行独立确认。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. Rohan Paul
    MerchantBench 评测显示八款 LLM 长周期任务表现远逊人类,最好模型仅达人类 27.3%

    MerchantBench 用 365 天电商模拟环境评测八款 LLM 智能体在长期连贯性上的表现,包括 GPT-5.6 Sol 和 Claude Opus 4.8。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。