MerchantBench 评测:八款 LLM 长周期任务远逊人类
热点事件持续更新
MerchantBench 评测:八款 LLM 长周期任务远逊人类
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,X 用户 Rohan Paul(@rohanpaul_ai)发布消息称,MerchantBench 评测显示八款 LLM 智能体在长周期任务上的表现远逊于人类,表现最好的模型仅达到人类水平的 27.3%。该评测使用 365 天电商模拟环境,考察智能体在长期连贯性方面的表现,参评模型包括 GPT-5.6 Sol 和 Claude Opus 4.8。报道未披露各模型的具体得分、评测的具体任务设置及人类基准的确定方式,也未说明评测的发布机构与完整结果。目前该消息仅来自单一来源,尚无其他主报道或跟进报道对上述数字与结论进行独立确认。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 10:16
MerchantBench 评测显示八款 LLM 长周期任务表现远逊人类,最好模型仅达人类 27.3%报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- Rohan PaulMerchantBench 评测显示八款 LLM 长周期任务表现远逊人类,最好模型仅达人类 27.3%
MerchantBench 用 365 天电商模拟环境评测八款 LLM 智能体在长期连贯性上的表现,包括 GPT-5.6 Sol 和 Claude Opus 4.8。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。