返回
AI 评分 38/100

Sierra 开源 hyper-τ-bench:评估能构建智能体的智能体

Sierra:Blog(RSS)·2026-09-09 04:25·3小时前·Ben Shi, Keshav Dhandhania
AI 导读

Sierra 今日开源 hyper-𝜏-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。该基准聚焦于“构建智能体的智能体”这一任务场景,为长时程自主智能体开发提供评测标准。

Sierra:Blog(RSS)
38AI 编辑部评分,满分 100

Sierra 开源 hyper-τ-bench:评估能构建智能体的智能体

2026-09-09 04:25· 3小时前· Ben Shi, Keshav Dhandhania
AI 导读

Sierra 今日开源 hyper-𝜏-bench,这是一个新的长时程智能体评测基准,用于衡量模型不仅能作为智能体行动、还能构建智能体的能力。该基准聚焦于“构建智能体的智能体”这一任务场景,为长时程自主智能体开发提供评测标准。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:Sierra:Blog(RSS)· sierra.ai