← 评测来源
Tencent HY / Lehigh 等 / 编程

Long-Horizon Terminal-Bench

在较长时间内持续使用终端,完成复杂工程与工具任务。

官方评测 ↗
在 AIHOT 中观察与参考
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

90 分钟、2 小时和 3 小时预算分别比较;修复前后判题协议不能混排,也不能把不同 Agent 的最好结果当统一模型成绩。

如何使用这份证据

候选观察:等待明确标注修复协议的新批次,现有旧分不自动采集到公开榜,也不计分;不据此断言每条旧结果都利用了漏洞。

尚未纳入可比成绩

候选观察:等待明确标注修复协议的新批次,现有旧分不自动采集到公开榜,也不计分;不据此断言每条旧结果都利用了漏洞。

查看上游官方页面 ↗
评测局限与数据署名

官方披露过判题信息泄漏;当前不能证明已有成绩属于隔离判题后的同一协议。部分任务与其他专业评测的来源重叠待核。

数据许可:Apache 2.0 · 官方 IntelligenceLab/LHTB-leaderboard 成绩数据集;保留署名和变更说明。

成绩由 Tencent HY / Lehigh 等 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。