← 评测来源
Tencent HY / Lehigh 等 / 编程
官方评测 ↗Long-Horizon Terminal-Bench
在较长时间内持续使用终端,完成复杂工程与工具任务。
在 AIHOT 中观察与参考
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集
它测什么,怎么测
90 分钟、2 小时和 3 小时预算分别比较;修复前后判题协议不能混排,也不能把不同 Agent 的最好结果当统一模型成绩。
如何使用这份证据
候选观察:等待明确标注修复协议的新批次,现有旧分不自动采集到公开榜,也不计分;不据此断言每条旧结果都利用了漏洞。
尚未纳入可比成绩
候选观察:等待明确标注修复协议的新批次,现有旧分不自动采集到公开榜,也不计分;不据此断言每条旧结果都利用了漏洞。
查看上游官方页面 ↗评测局限与数据署名
官方披露过判题信息泄漏;当前不能证明已有成绩属于隔离判题后的同一协议。部分任务与其他专业评测的来源重叠待核。
数据许可:Apache 2.0 · 官方 IntelligenceLab/LHTB-leaderboard 成绩数据集;保留署名和变更说明。
成绩由 Tencent HY / Lehigh 等 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。