HuggingFace Daily Papers·· 2 天前AI 评分50
关键词基准测试对小模型工具调用能力的误判:一套低成本诊断阶梯
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
AI 导读
一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。
来源:HuggingFace Daily Papers · arxiv.org