跳到正文
HuggingFace Daily Papers·· 2 天前AI 评分50

关键词基准测试对小模型工具调用能力的误判:一套低成本诊断阶梯

Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models

AI 导读

一项研究记录了关键词匹配基准的假阳性:一对共享解码器与 tokenizer 的西班牙语安全模型(661.6M 与 1,109M 参数)在宽松工具调用指标上得分几乎相同(B4:0.660 vs. 0.650),但逐字复现检查中 600M 在 6/6 样例上生成有效工具调用,1B 在 0/6 上做到。

来源:HuggingFace Daily Papers · arxiv.org