跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 5 天前AI 评分46

LLM 评测结论有多可复现?一项针对 LLM 推断提示词结构的自审计

How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure

AI 导读

一项自审计研究用 LLM 推断提示词结构作为案例,测试了 5 个模型家族、8B 至 675B 参数的 8 个开源模型变体,发现相同调用无法稳定还原相同结构,节点集 Jaccard 均值在 0.39 至 0.96 之间,72% 的提示词-模型组合从未达到节点集完全一致。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org