# NLP领域2018-2025年人类标注报告实践的大规模审计

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-06-01 08:00
- AIHOT 分数：71
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmpwmljjs049cslsnfoe42el4
- 原文链接：https://arxiv.org/abs/2606.02255

## 精选理由

NLP论文里的标注环节一直是个黑箱，这篇首次用大规模数据把各家怎么标注、哪些信息缺失扒了个遍，值得每个做数据和评估的人细看。

## AI 摘要

本研究对NLP领域2018至2025年间的人类标注报告实践进行了首次大规模审计。研究构建并验证了一个LLM辅助提取管线，其在Annotated-gold数据集（41篇论文，72个标注任务）上与人工裁决的一致性（Krippendorff's alpha）达到0.606。基于此，研究构建了Annotated-llm数据集，涵盖ACL会议论文，从1603篇论文中提取了2667个标注任务。分析发现，论文常报告招募策略、标注者专长等操作细节，但经常遗漏评估标注效度所需的关键信息，如培训、语言能力、薪酬、裁决过程及一致性数值。研究指出标注报告虽有改善但仍不均衡，并提出了一个可扩展的框架和最低报告标准。

## 正文

人工标注是大量自然语言处理研究的实证基础，从数据集构建到模型评估皆不例外，但论文往往未明确说明标注由谁完成以及标注过程如何受控。我们首次对主要自然语言处理会议中的人工标注报告进行了大规模、任务层面的审计，探究哪些标注细节被记录、哪些被遗漏，以及报告方式随时间、主题、会议类型和人工判断预期用途的变化。

我们引入了一套统一的标注报告实践分类体系，并针对 Annotated-gold（一个由 41 篇论文和 72 个标注任务组成、经人工裁决的黄金标准数据集）验证了基于大语言模型的辅助提取流程，其中最佳模型与裁决标签达到与人类相当的一致性，Krippendorff 的 alpha 值为 0.606，而人类之间的一致性为 0.585。

利用该流程，我们构建了 Annotated-llm 数据集，覆盖 2018 至 2025 年 ACL 会议论文，从 1603 篇论文中提取出 2667 个标注任务，并发现论文经常报告招募策略、标注者专业知识和标注量等操作细节，但往往省略评估标注有效性所需的细节，包括培训、语言能力、报酬、社会人口统计信息、裁决和一致性数值，在模型评估研究中尤为突出。

我们的结果表明，自然语言处理领域的标注报告质量随时间有所改善，但仍不均衡，同时我们建立了一个可扩展的框架和最低限度报告建议，旨在使人工标注更加可靠、可复现和可解释。
