跳到正文
原文
HuggingFace Daily Papers·· 2 天前AI 评分44

合成预预训练在规模扩展下依然有效,但并非源于语法先验

Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior

AI 导读

一项覆盖 500M 至 7B 四种参数规模、PT 预算最高 100B token 的研究显示,合成非自然语言数据上的预预训练(PPT)带来的下游性能与 token 效率提升可随规模保持,在 3B 规模下至少节省 21B PT token。但与先前工作不同,研究未发现一致证据表明这些收益来自语法先验,收益实际来自改善长程检索的 PPT 任务,且仅在 PT 数据混合中缺少网页文本时才会减弱。

来源:HuggingFace Daily Papers · arxiv.org