跳到正文
HuggingFace Daily Papers·· 3 天前AI 评分43

自生成反馈会破坏测试时训练:长时程适应的因果分解

Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation

AI 导读

研究在 128K token 流上发现,测试时训练(TTT)若保留模型自生成文本的权重更新,会损害其在独立人类文本上的预测能力,该现象在 125M、760M、3B 三种 TTT-E2E 配置以及 Adam 更新 Qwen3-4B 现有权重时均出现。

来源:HuggingFace Daily Papers · arxiv.org