HuggingFace Daily Papers·· 3 天前AI 评分43
自生成反馈会破坏测试时训练:长时程适应的因果分解
Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation
AI 导读
研究在 128K token 流上发现,测试时训练(TTT)若保留模型自生成文本的权重更新,会损害其在独立人类文本上的预测能力,该现象在 125M、760M、3B 三种 TTT-E2E 配置以及 Adam 更新 Qwen3-4B 现有权重时均出现。
来源:HuggingFace Daily Papers · arxiv.org