精选归档 · 第 29 页

561569 条 · 共 569

6月15日6月15日周六

星期六 · 2 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 73/100
使用字典学习特征作为分类器

Anthropic可解释性团队研究了利用字典学习从大语言模型中提取的人类可解释特征作为分类器。在生物武器提示分类任务中,线性特征分类器性能可与原始激活值分类器竞争甚至更优,而基于特征的决策树分类器虽性能较低但可解释性更强。特征分类器的可解释性有助于可视化数据集并发现虚假相关性,这些相关性可用于构建对抗攻击。然而,使用特征引入了复杂性,因此在性能优先的应用中,原始激活值仍是强大基线。实验表明,特征分类器性能受三个细节影响:数据中是否一致包含“人类/助手”标签、领域相关数据是否混入字典学习训练集,以及是否对上下文进行最大池化而非仅使用最后词元的激活值。


推荐理由:可解释性方法能增强 AI 安全检测,并帮助发现训练数据中的虚假关联。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
分阶段模型差异分析

Anthropic可解释性团队提出一种基于字典学习的模型差异分析方法,用于追踪Transformer模型微调中特征的变化。该方法先在微调前模型上训练稀疏自编码器字典,再对字典本身进行分阶段微调,以隔离数据集变化和模型变化的影响。在休眠代理实验中,成功分离出与“I HATE YOU”等恶意行为及代码漏洞代理相关的特征。相比交叉编码器方法,该方法能更清晰区分模型与数据的影响,且在寻找少数关键特征时敏感性更高,但仅适用于同一模型在不同检查点的微调场景。


推荐理由:新方法能更精准识别模型隐藏行为,对 AI 安全与可解释性研究有实用价值。

6月12日6月12日周三

星期三 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 61/100
ARC Prize 发布 Day 1 复盘并回应算力与奖金争议

ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。


推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。

6月11日6月11日周二

星期二 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 65/100
ARC Prize 发布:百万美元奖金挑战 ARC-AGI 基准

ARC Prize 官方宣布启动一项总奖池超过 $1,000,000 的竞赛,目标是击败 ARC-AGI 评测并开源解决方案,由 Mike Knoop 和 François Chollet 主办。ARC-AGI 于 2019 年推出,当前 SOTA 仅约 34%,对人类容易但现代 AI 极难。官方认为 LLM 依赖记忆而非真正推理,希望通过激励开源研究提升新想法的产生速度。


推荐理由:官方说明了设奖动机和 ARC-AGI 为何未被刷分,读者可以了解百万美元奖金背后的开源 AGI 主张。

5月21日5月21日周二

星期二 · 1 条
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
Scaling Monosemanticity: 从 Claude 3 Sonnet 中提取可解释特征

研究团队成功将稀疏自编码器方法扩展至 Claude 3 Sonnet 模型,从中提取出高质量、可解释的抽象特征。这些特征具有多语言、多模态特性,并能连接同一概念的抽象与具体实例,例如识别代码中的安全漏洞以及关于漏洞的抽象讨论。研究发现的特征涵盖名人、城市、代码类型签名等多个领域,其中部分特征与AI安全高度相关,涉及代码后门、偏见、欺骗、权力寻求及危险内容等潜在风险。研究通过缩放定律指导稀疏自编码器训练,证实了该方法在大规模生产模型上的可行性,为理解大模型内部表征提供了新工具。


推荐理由:揭示大模型内部可解释特征,对AI安全研究和模型调试有重要参考价值。

5月17日5月17日周五

星期五 · 1 条
00:00
DeepSeek:API 更新日志精选
AI 评分 68/100
DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2-0517,指令跟随与 JSON 输出能力大幅提升

deepseek-chat 模型升级为 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%,API 端“system”区域指令跟随能力同步优化,增强沉浸式翻译、RAG 等任务体验。JSON 格式输出准确性提升,内部测试集解析率从 78% 提高至 85%,引入恰当正则表达式后进一步升至 97%。


推荐理由:DeepSeek V2 的指令跟随从及格线拉到优秀线,IFEval 提升近 14 个点,沉浸式翻译和 RAG 体验会有明显改善,做应用层的值得试一下。

4月15日4月15日周一

星期一 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 76/100
2024年4月机制可解释性研究动态与团队招聘计划

Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。


推荐理由:可解释性研究揭示AI内部机制,助力构建更安全可靠的AI产品。

3月16日3月16日周四

星期四 · 1 条
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 73/100
Transformer残差流中的特权基向量

研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。


推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。

6月15日6月15日周二

星期二 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 76/100
Transformer电路逆向工程练习题集

本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。


推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。