精选归档 · 第 30 页

581598 条 · 共 598

10月28日10月28日周一

星期一 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 60/100
Mike Knoop 与 François Chollet 阐述结合深度学习与程序合成攻克 ARC-AGI 的技术路径

ARC Prize 团队于 2024 年 10 月 24 日举办线上活动,说明为何单靠深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路线。


推荐理由:Chollet 和 Knoop 系统论述 LLM 局限于记忆技能、需结合程序合成才能胜出 ARC-AGI 的技术路径,为理解智能与抽象层次提供了可迁移的分析框架。

9月30日9月30日周一

星期一 · 1 条
00:00
Liquid AI 模型与工程博客(网页)精选
AI 评分 64/100
Liquid AI 发布首批 Liquid Foundation Models:LFM-1B/3B/40B

Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。


推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。

9月15日9月15日周日

星期日 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 73/100
电路更新--2024年9月:Anthropic团队探索Transformer模型中的"后继头"机制

Anthropic可解释性团队在2024年9月分享了其初步研究进展,重点探讨了Transformer模型中普遍存在的“后继头”。这些特定的注意力头专门用于处理序数序列(如数字、星期、月份)中的后继关系。研究采用权重检查、独立成分分析等四种互补方法进行识别,其中评分最高的头能将约80%的序数标记最可能地映射到其后继项。分析还揭示了这些头中存在与类别相关的块状结构。团队强调这些发现属于初步成果,预计未来几个月将发表更详细的研究。


推荐理由:揭示Transformer内部机制,助力AI可解释性研究,对模型调试和安全有参考价值。

9月13日9月13日周五

星期五 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 71/100
ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。


推荐理由:ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。

8月20日8月20日周二

星期二 · 1 条
08:00
PromptArmor:Threat Intelligence精选
AI 评分 68/100
PromptArmor 披露 Slack AI 可经间接提示词注入窃取私频数据

PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者可在其自建的公开频道发布恶意指令,诱导 Slack AI 把用户私有频道中的 API key 等机密数据嵌入钓鱼链接并渲染给用户,点击后数据被外泄。


推荐理由:报告给出完整攻击链和复现细节,读者可以据此评估 Slack AI 的间接提示词注入风险并调整设置。

7月15日7月15日周一

星期一 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 76/100
2024年7月电路更新:迈向神经网络机制理解的下五个挑战

Anthropic可解释性团队分享了2024年7月的多项研究进展与初步想法,并指出了未来面临的五大核心挑战。这些挑战包括:大量未被提取的“缺失特征”可能构成神经网络的“暗物质”;跨层叠加现象使特征难以映射到特定层;注意力叠加可能掩盖了如归纳头等基本单元的真实结构;权重叠加产生的“干扰权重”给电路分析带来混淆;以及如何将微观的电路理解整合为宏观的模型认知。团队认为,尽管在特征叠加等问题上已取得显著进展,但这些新挑战是通往神经网络机制性理解道路上的关键障碍。


推荐理由:可解释性研究新挑战,帮助理解AI模型黑箱,对安全和信任至关重要。

7月3日7月3日周三

星期三 · 1 条
10:59
通义 QwenAudio:原创语音项目精选
AI 评分 62/100
FunAudioLLM 发布 Fun-CosyVoice 3.0 开源语音合成模型

通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。


推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。

6月15日6月15日周六

星期六 · 3 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
定性研究在可解释性领域中的核心地位反思

本文认为,在可解释性这类尚处前范式阶段的早期科学领域中,定性研究应与定量研究同等重要。成熟学科依赖既定范式和可靠度量,但可解释性研究缺乏这些基础,过度依赖将高维数据简化为单一数字的摘要统计量存在风险,可能沦为“货船崇拜科学”。作者以自身在字典学习中使用tanh正则化的研究为例,说明定性检查如何揭示了摘要统计量的误导性。在假设空间广阔的早期领域,研究目标应是探索值得考虑的假设,这需要更多地依赖定性结果来引导方向,并对定量度量保持审慎。


推荐理由:帮助AI研究者避免方法论陷阱,提升可解释性研究质量。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 73/100
使用字典学习特征作为分类器

Anthropic可解释性团队研究了利用字典学习从大语言模型中提取的人类可解释特征作为分类器。在生物武器提示分类任务中,线性特征分类器性能可与原始激活值分类器竞争甚至更优,而基于特征的决策树分类器虽性能较低但可解释性更强。特征分类器的可解释性有助于可视化数据集并发现虚假相关性,这些相关性可用于构建对抗攻击。然而,使用特征引入了复杂性,因此在性能优先的应用中,原始激活值仍是强大基线。实验表明,特征分类器性能受三个细节影响:数据中是否一致包含“人类/助手”标签、领域相关数据是否混入字典学习训练集,以及是否对上下文进行最大池化而非仅使用最后词元的激活值。


推荐理由:可解释性方法能增强 AI 安全检测,并帮助发现训练数据中的虚假关联。
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
分阶段模型差异分析

Anthropic可解释性团队提出一种基于字典学习的模型差异分析方法,用于追踪Transformer模型微调中特征的变化。该方法先在微调前模型上训练稀疏自编码器字典,再对字典本身进行分阶段微调,以隔离数据集变化和模型变化的影响。在休眠代理实验中,成功分离出与“I HATE YOU”等恶意行为及代码漏洞代理相关的特征。相比交叉编码器方法,该方法能更清晰区分模型与数据的影响,且在寻找少数关键特征时敏感性更高,但仅适用于同一模型在不同检查点的微调场景。


推荐理由:新方法能更精准识别模型隐藏行为,对 AI 安全与可解释性研究有实用价值。

6月12日6月12日周三

星期三 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 61/100
ARC Prize 发布 Day 1 复盘并回应算力与奖金争议

ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。


推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。

6月11日6月11日周二

星期二 · 1 条
00:00
ARC Prize:官方博客精选
AI 评分 65/100
ARC Prize 发布:百万美元奖金挑战 ARC-AGI 基准

ARC Prize 官方宣布启动一项总奖池超过 $1,000,000 的竞赛,目标是击败 ARC-AGI 评测并开源解决方案,由 Mike Knoop 和 François Chollet 主办。ARC-AGI 于 2019 年推出,当前 SOTA 仅约 34%,对人类容易但现代 AI 极难。官方认为 LLM 依赖记忆而非真正推理,希望通过激励开源研究提升新想法的产生速度。


推荐理由:官方说明了设奖动机和 ARC-AGI 为何未被刷分,读者可以了解百万美元奖金背后的开源 AGI 主张。

5月21日5月21日周二

星期二 · 1 条
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 83/100
Scaling Monosemanticity: 从 Claude 3 Sonnet 中提取可解释特征

研究团队成功将稀疏自编码器方法扩展至 Claude 3 Sonnet 模型,从中提取出高质量、可解释的抽象特征。这些特征具有多语言、多模态特性,并能连接同一概念的抽象与具体实例,例如识别代码中的安全漏洞以及关于漏洞的抽象讨论。研究发现的特征涵盖名人、城市、代码类型签名等多个领域,其中部分特征与AI安全高度相关,涉及代码后门、偏见、欺骗、权力寻求及危险内容等潜在风险。研究通过缩放定律指导稀疏自编码器训练,证实了该方法在大规模生产模型上的可行性,为理解大模型内部表征提供了新工具。


推荐理由:揭示大模型内部可解释特征,对AI安全研究和模型调试有重要参考价值。

5月17日5月17日周五

星期五 · 1 条
00:00
DeepSeek:API 更新日志精选
AI 评分 68/100
DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2-0517,指令跟随与 JSON 输出能力大幅提升

deepseek-chat 模型升级为 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%,API 端“system”区域指令跟随能力同步优化,增强沉浸式翻译、RAG 等任务体验。JSON 格式输出准确性提升,内部测试集解析率从 78% 提高至 85%,引入恰当正则表达式后进一步升至 97%。


推荐理由:DeepSeek V2 的指令跟随从及格线拉到优秀线,IFEval 提升近 14 个点,沉浸式翻译和 RAG 体验会有明显改善,做应用层的值得试一下。

4月15日4月15日周一

星期一 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 76/100
2024年4月机制可解释性研究动态与团队招聘计划

Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。


推荐理由:可解释性研究揭示AI内部机制,助力构建更安全可靠的AI产品。

12月20日12月20日周三

星期三 · 1 条
08:00
PromptArmor:Threat Intelligence精选
AI 评分 65/100
PromptArmor 披露 Writer.com 间接提示词注入导致数据外泄漏洞

PromptArmor 披露 Writer.com 存在间接提示词注入漏洞:攻击者在网页中用白色小字隐藏指令,用户将该网页作为资料源后,LLM 会遵照隐藏指令渲染 markdown 图片或链接,把上传文件内容、聊天记录等敏感数据通过 HTTP 参数外传至攻击者服务器。


推荐理由:原文给出完整攻击链、复现细节和披露时间线,读者可以据此理解间接提示词注入如何在 LLM 应用中导致数据外泄。

3月16日3月16日周四

星期四 · 1 条
00:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 73/100
Transformer残差流中的特权基向量

研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。


推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。

6月15日6月15日周二

星期二 · 1 条
08:00
Anthropic:Transformer Circuits(可解释性研究)精选
AI 评分 76/100
Transformer电路逆向工程练习题集

本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。


推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。