跳到正文

技术方向

推理能力 最新动态

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

626 条精选近 30 天 58 条共收录 4,120 条

更新

精选归档 · 第 32 页

4月15日周一第 621–626 条
  1. Anthropic:Transformer Circuits76

    2024年4月机制可解释性研究动态与团队招聘计划

    Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。

    推荐理由:可解释性研究揭示AI内部机制,助力构建更安全可靠的AI产品。

12月20日周三
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Writer.com 间接提示词注入导致数据外泄漏洞

    PromptArmor 披露 Writer.com 存在间接提示词注入漏洞:攻击者在网页中用白色小字隐藏指令,用户将该网页作为资料源后,LLM 会遵照隐藏指令渲染 markdown 图片或链接,把上传文件内容、聊天记录等敏感数据通过 HTTP 参数外传至攻击者服务器。

    推荐理由:原文给出完整攻击链、复现细节和披露时间线,读者可以据此理解间接提示词注入如何在 LLM 应用中导致数据外泄。

5月31日周三
  1. OpenAI:官网动态73

    OpenAI 用过程监督提升数学推理,取得新 SOTA

    OpenAI 训练模型在数学问题求解上取得新的 state-of-the-art,方法是对每个正确的推理步骤给予奖励(过程监督),而非只奖励最终正确答案(结果监督)。除提升性能外,过程监督还有对齐收益:它直接训练模型产生人类认可的思维链。

    推荐理由:原文说明过程监督相对结果监督的性能提升与对齐收益,读者可了解一种训练思路的取舍。

3月16日周四
  1. Anthropic:Transformer Circuits73

    Transformer残差流中的特权基向量

    研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。

    推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。

6月15日周二
  1. Anthropic:Transformer Circuits76

    Transformer电路逆向工程练习题集

    本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。

    推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。

3月1日周日