跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

3,681条收录643条精选最近更新 相关主题OpenAI / ChatGPTGoogle / Gemini安全对齐

精选归档 · 第 33 页

第 641–643 条 · 共 643 条
3月17日周五
  1. METR:Research70

    ARC 发布 Claude 与 GPT-4 危险能力评测进展

    ARC 作为第三方评估方与 Anthropic、OpenAI 等实验室合作,在受控环境中测试前沿模型自主获取资源、逃避人工监督的危险能力。结论是被测的 Claude 和 GPT-4 版本均未能产出可信的完整自主复制计划,执行中易出错、有幻觉、难以在多副本间分派任务,但能部分完成浏览网页、雇佣人类代办、制定长期计划等子任务。

    推荐理由:ARC 公布了危险能力评测的动机、方法与结论,读者可以了解模型自主复制能力的评估方式。

3月16日周四
  1. Anthropic:Transformer Circuits73

    Transformer残差流中的特权基向量

    研究发现Transformer模型的残差流中存在“特权基向量”现象,即某些坐标方向持续出现异常大的激活值,这与“无特权基”的理论预期相悖。通过实验,研究者将根源指向Adam优化器中的逐维度归一化器,而非层归一化或浮点精度问题。在2亿参数模型中,典型层有20至60个维度的激活绝对值超过6。研究还提出使用峰度作为检测指标,发现激活分布峰度普遍大于3,进一步证实了基向量对称性被破坏。

    推荐理由:揭示Transformer内部基依赖性的根源,帮助研究者改进模型可解释性。

6月15日周二
  1. Anthropic:Transformer Circuits76

    Transformer电路逆向工程练习题集

    本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。

    推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。