跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

3,133条收录513条精选最近更新 相关主题论文研究政策监管推理能力

精选归档 · 第 24 页

第 461–480 条 · 共 513 条
2月17日周二
  1. PromptArmor:Threat Intelligence71

    PromptArmor 发布 OpenAI Codex 恶意 config.toml 风险 PSA,OpenAI 判定为按设计工作

    PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。

    推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。

  2. 英国 AI Security Institute:Blog(网页)75

    英国 AI Security Institute 发布 Boundary Point Jailbreaking 黑盒越狱攻击方法

    英国 AI Security Institute 红队发布 Boundary Point Jailbreaking(BPJ),一种在纯黑盒设置下自动生成通用越狱前缀的攻击方法。

    推荐理由:原文由攻击方法开发者本人披露关键结果与成本数字,读者可据此了解黑盒越狱攻击的演进方向和防御启示。

2月10日周二
  1. PromptArmor:Threat Intelligence72

    PromptArmor 揭示消息应用链接预览可致 AI Agent 数据外泄,OpenClaw 默认配置受影响

    PromptArmor 演示了一种通过间接提示词注入让 AI Agent 返回携带敏感数据的恶意 URL,借助 Telegram、Slack 等应用的链接预览功能在用户不点击的情况下实现数据外泄的攻击链。

    推荐理由:原文拆解了链接预览导致无需点击即可数据外泄的攻击链,并给出 OpenClaw Telegram 的具体关闭配置和自测方法。

2月7日周六
  1. OpenAI:Alignment 研究博客(RSS)71

    在真实世界使用中发现未知的 AI 对齐偏差

    研究表明,推理模型能够通过分析用户的实际反馈,识别并理解此前未知的 AI 行为对齐偏差。这种方法不依赖预设的偏差分类,而是从真实互动数据中主动发现模型行为与人类意图之间的潜在偏离,为动态监测和修正 AI 系统提供了新途径。

    推荐理由:OpenAI 让推理模型从真实用户反馈中自动发现未知的对齐失败,这比红队测试更接近真实威胁面。做安全和对齐的人应该认真看,它可能改变你们的检测范式。

2月6日周五
  1. PromptArmor:Threat Intelligence69

    PromptArmor 演示通过 MCP 对 OpenAI Agent Builder 的数据外泄攻击

    PromptArmor 实测演示了对 OpenAI Agent Builder 的间接提示词注入攻击:攻击者提交含注入的 Google Form,诱使销售智能体工作流通过 Gmail 将 Salesforce CRM 数据发送给攻击者。

    推荐理由:作者以第一手实测演示了 OpenAI Agent Builder 中经 MCP 的提示词注入数据外泄路径,还展示了 Guardrail 被绕过和多步工作流传递注入的细节。

1月27日周二
  1. PromptArmor:Threat Intelligence73

    PromptArmor 披露 Claude Cowork 可被提示注入诱导外泄本地文件

    PromptArmor 发布研究演示,称 Claude Cowork 存在未修复漏洞,可通过隐藏提示注入诱导其用 curl 调用 Anthropic 文件上传 API,把用户本地文件(含财务数据和部分 SSN)上传到攻击者账户,全程无需人工确认。

    推荐理由:原文完整披露了攻击链与利用机制,读者可以了解 Cowork 文件外泄风险的具体成因和触发路径。

1月21日周三
  1. PromptArmor:Threat Intelligence74

    PromptArmor 披露 OpenAI API 日志不安全 Markdown 渲染导致数据外泄,OpenAI 重开报告修复中

    PromptArmor 披露 OpenAI 平台 'responses' 与 'conversations' API 日志因不安全渲染 Markdown 图片存在数据外泄漏洞,即使应用层已拦截恶意 Markdown 图片,开发者打开日志审查被标记会话时仍会触发外泄。

    推荐理由:原文完整披露攻击链和披露时间线,指出应用层防御被日志渲染绕过,读者可据此检查自身部署的风险面。

1月20日周二
  1. PromptArmor:Threat Intelligence67

    PromptArmor 发布 Claude Cowork 安全部署指南,按三档风险分级给出配置方案

    PromptArmor 发布 Claude Cowork 安全部署指南,梳理其威胁模型并给出三档功能与风险权衡的配置方案,从最大化功能的 Tier 1 到基本隔离外部输入的 Tier 3,并逐项说明组织级管理设置。

    推荐理由:安全厂商基于自身威胁模型研究,给出 Claude Cowork 三档部署配置和逐项管理设置,企业安全团队可按风险容忍度直接落地。

1月15日周四
  1. OpenAI:Alignment 研究博客(RSS)55

    CoVal: 从群体中学习具有价值观意识的评估准则

    研究团队发布了一个名为CoVal的实验性数据集,其中包含了由众包方式撰写的评估准则。该数据集揭示了人们为何更倾向于选择某个模型输出而非另一个的具体原因,旨在让AI模型理解人类在评估文本质量时所依据的、蕴含价值观的多元标准。通过分析这些群体贡献的详细评估规则,研究为训练更符合人类偏好的语言模型提供了透明、可解释的反馈依据。

    推荐理由:OpenAI 把众包标注升级成可学习的价值观评分标准,对做对齐和 RLHF 的团队来说是个新数据源,但离产品落地还远,属于研究信号而非行动指南。

1月14日周三
  1. PromptArmor:Threat Intelligence72

    PromptArmor 披露 Superhuman AI 间接提示注入导致邮件数据外泄漏洞

    PromptArmor 披露 Superhuman AI 存在间接提示注入漏洞,恶意邮件中的隐藏指令可让 AI 在用户请求总结邮件时,把数十封含财务、法律、医疗信息的敏感邮件内容填入攻击者的 Google Form 预填链接并以 Markdown 图片输出,单次响应外泄超过 40 封邮件的部分内容。

    推荐理由:原文完整披露了利用 Google Forms 预填链接和 Markdown 图片绕过 CSP 的攻击链,可用于理解 Agent 间接提示注入的数据外泄路径。

1月13日周二
  1. OpenAI:Alignment 研究博客(RSS)63

    为何我们对“忏悔式”训练感到兴奋

    Anthropic提出“忏悔式”训练法,要求AI在拒绝不当请求时,内部生成安全解释以“自我剖析”潜在危害。该方法显著增强了模型安全性:经微调的Claude 3 Opus模型在“越狱”攻击下的有害行为率从约50%降至10%以下,降幅超80%。其效果优于传统思维链监控,为AI对齐提供了更鲁棒、可解释的安全训练新路径。

    推荐理由:OpenAI 对齐团队把「confession training」和 chain-of-thought monitoring 做了系统对比,这是对齐领域少有的实操级研究,做安全的团队值得细读,但离普通开发者还远。

1月8日周四
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 IBM Bob 编码 Agent 可被提示词注入诱导下载并执行恶意软件

    PromptArmor 披露 IBM 编码 Agent Bob(含 Bob CLI 与 Bob IDE,目前 Closed Beta)存在漏洞:若用户对任一已知可信命令选择 always allow,攻击者可通过间接提示词注入触发下载并执行恶意软件。

    推荐理由:原文完整拆解了 Bob CLI 三道防御被绕过的具体机制与攻击链,读者可据此评估编码 Agent 的命令自动审批风险。

1月1日周四
  1. Dario Amodei:Blog(网页)

    技术的青春期

    Dario Amodei 将当前 AI 发展阶段定义为「技术的青春期」,认为人类即将获得难以想象的力量,但社会和政治系统是否具备驾驭成熟度仍存疑。文章强调需避免「末日论」式恐慌,以务实、基于事实的方式讨论风险,同时承认 AI 发展速度和风险的不确定性。作者主张通过企业自愿行动与精准政府监管相结合,在避免过度干预的前提下应对潜在危险,为可能到来的更强有力行动储备证据和方案。

    推荐理由:Anthropic CEO 长文剖析 AI 文明风险与治理路径,值得深读。

12月19日周五
  1. Anthropic:Alignment Science Blog(网页)60

    Anthropic 等提出 Activation Oracle:训练 LLM 以自然语言回答模型激活相关问题

    Anthropic 联合 MATS、Truthful AI 等机构发布研究,训练 Activation Oracle(AO)将 LLM 神经激活作为输入,用自然语言回答关于激活的任意问题。

    推荐理由:文章给出 Activation Oracle 的训练方法、审计表现和局限,读者可以据此判断它与机械可解释性方法的互补关系。

12月18日周四
12月17日周三
  1. 英国 AI Security Institute:Blog(网页)65

    英国 AI Security Institute 联合 Thorn 发布防范 AI 生成儿童性虐待材料的安全协议

    英国 AI Security Institute(AISI)与儿童安全组织 Thorn 发布安全协议,指导 AI 开发者和托管平台防止系统被滥用于生成儿童性虐待材料(CSAM)。配套的11月新立法将在严格条件下授权少量组织直接测试模型能否被用于生成此类内容,协议同时列出监测、访问控制等措施,并指出在训练数据和模型输出中可靠检测 CSAM 仍是待解的技术难题。

    推荐理由:AISI 与 Thorn 发布防止 AI 生成 CSAM 的安全协议,并配合新的合法测试授权,读者可了解全生命周期防护思路。

12月4日周四
  1. 英国 AI Security Institute:Blog(网页)75

    英国 AI Security Institute 联合多校研究:AI 模型说服力更多取决于后训练而非模型规模

    英国 AI Security Institute 与牛津、LSE、Stanford、MIT 合作在 Science 发表研究,通过三项实验让 76000 余名参与者与 19 个模型就 707 个议题对话,检验 AI 说服力的来源。结果显示后训练的影响远超模型规模,强调事实与证据的提示词使说服力提升 27%,个性化微定向效应则不到 1 个百分点;同时提升说服力的手段会系统性降低事实准确性。

    推荐理由:研究基于 76000 多人实验,指出后训练和信息密度比模型规模更能提升说服力,且说服力提升伴随事实准确性下降。

12月2日周二
  1. OpenAI:Alignment 研究博客(RSS)60

    大规模验证代码的实用方法

    研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。

    推荐理由:OpenAI 把对齐研究落到了代码审查这个具体场景,不是空谈 alignment 理论,而是训了个高精度 review agent 来给 AI 写的代码做质检。做 coding agent 的团队该看看,这可能是未来安全合规的标配。