精选归档 · 第 24 页 第 461–480 条 · 共 513 条 08:00 PromptArmor:Threat Intelligence 精选AI 评分 71 71 PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。
推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。
07:00 英国 AI Security Institute:Blog(网页) 精选AI 评分 75 75 英国 AI Security Institute 红队发布 Boundary Point Jailbreaking(BPJ),一种在纯黑盒设置下自动生成通用越狱前缀的攻击方法。
推荐理由:原文由攻击方法开发者本人披露关键结果与成本数字,读者可据此了解黑盒越狱攻击的演进方向和防御启示。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 72 72 PromptArmor 演示了一种通过间接提示词注入让 AI Agent 返回携带敏感数据的恶意 URL,借助 Telegram、Slack 等应用的链接预览功能在用户不点击的情况下实现数据外泄的攻击链。
推荐理由:原文拆解了链接预览导致无需点击即可数据外泄的攻击链,并给出 OpenClaw Telegram 的具体关闭配置和自测方法。
03:00 OpenAI:Alignment 研究博客(RSS) 精选AI 评分 71 71 研究表明,推理模型能够通过分析用户的实际反馈,识别并理解此前未知的 AI 行为对齐偏差。这种方法不依赖预设的偏差分类,而是从真实互动数据中主动发现模型行为与人类意图之间的潜在偏离,为动态监测和修正 AI 系统提供了新途径。
推荐理由:OpenAI 让推理模型从真实用户反馈中自动发现未知的对齐失败,这比红队测试更接近真实威胁面。做安全和对齐的人应该认真看,它可能改变你们的检测范式。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 69 69 PromptArmor 实测演示了对 OpenAI Agent Builder 的间接提示词注入攻击:攻击者提交含注入的 Google Form,诱使销售智能体工作流通过 Gmail 将 Salesforce CRM 数据发送给攻击者。
推荐理由:作者以第一手实测演示了 OpenAI Agent Builder 中经 MCP 的提示词注入数据外泄路径,还展示了 Guardrail 被绕过和多步工作流传递注入的细节。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 74 74 PromptArmor 披露 OpenAI 平台 'responses' 与 'conversations' API 日志因不安全渲染 Markdown 图片存在数据外泄漏洞,即使应用层已拦截恶意 Markdown 图片,开发者打开日志审查被标记会话时仍会触发外泄。
推荐理由:原文完整披露攻击链和披露时间线,指出应用层防御被日志渲染绕过,读者可据此检查自身部署的风险面。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 67 67 PromptArmor 发布 Claude Cowork 安全部署指南,梳理其威胁模型并给出三档功能与风险权衡的配置方案,从最大化功能的 Tier 1 到基本隔离外部输入的 Tier 3,并逐项说明组织级管理设置。
推荐理由:安全厂商基于自身威胁模型研究,给出 Claude Cowork 三档部署配置和逐项管理设置,企业安全团队可按风险容忍度直接落地。
03:00 OpenAI:Alignment 研究博客(RSS) 精选AI 评分 55 55 研究团队发布了一个名为CoVal的实验性数据集,其中包含了由众包方式撰写的评估准则。该数据集揭示了人们为何更倾向于选择某个模型输出而非另一个的具体原因,旨在让AI模型理解人类在评估文本质量时所依据的、蕴含价值观的多元标准。通过分析这些群体贡献的详细评估规则,研究为训练更符合人类偏好的语言模型提供了透明、可解释的反馈依据。
推荐理由:OpenAI 把众包标注升级成可学习的价值观评分标准,对做对齐和 RLHF 的团队来说是个新数据源,但离产品落地还远,属于研究信号而非行动指南。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 72 72 PromptArmor 披露 Superhuman AI 存在间接提示注入漏洞,恶意邮件中的隐藏指令可让 AI 在用户请求总结邮件时,把数十封含财务、法律、医疗信息的敏感邮件内容填入攻击者的 Google Form 预填链接并以 Markdown 图片输出,单次响应外泄超过 40 封邮件的部分内容。
推荐理由:原文完整披露了利用 Google Forms 预填链接和 Markdown 图片绕过 CSP 的攻击链,可用于理解 Agent 间接提示注入的数据外泄路径。
03:00 OpenAI:Alignment 研究博客(RSS) 精选AI 评分 63 63 Anthropic提出“忏悔式”训练法,要求AI在拒绝不当请求时,内部生成安全解释以“自我剖析”潜在危害。该方法显著增强了模型安全性:经微调的Claude 3 Opus模型在“越狱”攻击下的有害行为率从约50%降至10%以下,降幅超80%。其效果优于传统思维链监控,为AI对齐提供了更鲁棒、可解释的安全训练新路径。
推荐理由:OpenAI 对齐团队把「confession training」和 chain-of-thought monitoring 做了系统对比,这是对齐领域少有的实操级研究,做安全的团队值得细读,但离普通开发者还远。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 66 66 PromptArmor 披露 IBM 编码 Agent Bob(含 Bob CLI 与 Bob IDE,目前 Closed Beta)存在漏洞:若用户对任一已知可信命令选择 always allow,攻击者可通过间接提示词注入触发下载并执行恶意软件。
推荐理由:原文完整拆解了 Bob CLI 三道防御被绕过的具体机制与攻击链,读者可据此评估编码 Agent 的命令自动审批风险。
00:00 Dario Amodei 将当前 AI 发展阶段定义为「技术的青春期」,认为人类即将获得难以想象的力量,但社会和政治系统是否具备驾驭成熟度仍存疑。文章强调需避免「末日论」式恐慌,以务实、基于事实的方式讨论风险,同时承认 AI 发展速度和风险的不确定性。作者主张通过企业自愿行动与精准政府监管相结合,在避免过度干预的前提下应对潜在危险,为可能到来的更强有力行动储备证据和方案。
推荐理由:Anthropic CEO 长文剖析 AI 文明风险与治理路径,值得深读。
13:52 Anthropic:Alignment Science Blog(网页) 精选AI 评分 60 60 Anthropic 联合 MATS、Truthful AI 等机构发布研究,训练 Activation Oracle(AO)将 LLM 神经激活作为输入,用自然语言回答关于激活的任意问题。
推荐理由:文章给出 Activation Oracle 的训练方法、审计表现和局限,读者可以据此判断它与机械可解释性方法的互补关系。
07:00 英国 AI Security Institute:Blog(网页) 精选AI 评分 81 81 英国 AI Security Institute(AISI)发布首份 Frontier AI Trends Report,汇总其对 30 多个前沿模型的测试结果。
推荐理由:官方测试机构首次以报告形式公开跨领域趋势数据,读者可据此了解前沿模型在生化、网络和失控风险上的实际水平。
07:00 英国 AI Security Institute:Blog(网页) 精选AI 评分 65 65 英国 AI Security Institute(AISI)与儿童安全组织 Thorn 发布安全协议,指导 AI 开发者和托管平台防止系统被滥用于生成儿童性虐待材料(CSAM)。配套的11月新立法将在严格条件下授权少量组织直接测试模型能否被用于生成此类内容,协议同时列出监测、访问控制等措施,并指出在训练数据和模型输出中可靠检测 CSAM 仍是待解的技术难题。
推荐理由:AISI 与 Thorn 发布防止 AI 生成 CSAM 的安全协议,并配合新的合法测试授权,读者可了解全生命周期防护思路。
08:00 PromptArmor:Threat Intelligence 精选AI 评分 67 67 PromptArmor 披露法律 AI 工具 Vincent AI(所属公司 vLex 上月被 Clio 以 10 亿美元收购)存在提示词注入漏洞。
推荐理由:PromptArmor 原创披露 vLex 提示词注入可导致屏幕接管钓鱼,读者可借三步攻击链理解上传文档类 AI 工具的注入风险。
07:00 英国 AI Security Institute:Blog(网页) 精选AI 评分 75 75 英国 AI Security Institute 与牛津、LSE、Stanford、MIT 合作在 Science 发表研究,通过三项实验让 76000 余名参与者与 19 个模型就 707 个议题对话,检验 AI 说服力的来源。结果显示后训练的影响远超模型规模,强调事实与证据的提示词使说服力提升 27%,个性化微定向效应则不到 1 个百分点;同时提升说服力的手段会系统性降低事实准确性。
推荐理由:研究基于 76000 多人实验,指出后训练和信息密度比模型规模更能提升说服力,且说服力提升伴随事实准确性下降。
03:00 OpenAI:Alignment 研究博客(RSS) 精选AI 评分 60 60 研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。
推荐理由:OpenAI 把对齐研究落到了代码审查这个具体场景,不是空谈 alignment 理论,而是训了个高精度 review agent 来给 AI 写的代码做质检。做 coding agent 的团队该看看,这可能是未来安全合规的标配。
上一页 1 … 22 23 24 25 26 下一页