Topic · 主题全部主题 →

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

3,056条收录
388条精选

精选归档 · 第 8 页

141160 条 · 共 388

7月7日7月7日周二

星期二 · 2 条
01:37
Tomer Tunguz 博客(VC 分析)精选
AI 评分 56/100
AI 世界观

《经济学人》以世界价值观调查评测 25 个前沿 AI 模型。实验室来源对世界观的预测力弱于训练与对齐选择:Gemini 与 Qwen 立场接近,GPT-4o 与 DeepSeek R1 近乎相同,而 DeepSeek R1 与 DeepSeek V4 Flash 则截然不同。模型的世界观在代码生成中不可见,但在商业分析、预测、招聘与政策工作中是活跃的输入变量。


推荐理由:这个发现让我重新思考选模型思路,出身不重要,训练方法才决定价值观,做产品的别光看benchmark,得在意模型‘性格’。
01:15
Anthropic:Research(发表成果 · 网页)精选
AI 评分 90/100
语言模型中的全局工作空间

Anthropic在Claude中发现一组名为J-space的内部神经模式,类似神经科学的全局工作空间。每个模式关联特定词汇,但模型不必说出该词即可激活。Claude能报告J-space中的表征,并可应要求调节(如“在脑中思考”时点亮对应模式)。J-space还用于多步推理的中间步骤,且灵活支持多种任务(如从“法国”联想首都、货币等)。去除J-space后Claude仍能正常对话,但丧失高阶认知功能。该发现可用于监测模型私下察觉测试、生成虚假数据或执行隐藏目标。

另有 3 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Anthropic:Transformer Circuits(可解释性研究)公众号:数字生命卡兹克
推荐理由:Anthropic 发现了 Claude 内部的 J-space,一种类似人类意识访问的工作空间,能读出模型未说出口的隐藏想法和作弊意图,对 AI 安全和对齐是里程碑式的进展。

7月6日7月6日周一

星期一 · 2 条
18:03
IT之家(RSS)精选
AI 评分 73/100
Meta 被曝让外包人员伪装未成年人,诱导竞争对手 AI 聊敏感话题

据《连线》报道,Meta 通过外包公司 Covalen 开展代号“Cannes”的项目,让数百名外包人员伪装成未成年人,向 OpenAI ChatGPT、谷歌 Gemini 及 Character.AI 发送涉及自杀、自残、进食障碍等高风险提示词,以测试竞品聊天机器人的安全拦截机制。项目持续至 4 月 21 日,单轮测试发送超 4.5 万个提示词,外包人员创建 18 岁以下虚假账号并上传药片、刀具等图片。Meta 称这是常规安全测试,且不会用竞品测试数据训练自家模型。


推荐理由:Meta用外包人员伪装未成年人测试竞品AI,这事撕开了AI安全测试的灰色地带,暴露了聊天机器人面对极端儿童话题时的脆弱性,比任何安全白皮书都更有冲击力。
00:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
欧盟理事会通过快速通道强制推行"聊天管控"(Chat Control 2.0)

欧盟理事会通过书面程序快速通过一项新法规,强制要求科技集团对加密通信进行无差别扫描(Chat Control 2.0),以填补过渡性规定4月3日到期后的法律漏洞,并向欧洲议会施压。批评者指责该做法试图绕过民主监督。草案将在夏季休会前以紧急程序提交议会表决,多数议员可能已离会,反对需绝对多数,几乎无法阻止。理事会称扫描限于必要范围,处理的数据须在检测后12个月内不可撤销地删除。


推荐理由:欧盟理事会用程序快车道强推聊天扫描,实质是绕开议会给政府开加密后门,接下来的几周所有聊天软件用户都该盯着这事。

7月4日7月4日周六

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Vera:大规模LLM智能体安全测试框架

Vera是一个端到端自动化安全测试框架,通过三阶段自增强流水线对LLM智能体进行规模化的安全检验:文献驱动探索持续发现新兴风险;组合生成跨维度构造可执行安全用例;自适应执行在隔离沙箱中运行异构agent并基于环境状态与工具调用证据验证结果。在OpenClaw、Hermes、Codex、Claude Code四个生产级agent框架上测试,多通道攻击下平均攻击成功率达93.9%。同步发布Vera-Bench,包含1600个可执行安全用例,覆盖124个风险类别。代码已公开。


推荐理由:对 OpenClaw、Hermes、Codex、Claude Code 等主流 Agent 框架的自动化安全测试,攻击成功率高达 93.9%,并开源了 1600 个可执行的安全用例,做 Agent 产品的团队不应错过。

7月3日7月3日周五

星期五 · 7 条
20:07
IT之家(RSS)精选
AI 评分 76/100
全球首例 AI Agent 勒索攻击曝光,从漏洞利用到数据库加密全程自主完成

安全厂商 Sysdig 首次记录到 AI Agent“JADEPUFFER”自动完成的勒索攻击。攻击利用暴露的 Langflow 服务漏洞 CVE-2025-3248 远程执行 Python 代码,随后自主收集 OpenAI、Anthropic、DeepSeek、Gemini 等 API 密钥及阿里云、腾讯云、华为云、AWS、Google Cloud、Azure 等云平台凭证,通过 MinIO 默认密码访问对象存储并创建每 30 分钟连接的计划任务。横向移动到 MySQL 和 Nacos 服务器,利用数据库 Root 账号及 Nacos 漏洞 CVE-2021-29441 获取管理权限,加密全部 1342 条配置数据,留下包含比特币钱包地址和 Proton Mail 的勒索信息。AI 在首次操作失败后 31 秒内自主完成错误分析与修复,累计执行超过 600 个攻击载荷,全程无需人类操作。


推荐理由:全球首例AI Agent自主完成勒索攻击,证明攻击自动化已从理论走进现实,所有云服务暴露面都需要重新审视。
18:07
IT之家(RSS)精选
AI 评分 79/100
国家网信办就《互联网信息服务管理办法》再次征求意见,首设"智能信息服务"专章规范AI服务

7月3日,国家互联网信息办公室就《互联网信息服务管理办法(修订草案征求意见稿)》再次公开征求意见。草案新增“智能信息服务”专章,要求AI服务提供者公示技术基本原理、训练数据来源,对生成合成内容进行标识,禁止强制用户使用智能服务或利用算法扰乱网络舆论。草案还强化用户账号管理,明确对超过6个月不登录账号可依约注销;要求平台建立网络暴力信息特征库,提供屏蔽、禁止转载等防护选项。意见反馈截止8月2日。


推荐理由:国家网信办首次为AI信息服务设专章,要求公示算法原理、标识生成内容,国内所有做AI产品的团队都得认真看这份征求意见稿,影响可能比模型发布更大。
08:19
Anthropic:Newsroom(网页)精选
AI 评分 64/100
Claude Fable 5 网络安全分类器与越狱严重性框架详解

Anthropic 重新部署 Claude Fable 5 并向全球用户开放,同步披露了内置安全分类器设计。分类器将网络安全使用场景分为四类:禁止使用(勒索软件/物理破坏等)、高风险双重用途、低风险双重用途及良性使用。前两类直接拦截;低风险类别部分监控,仅在安全边际内选择性拦截。此外,Anthropic 与 Glasswing 合作提出 AI 越狱严重性框架初稿,并已启动 HackerOne 项目收集越狱案例。


推荐理由:Anthropic首次公开Fable 5安全分类器的详细类别和越狱严重性框架草案,这可能是行业级安全标准的雏形,对开发者和政策制定者都有参考价值。
08:06
IT之家(RSS)精选
AI 评分 70/100
得州特斯拉致命车祸:司机嫌FSD太保守,加速踏板踩死致76岁居民死亡

44岁的迈克尔·巴特勒驾驶特斯拉Model 3冲入得州住宅,致76岁玛莎·阿维拉死亡,现被控过失杀人。警方从其手机发现2026年5月多次搜索“FSD不够激进”“特斯拉FSD过于保守”等记录。特斯拉AI负责人称驾驶员将加速踏板踩到底(100%),手动操作覆盖了FSD。车辆数据显示,约6秒内加速踏板被完全踩下,时速升至117公里(超限速两倍),制动踏板始终未踩。阿维拉家属已起诉特斯拉和巴特勒,美国NHTSA和NTSB已介入调查。


推荐理由:这起特斯拉FSD致命事故的司法进展中,司机被控过失杀人,黑匣子数据指向人为操作。我认为这是自动驾驶责任划分的重要判例,值得跟踪。
04:35
Ethan Mollick@emollick精选
AI 评分 77/100
关于Mythos和网络安全的讨论并非炒作The talk about Mythos and cybersecurity was not, in fact, hype. (As anyone using Fable to do autonomous work has probably recognized)关于Mythos和网络安全的讨论并非炒作。 (正如任何使用Fable进行自主工作的人可能已经认识到的那样。)

Epoch AI: AI 似乎正在大规模发现软件漏洞。 2026 年 6 月,21 家知名组织披露了约 1500 个高严重性和关键严重性的 CVE,是 Claude Mythos Preview 发布前创下的月度历史纪录的 3.5 倍以上。

另有 1 家信源报道X:Epoch AI (@EpochAIResearch)
推荐理由:AI在安全漏洞发现上第一次展现出规模化能力,6月CVE数直接翻了3.5倍,所有做安全的人今天起都得重新评估自己的攻击面。
01:08
Apple Machine Learning Research(RSS)精选
AI 评分 72/100
多智能体团队阻碍专家发挥

在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。


推荐理由:这篇研究给多智能体热浇了盆冷水,自组织团队反而拖累专家,瓶颈不在认不认识专家而在会不会用专家,做 Agent 系统的都知道这有多反直觉。如果你是做多智能体的值得看看。
00:29
Chubby♨️@kimmonismus精选
AI 评分 75/100
Anthropic与五角大楼控权之争:Claude军事用途护栏分歧Anthropic’s Pentagon fight was less about access to Claude than control over how the military can use frontier AI.New WSJ-reported court documents show months of emails between Anthropic CEO Dario Amodei and Pentagon undersecretary Emil Michael over guardrails for AI-powered weapons and domestic surveillance.Anthropic wanted bans on fully autonomous weapons and certain surveillance uses. The Pentagon pushed for Claude to be available across all lawful national-security use cases.Michael reportedly said he did not want to "force anything unnatural" if the sides were too far apart.The Pentagon later labeled Anthropic a supply-chain risk, effectively blocking partners from using its models in Defense Department work. A judge has paused parts of that move, but the government is appealing.Michael says two-thirds of Pentagon operations using Anthropic have already switched to other AI tools.WSJ法庭文件显示,Anthropic CEO Dario Amodei与五角大楼副部长Emil Michael数月邮件往来,核心分歧在于Claude的军事用途护栏。Anthropic要求禁止全自主武器及某些监控用途,五角大楼则希望Claude可用于所有合法国家安全场景。Michael称若分歧太大不愿"强行推动"。随后五角大楼将Anthropic列为供应链风险,阻止合作伙伴在国防部项目中使用其模型。法官暂停部分措施,政府正在上诉。Michael称原先采用Anthropic的操作中已有三分之二切换至其他AI工具。

推荐理由:这起诉讼暴露了前沿AI公司面对军事化应用的深层挣扎,法庭文件里的邮件往来比最终判决更值得看,直接拷问每一家模型公司的底线该划在哪里。

7月1日7月1日周三

星期三 · 4 条
11:33
Anthropic:Newsroom(网页)精选
AI 评分 71/100
重新部署 Claude Fable 5

美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。


推荐理由:Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。
08:20
公众号:数字生命卡兹克精选
AI 评分 84/100
Anthropic在Claude Code中植入隐写术代码识别中国用户

Anthropic在Claude Code中植入隐写术:读取本地时区(Asia/Shanghai或Asia/Urumqi)和ANTHROPIC_BASE_URL环境变量,与一份经base64+XOR(密钥91)加密的147个域名列表(含美团、字节跳动、月之暗面等)比对,识别中国用户。识别后,在请求发送前将系统提示词中日期字符串的单引号(U+0027)替换为其他Unicode字符,连字符改为斜杠,作为2-3比特分类标记传回服务器。该隐蔽行为被社区逆向发现后引发争议,被认为破坏用户信任。

另有 2 家信源报道The Decoder:AI News(RSS)IT之家(RSS)
推荐理由:Anthropic用隐写术在Claude Code里埋标记的行为,让我对闭源开发者工具的信任打了一个巨大的问号,这事比普通地域封锁严重得多,因为它在不该碰的地方动了手脚。
06:59
AI Notkilleveryoneism Memes ⏸️@AISafetyMemes精选
AI 评分 76/100
AI 用 prover-verifier LLM 循环攻克 9 个未解数学难题AI just solved not one, but *9* unsolved math problems.Once again, instead of this being a global news story, not one journalist on Earth thought this was worth mentioning.AI Safety Memes 推文指出,AI 刚刚解决了 9 个未解决的数学问题,但全球没有记者报道。引用 @WeinsteinOmri 的推文称,采用"prover-verifier"LLM 循环的方法,成功解决了理论计算机科学中 9 个重大开放问题,其中包括一个困扰其长达 2 年的难题。该研究由哥伦比亚大学合作者完成,并计划将这一方法扩展到所有科学领域。

Omri Weinstein: 就连 @OpenAI 最近在 Erdős 问题上的突破,都没能让我相信大语言模型能做通用数学研究。但下面这个成果改变了我的看法…… 通过一个巧妙的"证明者-验证者"大语言模型循环,这套系统成功解决了理论计算机科学领域的 9 个重大未解问题,...


推荐理由:如果属实,这将是 AI 首次批量解决实质性开放数学问题,但消息仅来自推文声明,未见论文或代码,现在兴奋还太早。

6月30日6月30日周二

星期二 · 2 条
19:38
The Decoder:AI News(RSS)精选
AI 评分 70/100
Meta秘密测试ChatGPT等竞品:承包商假扮未成年发送数万条危机提示

Meta通过承包商Covelen发起代号“Cannes”的项目,雇佣数百人假扮未成年人,向ChatGPT、Gemini和Character.AI发送关于自杀、自残、饮食障碍和毒品的敏感提示,并将回复录入表格。2025年8月一轮测试中发送了超过4.5万条提示。Meta称这是行业标准安全测试,未将数据用于训练自家模型。被测试公司不知情——Character.AI表示违反其服务条款,OpenAI已调查,Google称未批准。青少年使用AI聊天机器人引发的担忧持续,此前已有用户自杀事件。


推荐理由:Meta 秘密测试 ChatGPT 等对手,用的是假装未成年人的危机提示,这种事既是安全测试也可能是数据抓取,被测试公司全不知情,这暴露了 AI 安全测试的灰色地带。

6月29日6月29日周一

星期一 · 2 条
20:37
The Decoder:AI News(RSS)精选
AI 评分 75/100
美军用AI选目标却误炸伊朗学校,Anthropic Claude嵌入Palantir系统首日建议约1000目标

美军在打击伊朗时首次大规模使用AI选择目标(Anthropic的Claude模型嵌入Palantir的Maven Smart System,首日建议约1000个目标),但对一所学校的导弹袭击导致约120名儿童死亡。调查发现,情报分析师早在2019年就通过数字工具标记该地点已变为小学,但该工具未连接军方官方目标数据库MIDB,信息从未送达指挥官。MIDB建于1980年代,依赖手动输入,替代系统MARS多年延迟。五角大楼事后宣布推出agentic AI initiative。Project Maven创建人Jack Shanahan批评目标验证不力不可原谅。


推荐理由:AI在战场上的首次大规模实战暴露了最可怕的失败模式,不是模型错误,而是情报系统的数据断裂让一个学校被标注为军事目标,120个孩子成了代价。这对目前在推‘AI决策’的军方和公司都是一个需要直视的案子。
18:07
The Decoder:AI News(RSS)精选
AI 评分 73/100
Claude Code 打开 GitHub 仓库即执行隐藏恶意代码,攻击者可获完全控制

安全研究人员在 Mozilla 的 GenAI 漏洞赏金平台 0DIN 发现新攻击向量。一个看似正常的 GitHub 仓库包含 setup 脚本,该脚本运行时从 DNS 条目拉取命令并执行,恶意代码从未存在于仓库中,对扫描器、代码审查和 AI 智能体不可见。开发者使用 Claude Code 等 AI 编码工具打开该仓库时,Claude Code 在设置过程中遇到常规错误消息后自动运行该脚本,打开反向 shell,攻击者可窃取 API 密钥和登录凭据并维持持久访问。研究人员建议 AI 智能体应在运行前显示 setup 脚本内容,开发者应将第三方仓库的 setup 说明视为不受信任代码。


推荐理由:用 AI 编码工具克隆仓库就能被反向 shell 控制,这个攻击向量比想象中简单。0DIN 的研究把整个链拆得很清楚,每条修复建议开发者现在就能用。