首届 AI Safety Summit 在 Bletchley Park 召开,各国领导人与头部企业认同先进 AI 风险与测试的重要性
2023 年 11 月 2 日,首届 AI Safety Summit 在 Bletchley Park 举行,英国首相办公室及科学、创新和技术部发布总结。世界领导人与头部公司一致认同先进 AI 风险的重要性以及测试的意义。
推荐理由:主办方官方总结首届峰会成果,读者可从中了解各方对先进 AI 风险与测试重要性达成的共识。
技术方向
AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。
544 条精选近 30 天 54 条共收录 3,386 条
2023 年 11 月 2 日,首届 AI Safety Summit 在 Bletchley Park 举行,英国首相办公室及科学、创新和技术部发布总结。世界领导人与头部公司一致认同先进 AI 风险的重要性以及测试的意义。
推荐理由:主办方官方总结首届峰会成果,读者可从中了解各方对先进 AI 风险与测试重要性达成的共识。
OpenAI 发布 GPT-4V(ision) 系统卡,说明该多模态模型的相关信息。
OpenAI 联合 Future of Humanity Institute、Centre for the Study of Existential Risk。
推荐理由:OpenAI 与多家机构联合发布预测 AI 恶意用途的论文,为理解 AI 安全威胁和防范思路提供了系统性参考。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两个候选行为中哪个更好来推断人类想要什么。该工作旨在免去人工编写目标函数,避免为复杂目标使用简单代理或目标偏差导致不良甚至危险行为,是构建安全 AI 系统的一步。
推荐理由:原文说明该算法通过比较两种行为的优劣来推断人类偏好,从而免去人工编写目标函数,可作为对齐研究的背景参考。