OpenAI发布MentalHealthBench,GPT-6 Astra得57.3分、GPT-4o得32.1分
先了解这件事
事实说明OpenAI发布新的心理健康评估基准MentalHealthBench,用于衡量现实心理健康对话,弥补以往评估多集中于紧急情况和宽泛安全标准、对日常与模糊对话测量不足的空白。该基准由OpenAI与来自22个国家、覆盖19种语言和近20个亚专科的80多名持证心理学家和精神科医生共同创建;每段合成对话配有专家定制的评分标准,涵盖寻求背景、保留用户自主性、安全性和适当引导等行为,每个案例至少由3名专家审核,标准仅在2人同意且第3人未反对时保留。GPT-5.6 Sol依据这些人工撰写的标准为模型回答评分,因此评分质量仍部分依赖LLM评判。在该基准上,GPT-6 Astra得分为57.3,GPT-4o得分为32.1。
报道时间线
沿着报道,了解事件的不同侧面。
- OpenAI发布MentalHealthBench,GPT-6 Astra得57.3分、GPT-4o得32.1分
OpenAI发布新的心理健康评估基准MentalHealthBench,用于衡量现实心理健康对话,弥补以往评估多集中于紧急情况和宽泛安全标准、对日常与模糊对话测量不足的空白。该基准由OpenAI与来自22个国家、覆盖19种语言和近20个亚专科的80多名持证心理学家和精神科医生共同创建;每段合成对话配有专家定制的评分标准,涵盖寻求背景、保留用户自主性、安全性和适当引导等行为,每个案例至少由3名专家审核,标准仅在2人同意且第3人未反对时保留。GPT-5.6 Sol依据这些人工撰写的标准为模型回答评分,因此评分质量仍部分依赖LLM评判。在该基准上,GPT-6 Astra得分为57.3,GPT-4o得分为32.1。
- OpenAI发布开源基准MentalHealthBench,用于评估AI在真实心理健康对话中的回应
OpenAI发布开源基准MentalHealthBench,与来自22个国家、超过80名持证心理健康专家共同创建,评估AI在真实心理健康对话中的安全、寻求背景、尊重用户自主权和提供可行指导等行为。基准包含成人、13-17岁青少年、照顾者和临床医生等用户角色,覆盖非急性、高急性和紧急场景,并公开方法供其他研究者运行评估。
本事件热度走势
暂无可比热度趋势,待连续观测积累后展示。