热点事件 观察中

OpenAI发布MentalHealthBench,GPT-6 Astra得57.3分、GPT-4o得32.1分

2 篇报道2 个报道来源

先了解这件事

事实说明

OpenAI发布新的心理健康评估基准MentalHealthBench,用于衡量现实心理健康对话,弥补以往评估多集中于紧急情况和宽泛安全标准、对日常与模糊对话测量不足的空白。该基准由OpenAI与来自22个国家、覆盖19种语言和近20个亚专科的80多名持证心理学家和精神科医生共同创建;每段合成对话配有专家定制的评分标准,涵盖寻求背景、保留用户自主性、安全性和适当引导等行为,每个案例至少由3名专家审核,标准仅在2人同意且第3人未反对时保留。GPT-5.6 Sol依据这些人工撰写的标准为模型回答评分,因此评分质量仍部分依赖LLM评判。在该基准上,GPT-6 Astra得分为57.3,GPT-4o得分为32.1。

报道时间线

沿着报道,了解事件的不同侧面。

显示 2全部报道最新在前
  1. X:Rohan Paul (@rohanpaul_ai)
    OpenAI发布MentalHealthBench,GPT-6 Astra得57.3分、GPT-4o得32.1分

    OpenAI发布新的心理健康评估基准MentalHealthBench,用于衡量现实心理健康对话,弥补以往评估多集中于紧急情况和宽泛安全标准、对日常与模糊对话测量不足的空白。该基准由OpenAI与来自22个国家、覆盖19种语言和近20个亚专科的80多名持证心理学家和精神科医生共同创建;每段合成对话配有专家定制的评分标准,涵盖寻求背景、保留用户自主性、安全性和适当引导等行为,每个案例至少由3名专家审核,标准仅在2人同意且第3人未反对时保留。GPT-5.6 Sol依据这些人工撰写的标准为模型回答评分,因此评分质量仍部分依赖LLM评判。在该基准上,GPT-6 Astra得分为57.3,GPT-4o得分为32.1。

  2. OpenAI:官网动态官方一手精选
    OpenAI发布开源基准MentalHealthBench,用于评估AI在真实心理健康对话中的回应

    OpenAI发布开源基准MentalHealthBench,与来自22个国家、超过80名持证心理健康专家共同创建,评估AI在真实心理健康对话中的安全、寻求背景、尊重用户自主权和提供可行指导等行为。基准包含成人、13-17岁青少年、照顾者和临床医生等用户角色,覆盖非急性、高急性和紧急场景,并公开方法供其他研究者运行评估。

24 HOURS

本事件热度走势

当前热度 16

暂无可比热度趋势,待连续观测积累后展示。