热点事件 持续更新
作者对GPT-5.6 Luna与GPT-6 Astra在50个公开PR基准上的代码审查对比测试:Luna找到69个验证bug花费$0.20,Astra找到92个花费$5.66,Luna精度74%对96%,在Keycloak认证权限代码上差距最大,且Astra兼任judge、全部PR早于两模型cutoff等限定
先了解这件事
报道摘要Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
报道时间线
沿着报道,了解事件的不同侧面。
显示 1 篇全部报道,最新在前
- GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗
Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。
24 HOURS
本事件热度走势
当前热度 9峰值 9(9月15日 05:58)近24小时变化 —
移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。