热点事件 历史事件

GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗

2 篇报道2 个报道来源

事件全貌

AI 综述

作者在 AI-Code-Review-Evals 组织的 50 个公开基准 PR 上,用相同的仅查 bug 提示词对比了 GPT-5.6 Luna 与 GPT-6 Astra 的代码审查表现。这 50 个 PR 分别来自 Cal.com、Sentry、Discourse、Keycloak 和 Grafana,每个各 10 个,均针对干净基线分支引入缺陷。Luna 在 50 个 PR 中验证出 69 个 bug,Astra 验证出 92 个;Luna 整轮花费 0.20 美元,Astra 花费 5.66 美元。Luna 提出 93 条发现中 24 条未通过验证,Astra 96 条中 4 条未通过,精度分别为 74% 和 96%。

验证方式为:每个 PR 中来自 Astra、Sol、Luna 及公开 Entelligence 审查评论的发现汇入一份匿名列表,由 GPT-6 Astra 与 GPT-5.6 Sol 分别对照 diff 判定,只有两位裁判都认定为真才算验证通过;两者在 91% 的发现上一致,共 143 个不同 bug 通过。作者说明,加入 Luna 的发现改变了裁判所见的池子,因此全部重新判定,Astra 的验证数从上篇的 91 变为 92,Sol 的从 107 变为 108;Astra 同时是两名裁判之一,可能略微有利于它。

按代码库看,在 Sentry、Discourse 和 Grafana,Luna 与 Astra 的验证 bug 数相差不超过两个;Cal.com 差距较大,为 21 比 30;Keycloak 差距最大,Luna 找到 6 个验证 bug,Astra 找到 14 个,Luna 在 Keycloak 的发现仅 50% 成立,Astra 为 93%。按 bug 类别,数据与逻辑类 Luna 39 个对 Astra 47 个,并发类 10 对 13,安全类 Luna 找到 24 个中的 9 个,Astra 找到 19 个。143 个验证 bug 中,44 个由两个模型共同发现,48 个仅 Astra 发现,25 个仅 Luna 发现。

作者列出的限定包括:除 10 个重复 PR 外每个模型对每个 PR 只审查一次,重复运行显示结果会在运行间变动;Astra 既是参赛者又是两名裁判之一,要求 Sol 同意可减少偏差但不能消除;所有 PR 都早于两个模型的训练截止时间,因此读者要求的按日期切分在此无法实现;两个模型只看到 diff,没有仓库历史、调用图或生产数据;验证数是所存在 bug 的下限。作者还称,若在每个 PR 上同时运行两个模型,总共花费 5.86 美元可发现 143 个验证 bug 中的 117 个(82%),即在 Astra 的 5.66 美元之上加 Luna 的 0.20 美元,多发现 25 个验证 bug。

AI 汇总报道生成 · 8天前更新。单篇报道保留其发布时的原貌。

最新进展

历史报道归档。当前热点以新版榜单为准。

报道时间线

沿着报道,了解事件的不同侧面。

显示 2全部报道最新在前
  1. Hacker News 热门(buzzing.cc 中文翻译)
    Entelligence 评测 GPT-5.6 Luna 对比 GPT-6 Astra:单次审查便宜 28 倍的模型能否胜任代码审查

    Entelligence 用 AI-Code-Review-Evals 的 50 个公开 PR 对比 GPT-5.6 Luna 与 GPT-6 Astra 做代码审查。

  2. Hacker News:AI 热帖精选
    GPT-5.6 Luna 对比 GPT-6 Astra:$1.20 的模型做代码评审够用吗

    Entelligence 在 50 个公开基准 PR 上用相同提示词对比 GPT-5.6 Luna 和 GPT-6 Astra 的代码评审能力,Luna 找到 69 个经验证 bug(Astra 92 个),总成本 $0.20 对 $5.66,精度 74% 对 96%。