返回
精选AI 评分 79/100

Together AI 实测 DeepSWE:DeepSeek-V4 Flash 0731 对比 GPT-5.6 Luna 的成本与编码表现

Together AI 研究与产品博客(RSS)·2026-08-06 08:00·37天前·Zain Hasan, Shobhit Dixit
AI 导读

Together AI 在 113 个 DeepSWE 任务上对比 DeepSeek-V4 Flash 0731 与 GPT-5.6 Luna:Luna pass@1 为 67.2%,DeepSeek 为 53.3%,但 DeepSeek 每次 rollout 成本约 $0.10,仅为 Luna($0.61)的约六分之一。

Together AI 研究与产品博客(RSS)
精选
79AI 编辑部评分,满分 100

Together AI 实测 DeepSWE:DeepSeek-V4 Flash 0731 对比 GPT-5.6 Luna 的成本与编码表现

2026-08-06 08:00· 37天前· Zain Hasan, Shobhit Dixit
AI 导读

Together AI 在 113 个 DeepSWE 任务上对比 DeepSeek-V4 Flash 0731 与 GPT-5.6 Luna:Luna pass@1 为 67.2%,DeepSeek 为 53.3%,但 DeepSeek 每次 rollout 成本约 $0.10,仅为 Luna($0.61)的约六分之一。

推荐理由

原文基于同一轮 900 次 rollout 实测给出两款模型的成本、失败模式与分域表现,并提出可复用的低成本级联方案。

按该来源的展示范围,站内仅提供摘要。

前往原站阅读(在新标签页打开)

来源:Together AI 研究与产品博客(RSS)· together.ai