给大家带来阶跃 Step-5-Preview 实测!
直接说结论, Step-5-Preview 最大的亮点是输出很稳, 这意味着它的后训练极其扎实. 用来写工程代码很难出现反复仰卧起坐的情况.
本次页给大家带来了全新的Agent 能力测试——硅基交警. 而 Step-5-Preview 在这个测试中全程没有指挥出事故. 非常稳定. 而在后端 Agentic Coding 测试和旧的硅基骑手测试中, 多轮测试得分Δ也非常小. 所以稳是这个模型最直观的感受.
除此之外, 模型还有一个我意想不到的特性, 它 Agent Loop 迭代特别强, 可以卡着极限数值去进行迭代优化. 最好玩的是, 硅基骑手测试中咱们要求了送餐超时如果不超过5分钟就不会扣钱, 结果它直接认为送餐超时就是送餐时间+5分钟, 充分利用了这个规则赚取了更多的积分.
而模型的短板目前也是特别明显的, 最需要提升的方面还是前端, 3D场景, 美学这些方面. 可以看我视频中的实测, 虽然较上一代模型有提升, 但是距离这一代的SOTA模型还是有距离的. 因此想写一些炫酷的3D演示还是很难的.
这种可以 Agent Loop 疯狂打磨细节的模型, 你觉得能用在哪些意想不到的地方呢?欢迎在评论区留下你的脑洞!
#阶跃星辰 #StepFun #Step5Preview #step5 #AgentLoop