不是, 😭 说的不是 high 比 max 强这个事情, 我自己测也是 high 比 max 强. 而且我上一期给大家测小模型量化版甚至有的 medium 表现更好.
但模型厂商本身拿max刷分然后又反手说max并不适合普适场景, 然后D小将逢人就教育说要开high. 要用linux bash, 要打补丁, 要看到思维链出现xxx才能用. 这种明明是后训练拉了却要包装成最佳实践让人无语.
思考强度高性能就好是模型厂商自己宣传的, 然后max表现不利就跟大家说降一档用也是模型厂商宣传的. 合着怎么都优势在我.
我寻思星巴克也不敢中杯比大杯咖啡多250ml吧? 那罗老师就不是打自己嘴巴子那么简单了.....
但我们 @lobehub 内部bench测的结果也是high比max强….. 而且差的挺多的🤣