别再去盯那些大模型能不能解千禧年难题的虚假跑分了。 顶级投资人 @ai Iyer 刚刚转出来的这张天梯榜, 把全网所有只会吹概念的科技大厂给狠狠抽了一记耳光。
为什么这个刚刚上线的评测站 assistantbenchmark 会在硅谷瞬间刷屏? 因为作者 David Pawlan 彻底抛弃了学术界那一套无聊的问答测试, 直接把市面上 71 款号称能帮你办事的消费级 AI 助手,拉到了同一个残酷的现实考场里:
大家早就受够了那些问一句回一段漂亮废话的聊天框; 普通人在生活里真正需要的,是一个能替你抗下杂活的数字生活秘书:
1️⃣ 衡量好坏的标准彻底变了,全看能不能把事办完: 不看模型有多大,只看 15 个带血的生活维度打分: 能不能去网页上找酒店并一路走到结账页面? 推荐的餐厅靠不靠谱? 能不能主动帮你梳理医疗账单甚至替你向保险公司发起申诉? 能不能在航班延误好几个小时后,自己去查信用卡和航司条款,替你全家追回上千美元的赔偿? 能不能直接打电话给线下店家确认库存?
2️⃣ 真正的技术壁垒全在克制与分寸感: 很多自作聪明的 AI 最让人崩溃的地方,是乱发邮件、胡乱订票、过度推断; 高段位的助手最值钱的品质叫克制—— 知道什么时候该放手干完,知道什么时候涉及大额转账必须停在人类面前求确认, 更知道在多轮对话后记住你的真实偏好,而不是每次都像失忆一样重来; 3️⃣ 智能体正在迎来真正的物种大爆发: 从 Meta 刚推出的 Muse,到 Instinct、Poke,再到各种垂直的调度工具, 评测站的数据证明了一个极其冷峻的现实: 在聊天框里口若悬河的大模型,放到真实的生活办事场景里,大半都会因为拿不到登录态、处理不好异常而当场趴窝。
大模型的技术狂欢已经走完了第一幕。 以后的胜负手,不再看谁能把百科全书背得更熟, 而是看谁能在你焦头烂额的时候, 安安静静地替你把现实世界里最繁琐的那张账单给平了。
生活苦杂活久矣。 找一个真正能替你扛雷的数字秘书,比天天追最新的大模型参数有用一百倍。