有点燃炸, 这才是 AI 自动化测试最狂暴的打开方式, 建议全屏静音把这几十秒百路并发狂测的演示看完, 去感受一下什么叫真正的工程降维打击。 前 Zapier AI Agent 负责人 Rafal Wilinski 刚晒出的这套对抗测试套件, 直接把整个 QA 圈看傻了。每次代码发布, 直接调动百路无头浏览器并发狂轰滥炸, 死命寻找能搞崩前端系统的边界缺陷, 跑完一整轮的成本竟然只有几美分。 很多团队以前尝试用大模型写端到端测试, 基本上全踩进了同一个坑: 鼠标点一下要等大模型在云端思考 3 到 5 秒, 跑完几十个用例烧掉几十刀不说, 还动不动遇到 JSON 格式崩溃或者把测试跑死在半路上。 真正让我觉得有意思的是, Rafal 根本没有用传统聊天模型, 他接入了专门输出强类型决策的 Jev。 最核心的质变是把文本生成降级为状态单选。以前的大模型在努力写小作文, 这里的模型只接收页面当前状态和一组预设动作, 在 100 毫秒内直接单选出破坏力最高的操作, 没有废话, 也不存在格式幻觉, 话音没落动作已经执行完毕。 这一步直接打通了成本的死穴。由于底层模型只对输入计费, 官方定价每百万 Token 仅 0.042 美元, 输出完全不花钱, 这意味着测试套件可以肆无忌惮地进行多路并发探索, 哪怕分出上百条执行链路去尝试畸形输入, 边际成本也几乎等于零。 更耐人寻味的是测试逻辑的倒置。以前写自动化脚本, 是人在已知用例里小心翼翼求证系统正常; 现在的对抗测试, 是放出一群不知疲倦的数字破坏狂, 在每个边界点上疯狂试探你的前端极限。 以前是人写死脚本去验证预期, 从今天起是 AI 扮演黑客在并发世界里暴力寻找意外。 这套打法不仅能测 Web 端, 几乎所有带状态机的交互都能被重写一遍。 如果把这种对抗测试挂进你们的发布流水线, 你最想让它去轰炸哪个页面? 我先说, 购物车结账和第三方授权回调, 以前人工测到吐的地方最该交给它。 完整的三层架构链路和接入逻辑, 我整理好沉在一楼了。 https://x.com/rafalwilinski/status/2100882207879434359/video/1
Rafal 用 Jev 打造百路并发对抗测试套件
AI 导读
前 Zapier AI Agent 负责人 Rafal Wilinski 基于 typesafeai 的 Jev 构建了一套大规模并行浏览器对抗测试套件,每次发布可调动百路无头浏览器并发寻找前端边界缺陷,单轮成本仅几美分。
44
AI 编辑部评分,满分 100Rafal 用 Jev 打造百路并发对抗测试套件
前 Zapier AI Agent 负责人 Rafal Wilinski 基于 typesafeai 的 Jev 构建了一套大规模并行浏览器对抗测试套件,每次发布可调动百路无头浏览器并发寻找前端边界缺陷,单轮成本仅几美分。
thanks to @typesafeai's Jev we now have massively parallel browser-based adversarial testing suite that tries to break each release. and it costs pennies.
来源:AYi· x.com