以前想把一个公司内部流程教给 AI,你要么抓破脑袋写几页操作手册,要么求 IT 团队写代码排期。 Grok Bot 这个演示的狠活在于:你直接接管鼠标点一遍,它把你的肌肉动作直接逆向编译成能跑的工作流。
Grok Bot 看人类做一次 PPT 就学会流程的视频,很多人看完直呼 AI 成了精,但如果把那些神化 AI 偷师学艺的词剥掉,它真正解决的根本不是 AI 有多聪明, 而是终于不用逼着人类写三千字提示词,去向一个模型解释那个该死的按钮在屏幕什么位置了。
视频里的场景其实很接地气: 工程师直接接管电脑,在 Google Slides 里手动做一遍动画排版; Grok Bot 在后台记录视觉变化与点击轨迹,做完之后直接封装成一个可调用的专属技能; 下次再碰到类似需求,Bot 顺着这个工作流自己跑。 真正值钱的转变不是 AI 拥有了开悟的灵性,而是人类知识输入的接口彻底变了。 过去想让自动化工具帮你干活,最痛苦的不是执行,而是交代任务: 你要截图、标红框、写长篇大论的提示词去描述界面; 而示教学习相当于给系统装上了三件套: 眼睛是多模态录屏器,扫过界面的每一个元素状态; 脑子是语义提取器,把一次性动作抽象成带参数的标准工序; 手是带容错的自动脚本,下次遇到同类任务照方抓药。 你用最本能的肌肉记忆点一遍,就把深埋在脑子里的隐性流程全交接了。 但如果你以为从此所有岗位都能一键复制,有两个残酷的现实必须讲清: 第一,录制下来的只是顺风局的操作轨迹,一旦目标网页稍微改版、或者跳出一个意料之外的验证弹窗,缺乏异常处理分支的 Bot 会瞬间卡在原地; 第二,它学会的是怎么点,而不是为什么要点,当业务数据发生冲突时,它依然无法做价值取舍。 大模型最大的浪费,就是让懂业务的人天天在提示词里扮演人工编译器; 能把一次手动画面的操作变成长期复用的技能,确实把普通人做自动化的门槛打平了一大截。 但永远别担心自己的工作会被录两下就偷走, 能被轻易复刻的从来只是鼠标指针的位移,那个在关键时刻知道什么时候该打破流程的人,依然是你。 https://x.com/XFreeze/status/2100180165787877454/video/1