# Grok Bot 演示示教学习：点一遍鼠标生成工作流

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-17 00:52
- AIHOT 分数：48
- AIHOT 链接：https://aihot.news/items/cmu4cvs1c0ipiro4w3plxxv03
- 原文链接：https://x.com/AYi_AInotes/status/2100266510010741131

## AI 摘要

Grok Bot 演示了示教学习能力：工程师在 Google Slides 里手动做一遍动画排版，Bot 在后台记录视觉变化与点击轨迹，完成后封装成可调用的专属技能，下次同类任务自动执行。该方式把人类知识输入从写提示词、截图标注变成直接操作一遍，但录制的只是顺风局轨迹，页面改版或异常弹窗会让缺乏异常分支的 Bot 卡住，它学会的是怎么点而非为什么点。

## 正文

以前想把一个公司内部流程教给 AI，你要么抓破脑袋写几页操作手册，要么求 IT 团队写代码排期。
 Grok Bot 这个演示的狠活在于：你直接接管鼠标点一遍，它把你的肌肉动作直接逆向编译成能跑的工作流。

Grok Bot 看人类做一次 PPT 就学会流程的视频，很多人看完直呼 AI 成了精，但如果把那些神化 AI 偷师学艺的词剥掉，它真正解决的根本不是 AI 有多聪明， 而是终于不用逼着人类写三千字提示词，去向一个模型解释那个该死的按钮在屏幕什么位置了。

视频里的场景其实很接地气： 工程师直接接管电脑，在 Google Slides 里手动做一遍动画排版； Grok Bot 在后台记录视觉变化与点击轨迹，做完之后直接封装成一个可调用的专属技能；
 下次再碰到类似需求，Bot 顺着这个工作流自己跑。
真正值钱的转变不是 AI 拥有了开悟的灵性，而是人类知识输入的接口彻底变了。 过去想让自动化工具帮你干活，最痛苦的不是执行，而是交代任务： 你要截图、标红框、写长篇大论的提示词去描述界面； 而示教学习相当于给系统装上了三件套： 眼睛是多模态录屏器，扫过界面的每一个元素状态； 脑子是语义提取器，把一次性动作抽象成带参数的标准工序； 手是带容错的自动脚本，下次遇到同类任务照方抓药。 你用最本能的肌肉记忆点一遍，就把深埋在脑子里的隐性流程全交接了。
但如果你以为从此所有岗位都能一键复制，有两个残酷的现实必须讲清：
 第一，录制下来的只是顺风局的操作轨迹，一旦目标网页稍微改版、或者跳出一个意料之外的验证弹窗，缺乏异常处理分支的 Bot 会瞬间卡在原地； 第二，它学会的是怎么点，而不是为什么要点，当业务数据发生冲突时，它依然无法做价值取舍。
大模型最大的浪费，就是让懂业务的人天天在提示词里扮演人工编译器； 能把一次手动画面的操作变成长期复用的技能，确实把普通人做自动化的门槛打平了一大截。 但永远别担心自己的工作会被录两下就偷走， 能被轻易复刻的从来只是鼠标指针的位移，那个在关键时刻知道什么时候该打破流程的人，依然是你。 https://x.com/XFreeze/status/2100180165787877454/video/1
