本文由 辛梓煜@词元2号站(www.ciyuanerhao.com)撰写,转载请注明出处。
快速摘要:这篇文章讲的是"录制式 AI 自动化"——你当着 AI 的面把一套操作做一遍,AI 把屏幕画面、鼠标键盘轨迹、每一步背后的意图一起学走,打包成一个可复用的"技能",下次你说一句话,它就能自己把整套流程跑完。核心结论有三条:第一,它解决的痛点是"说不清楚"——像订票、录单据、整理群聊接龙这种事,用嘴交代给 AI 永远交代不明白,但演示一遍它就能学会;第二,录制有讲究,先登录好目标网站再录、动作要直白、别中途切应用、全程别超过 30 分钟、务必给 AI 设定"该停就停"的边界,防止它自作主张付款或发布;第三,这类能力不是某一家独有,2026 年国内已经有 Coze 工作流、影刀 RPA、UI-TARS、OpenClaw、钉钉/飞书智能体等一系列可落地的替代工具,方法论完全通用。文中我会用订票、发票记账、群聊接龙归档三个完整案例,带你从录制走到复现,再附上录制规范、踩坑清单和国内工具矩阵。想看完整拆解,往下翻。
我自己是那种很怕重复劳动的人。新员工入职培训的录像带、ERP 系统里密密麻麻的录入步骤、群聊里一长串"加一"的接龙……这些东西消耗掉的不是时间,是耐心。所以这两年我一直在折腾一件事:怎么让 AI 替我干这些活。折腾到今天,我最满意的答案是"录一遍给它看"。
这篇文章就把我踩过的坑、试出来的流程、以及 2026 年国内能用的替代方案,一次性讲清楚。
第一章 为什么我决定把重复操作"教"给 AI:先说说痛点
先说个我自己的场景。前阵子帮朋友公司梳理新人培训流程,他们给每个新员工准备了一套"入职大礼包":管理部录好的教学影片,一部比一部冗长;还有一堆教你怎么往 CRM、ERP 系统里手工录入数据的"懒人包",全是文字版的 SOP,密密麻麻,看到第二页就想合上电脑。
你有没有类似的经历?换部门、换公司,第一周基本都在跟这些教程搏斗。真正干活的时候,你手边还得开着另一个窗口,一边看教程一边点系统,生怕哪一步漏了。可等到你自己熟练了,回头一看,这套流程其实就是固定的几步:点哪里、填什么、按哪个键、等什么反应。它一点都不难,就是繁琐。
繁琐的东西,恰恰是最该交给 AI 的。问题在于,怎么交?
用嘴说不清楚的事,演示一遍就行
我最早的想法很简单:跟 AI 说清楚流程,让它照着做。试了几次就发现此路不通。就拿订一张火车票来说,你试着跟 AI 描述一遍:"你先打开订票网站,选出发地,选到达地,选日期,查时刻,然后挑一个车次,点预订,再填乘车人信息,最后提交订单……"
听起来挺清楚对吧?真让 AI 照着做,它会在无数个细节上卡壳:那个"出发地"输入框是不是要等联想列表弹出来再点?日期控件是日历还是下拉框?有没有登录态?验证码要不要过?这些你没交代到的细节,AI 全都要靠猜。猜错了,整个流程就崩了。
后来我换了个思路——**我不描述了,我做给你看。**就像带新人一样,你手把手把流程走一遍,新人在旁边看着,看完就会了。AI 其实也是这个道理:它不需要你解释"为什么要这么做",它只需要看见"你是怎么做的"。
这就是"录制式教学":你当着 AI 的面把整套操作完整做一遍,AI 通过屏幕画面、鼠标轨迹、键盘输入,以及你同步说的话,把这段操作背后的逻辑学走,存成一个"技能"。以后你只要说一句"帮我订票",它就把这套流程自己跑一遍。
哪些活适合这么教?我总结了几类
我这两年陆陆续续录了不少流程,适合录制的活儿基本长这样:
- 固定路径的网页操作:订票、挂号、预约、报名、缴费,页面是固定的,步骤是固定的,纯机械重复。
- 信息搬运:把邮件里的数据抄到表格里、把聊天记录里的订单整理成台账、把发票信息录入报销系统。
- 多系统之间的"摆渡":从 A 系统查数据,填到 B 系统的表单里,再回 A 系统标记"已完成"。这种跨系统操作人做起来最烦,也最容易出错。
- 定期巡检:每天上班先登录后台看一遍数据、截图、发到群里,这种"每天同一时间做同一件事"的活儿,最适合做成技能。
反过来,哪些不适合?需要临场判断的、涉及大额资金或法律效力的、要跟真人讨价还价的,先别急着交给 AI。这个边界问题我后面专门用一章来讲,它是整个实践里最容易翻车的地方。
一句话总结这一章
不是所有活儿都值得录,但凡是"你会做、天天做、闭着眼都能做"的操作,都值得考虑录一份交给 AI。你省下来的不是一次操作的时间,而是把"每次都重新做一遍"变成了"录一次,用无数次"。我自己的体会是:**录制的本质,是把你脑子里的隐性流程,变成 AI 能反复调用的显性资产。**至于这个"技能"到底是怎么录进去、怎么跑起来的,下一章拆给你看。
第二章 Record & Replay 是什么:把原理拆开给你看
先交代一下这个词的出处。OpenAI 在 2025 年下半年到 2026 年初,陆续给桌面端产品加了一套叫 Record & Replay(录制与回放) 的能力:你打开桌面应用,切到 Work 工作模式,在插件面板里点 "+",选 Record a skill(录制一个技能),AI 会先跟你确认"接下来我要录你的屏幕操作,可以吗",你同意之后,把自己要演示的流程在电脑上完整做一遍,点停止,AI 就开始回看这段操作,提取规律,最后生成一个"技能包"存在你的账号里。下次你直接说"用某某技能做某某事",它就在浏览器里自己动起来。
这套能力公开之后,海外开发者圈讨论得很热闹,我也跟着研究了一阵。不过今天这篇文章不打算只讲某一家产品——"录一遍就学会"这件事,本质是一套方法论,不是某个按钮。2026 年国内已经有不少工具能用同样的思路落地,第九章我会给你一张完整的工具对照表。这一章先把原理讲透,原理通了,换什么工具你都能举一反三。
三个你必须先搞懂的概念
在往下看之前,先花两分钟把三个词说人话:
- 多模态:AI 不再只看文字,还能"看"屏幕截图、"听"你的语音。录制功能靠的就是这个——它看着你的屏幕一步步操作,同时听着你嘴里念叨"这里要选出发地"。
- Computer Use(电脑操作能力):让 AI 像人一样操作电脑的能力——移动鼠标、点击、输入文字、滚动页面、截图确认。以前 AI 只能"说",有了这个能力它才能"动手"。
- 技能包(Skill):一次录制产出的最终产物,相当于一份"操作说明书 + 执行程序"的合体,里面既有对流程的文字描述,也有可执行的步骤逻辑,能被反复调用。
这三个概念合起来,就是录制式自动化的全部秘密:多模态负责"看会",Computer Use 负责"动手",技能包负责"记住"。
一次录制的完整生命周期
我自己把整个流程拆成了四个阶段,画成图长这样:
flowchart TD
A[录制阶段<br/>你演示一遍操作] --> B[理解阶段<br/>AI 回看屏幕与键鼠轨迹<br/>结合语音与上下文推理]
B --> C[打包阶段<br/>生成技能包<br/>存入账号]
C --> D[复现阶段<br/>你说一句话<br/>AI 在浏览器里执行]
D --> E{执行中遇到异常}
E -->|资料缺失/界面不同/结果存疑| F[停下来向你确认]
E -->|一切正常| G[完成并汇报结果]
F --> D
录制阶段,AI 干的事情有点像"屏幕录像 + 操作日志"。它记下你每一步的点击坐标、输入内容、页面变化,同时录下你同步说的话——这很重要,因为光看操作猜不出意图,但你嘴里那句"现在选 8 点出发的车次"就是最好的注释。
理解阶段是最见功力的一环。录完并不是简单回放,AI 会像一个刚看完师傅示范的学徒,自己琢磨:哪几步是固定套路,哪几步是这次特有的输入(比如这次订的日期、这次的金额),哪些页面元素是可变的(日期、车次、价格),哪些是固定按钮(查询、下一步、确认)。它要把"可变参数"和"固定动作"区分开,否则录出来的技能换个日期就不会用了。
打包阶段,AI 把理解结果整理成一份结构化的技能描述:流程的步骤、每一步的操作方式、需要输入的参数、异常时的处理策略。这份东西存在你的账号里,下次随时能调。
复现阶段,就是你发号施令的时刻了。AI 会打开浏览器,一步步执行技能里的步骤,每做一步截个图确认效果,遇到登录态失效、验证码弹出、页面改版这类情况,它会停下来问你要怎么办,而不是硬着头皮往下点。
它和 RPA 到底有啥区别
很多人一听"AI 自动操作电脑"就说:这不就是 RPA(机器人流程自动化)吗?我在录第一个技能之前也是这么想的,用下来发现差别挺大,给你列个对比表:
|
对比维度 |
传统 RPA |
录制式 AI 自动化 |
|
学习方式 |
需要人工拖拽组件、配置流程 |
看你演示一遍,自动生成技能 |
|
对页面变化的适应 |
界面一改就失效,要重新配置 |
基于语义理解,页面微调一般能扛住 |
|
异常处理 |
写死规则,遇到没预设的情况直接报错 |
能识别异常,停下来问你怎么办 |
|
处理非结构化信息 |
弱,主要靠固定规则抓取 |
强,发票照片、聊天截图都能看懂 |
|
上手门槛 |
需要专门学一阵工具 |
会操作电脑就会录制 |
|
稳定性 |
高,流程固定时很可靠 |
依赖模型能力,复杂流程需要验证 |
说白了,RPA 是"照着写好的剧本演",录制式 AI 是"看一遍就会自己加戏"。前者胜在稳定,后者胜在灵活和低门槛。我自己的用法是:高价值、高频、绝对不能错的流程,两者结合着来;低价值、高频、错了也无伤大雅的流程,直接交给录制式 AI 就行。
原理讲到这儿,你脑子里应该有个大致的图景了。下一章,我们开始动手——先做录制前的准备,把环境、权限这些容易翻车的细节一次搞定。
第三章 动手前的准备:环境、权限与录制规范
有句老话说"磨刀不误砍柴工",录制这套东西尤其如此。我自己第一次录的时候,因为没做准备,录到一半被一个弹窗打断,整段作废重来,气得够呛。所以这一章我把录制前的准备工作给你列全,照着做能省一大半的返工。
先搭好环境
录制式自动化对运行环境有基本要求,主要看四样东西:
|
准备项 |
具体要求 |
为什么重要 |
|
桌面应用 |
安装桌面版应用,并确保登录状态 |
录制与执行都依赖桌面端权限 |
|
工作模式 |
在模式切换器里切到 Work(工作)模式 |
录制技能入口只在工作模式里出现 |
|
浏览器与插件 |
用 Chrome 系浏览器,并装好官方扩展插件 |
AI 要靠插件才能在浏览器里"动手" |
|
账号权限 |
账号要有使用插件/技能功能的权限 |
部分功能对账号套餐有要求 |
这里多说一句浏览器插件:它相当于是 AI 伸进你浏览器里的一只手。没有它,AI 只能看不能点;装上并授权之后,它才能替你在网页里执行点击、输入、翻页这些动作。第一次使用时,浏览器会弹出授权确认,记得点允许,别手滑拒绝——我见过有人在这卡了半小时。
录制前必做的四件小事
环境搭好后,先别急着按录制键。我每次录制前都会过一遍下面的清单:
- 先把目标网站登录好。你要演示的网站,提前登录好账号、保持在已登录状态,再开始录。原因很简单:录制的画面里会包含登录过程,如果不小心录到了账号密码的输入画面,这些信息会跟着技能一起被存下来,有泄露风险。提前登录好,录制画面里就没有这些敏感内容了。
- 清空无关干扰。关掉别的浏览器标签页、关掉消息通知、把桌面收拾干净。录制期间弹出来的任何东西——微信消息、邮件提醒、系统更新——都可能被 AI 当成流程的一部分学走。别笑,真有人的技能里莫名其妙多了"关掉弹窗"这一步。
- 想好要说的话。录制时你不是哑巴,一边操作一边说"这一步是选出发地""这里填日期"之类的话,AI 会把这些语音当注释,帮助它理解意图。但注意别说跟流程无关的闲话,AI 分不清哪些是指导、哪些是闲聊。
- 看一眼时长预算。官方建议单次录制控制在 30 分钟以内。超过这个时间,AI 的模仿和学习效果会明显下降。如果你的流程特别长,把它拆成几个小技能,比录一个"超长待机"的技能靠谱得多。
录制过程中的三条纪律
准备就绪,开始录了,这时候要守住三条纪律,我每条都踩过坑:
- **动作要直白,一步是一步。**录制的目的是让 AI 看清你的操作路径,不是看你炫技。正常速度、正常点击,别用快捷键跳步骤,别同时开好几个窗口来回切。你平时可能习惯用 Ctrl+C、Ctrl+V 复制粘贴,但录制时最好老实点用鼠标右键菜单,让每个动作都在画面里留下痕迹。
- **中途别去干别的。**录到一半突然想起来回个消息、查个资料、点开个别的软件——哪怕只有几秒钟,AI 也会把这几个动作学进去。录制的每一秒都在"教学",你离开的那几秒,教给它的就是"中途可以切走"。
- **一次只教一件事。**别贪心,一个技能对应一个完整流程。比如"订票"就只录到订单提交成功为止,别顺手把"顺便把票发到群里"也录进去。技能越小越聚焦,后面越好用、越好改。
一个容易被忽略的点:先想好异常怎么办
录制时一切顺利,不代表复现时也顺利。页面改版了怎么办?验证码弹出来了怎么办?登录过期了怎么办?这些异常在录制时就要想好预案,最好的做法是直接写进技能的要求里,让 AI 遇到异常就停下问你,而不是自作主张。具体怎么写,第五章我会给你一份可以直接抄的提示词模板。
准备做得越细,后面复现越省心。这一章讲的是"怎么录得干净",下一章我们真正录一遍——拿订票这个最经典的场景,从按下录制键到 AI 独立完成订票,全程走给你看。
第四章 第一次完整录制:以高铁订票为例
理论讲得再多,不如完整走一遍。这一章我们做一个最经典的演示——订高铁票。这个场景我选它有三个理由:一是几乎人人都会遇到,代入感强;二是流程足够长,能展示录制式自动化的完整能力;三是它涉及"提交订单"这种略带风险的步骤,正好能演示怎么设边界。
先声明一下:下面的演示,我在录制时做到"订单提交成功"就停了,没有进入付款环节。付款这种动钱的步骤,我的原则是永远让 AI 停在门口、由人来做最后一步。这个原则也写进了技能的要求里。
第一步:录制
流程是这样的:打开桌面应用 → 切到 Work 模式 → 点 "+" → 选 Record a skill → 同意录制权限 → 开始演示。
演示的操作序列如下(伪代码,方便你对照):
1. 打开高铁订票网站,确认已登录
2. 进入车票查询页
3. 输入出发地:A 市
4. 输入到达地:B 市
5. 选择出发日期:本周六
6. 点击"查询车票"
7. 等待时刻表加载,读出第一屏车次
8. 选择上午 9 点 21 分发车的车次
9. 点击"预订"
10. 确认乘车人信息(默认选择本人)
11. 点击"提交订单"
12. 等待订单生成,截图确认订单号
13. 停止录制
录制过程中我同步说的注释大概是:"现在选出发地""选这个 9 点 21 分的车次""提交订单到这里就可以了,不用付款"。这些语音会被当成意图注释,让 AI 明白哪几步是固定动作、哪几步是这次才有的输入。
点停止之后,AI 会开始"复盘":它把屏幕录像、操作轨迹、语音注释放在一起看,区分出"固定动作"和"可变参数"。几分钟后,它会给出一个技能描述,大意是"这个技能可以做车次查询和订票:输入出发地、到达地、日期,查询车次后按你选择的班次下单,生成订单后停止,不进入付款"。确认无误,技能就存进你的账号了。
第二步:验证技能
技能录好不等于能用,一定要当场验证一遍。我的做法是换一组参数重新跑一次——比如这次订下周三下午从 C 市到 D 市的票,跟录制时完全不同的日期和站点。
这时候你会看到 AI 在浏览器里"自己动":光标自己在输入框里打字、自己点查询、自己滚动页面。它每做一步都会截图自检,确认页面状态跟预期一致才继续。这个过程很值得盯着看——你会直观地看到它哪些步骤学对了、哪些地方犹豫了。
第一次验证通常不会一次通过,常见的状况是:日期控件点开了没选上、乘车人默认勾选被取消、页面弹了验证码。遇到这些,你的处理方式有两种:小问题直接在对话里纠正它("日期选错了,重新选""遇到验证码就停下告诉我"),大问题就重录一遍。迭代两三次,技能就稳定了。
第三步:让它按你的偏好干活
技能稳定之后,还有个进阶操作:教它"符合你习惯"地干活。比如我录完订票技能,就跟 AI 说:"以后用这个技能订票,不用每一步都问我。你直接查好车次,把候选列出来让我挑,我确定车次之后,剩下的乘车人、提交订单你全办完,最后告诉我订单号和预计金额就行。遇到付款环节,停下等我。"AI 会把这个偏好更新进技能包,之后每次执行都按这个风格来。
这样一轮下来,一个完整的订票技能就真正属于你了。我把录制和复现两个阶段的差异整理成一张表,帮你理解整个过程:
|
阶段 |
谁在操作 |
发生了什么 |
你的角色 |
|
录制 |
你 |
完整演示一遍流程,边做边解释 |
老师 |
|
复盘打包 |
AI |
分析录像与轨迹,生成技能描述 |
审核 |
|
首次验证 |
AI |
换参数试跑,暴露学错的地方 |
纠错 |
|
日常使用 |
AI |
你说一句话,它全流程执行 |
发号施令 + 最终确认 |
|
异常时刻 |
AI + 你 |
AI 停下提问,你给出决策 |
决策者 |
订票案例给我的三点体会
走完这一遍,我有三个很深的感受,也分享给你:
- **"做一遍"比"说一万句"有效。**这个案例里,我没有给 AI 写过任何一行流程代码,全程就是做给它看。它学到的不是死板的步骤,而是"订票这件事该怎么做"的理解。
- **参数化是自动化的灵魂。**AI 能区分"固定动作"和"可变参数",这个技能才算真的学会了。如果录出来的技能换个日期就不会用,那跟录屏回放没区别。
- **边界要提前写进技能。**我在录制时就说了"不用付款",AI 就把"停在付款前"当成了流程的一部分。你在录的时候想清楚哪些步骤绝对不能让它碰,一开始就讲明白,比事后补救强十倍。
订票这种"查信息 + 填表单"的流程,是录制式 AI 最擅长的类型。下一章我们专门讲讲怎么给技能立规矩——也就是我反复提到的"边界设定",这是整个实践里最重要、也最容易被忽略的一环。
第五章 让技能"听话":边界设定与指令微调
我录完第一个技能的时候特别兴奋,逢人就展示"你看,AI 会自己订票了"。结果有一次演示翻车了:我让 AI 查票,它查到一半,页面弹了个登录确认,它居然自作主张点了个"记住本次登录",然后继续往下跑。虽然没造成什么损失,但那一刻我意识到一个严重的问题——AI 执行起来比我想象的"莽"得多,如果不提前立规矩,它什么都敢点。
从那以后,我给每个技能都配了一份"行为守则"。这一章把我现在用的模板和思路完整给你。
为什么必须给 AI 设边界
道理其实很朴素。AI 在执行技能的时候,追求的是"把任务完成",它没有人类那种"这个操作有风险,我要谨慎"的本能。在你看来"这一步不该点",在它看来只是"流程里的下一步"。所以边界必须由你预先写清楚,而不是指望它自己领悟。
最典型的三个危险动作,我建议一律禁止 AI 擅自执行:
- 付款:任何涉及真实资金的操作,AI 只允许走到"生成订单/确认金额"这一步,付款必须由你手动完成。
- 发布与删除:往任何公开平台发内容、删任何数据,AI 必须停下来等你确认。
- 提交涉及个人信息的内容:比如填身份证号、手机号、地址这类敏感信息,提交前要让你核对一遍。
这三个动作不是绝对禁止 AI 做,而是禁止它"擅自"做。它可以把流程走到门口,然后停下来报告:"订单已生成,金额 553 元,确认付款吗?"——你点确认,它再继续。这样一个"人机确认点",就把风险卡住了。
一份可以直接抄的边界模板
下面是我现在录完技能之后,固定会发给 AI 的一段话。你直接复制过去,把方括号里的内容换成自己的就行:
请把以下规则更新到本技能的行为守则中:
1. 执行过程中,如果发现页面与录制时不一致、缺少必要信息、
或操作结果无法确认,立即停止执行,向我描述当前情况,
等我给出指示后再继续,不得自行猜测或跳过。
2. 涉及付款、发布、删除、发送消息、提交个人信息等敏感操作时,
一律停在最后一步之前,向我报告将要执行的内容和后果,
等我确认后才可继续。
3. 每次执行结束时,向我汇报:完成了哪些步骤、关键结果是什么、
是否有异常情况、是否需要我处理。
4. [可选] 我的个人偏好:例如"订票时直接帮我选最早一班"
"整理表格时金额保留两位小数"等,按你的实际情况填写。
这段模板我用了很久,改过几个版本,核心就是三件事:**遇异常就停、碰敏感就停、做完要汇报。**第三条很多人会忽略,其实特别重要——AI 干完活闷声不响,你根本不知道它干得对不对,强制它汇报,等于多了一道质检。
微调:让技能从"能用"变成"好用"
边界定完,技能就算立住了,接下来是让它更好用。微调的思路就一句话:把你平时做这件事时的口头禅、小习惯、判断标准,都变成给 AI 的指令。
举个例子。订票这个技能,最初版是"每步都问",AI 查到车次会问"要订这班吗",查到票价又问"确定吗",烦得我头疼。我后来加了一句:"以后订票,你直接按我常用的偏好来:优先选时间合适、票价适中的车次,把候选列表给我,我确认后你全流程办完,不用每一步都问我。只有遇到付款、改签这类情况才需要等我。"加了这句之后,整个体验完全不一样了。
再比如记账这个场景(下一章会细讲),我加的是"金额统一保留两位小数,备注里写清楚来源和日期"。这些小规则单个看不起眼,积累起来,技能就从"一个会干活的 AI"变成了"一个懂你的 AI"。
边界设定里最容易犯的三个错
最后把我踩过的坑总结一下,你绕开走:
- **边界设晚了。**别等技能已经跑起来才发现"咦它怎么把订单提交了",边界要在录制完成后的第一时间就写进去,最好是录制时就说清楚。
- 边界太笼统。"注意安全""谨慎一点"这种话对 AI 等于没说。要具体到动作:哪些操作必须停、停了之后要报告什么、等谁确认。
- **改了不验证。**更新了行为守则之后,一定要重新跑一遍流程,确认 AI 真的按新规矩执行。我上次更新完忘了验证,结果它还是照旧每步都问,白改了。
这一章讲的是"给 AI 立规矩",下一章我们进入第二个完整案例——发票拍照自动记账。这个案例跟前一个完全不同:它处理的不再是网页表单,而是图片里的非结构化信息,正好能展示录制式 AI 的另一项硬本事。
第六章 案例二:发票与单据拍照自动记账
订票案例讲的是"网页表单自动化",属于录制式 AI 的基础款。这一章的案例升级一下难度:**不碰网页,处理图片里的信息。**场景是记账——很多人的痛点是,攒了一抽屉的发票、车票、小票,一直懒得录进表格,月底对账的时候想死的心都有。
我以前也这样。后来我录了一个技能,彻底解决了这个问题。现在的流程是:发票随手拍张照,丢给 AI,它自己把信息识别出来、核对一遍、写进表格,我再扫一眼确认就完事。下面把整个录制过程拆给你看。
录制前的准备
这个案例的录制,跟订票案例有一个关键区别:它要处理的不是固定网页,而是一张随时变化的表格。所以录制前,我先做了一件事——把表格模板搭好。我用的是一款国产在线表格(飞书多维表格、腾讯文档、WPS 都可以),先建好一张"记账表",列头是固定的:日期、类型、项目、金额、备注。
表格模板长这样:
|
日期 |
类型 |
项目 |
金额(元) |
备注 |
|
2026-01-12 |
交通 |
高铁票 |
553.00 |
A 市—B 市 |
|
2026-01-15 |
餐饮 |
客户午餐 |
286.00 |
与客户对接 |
|
2026-01-18 |
办公 |
打印耗材 |
89.50 |
京东下单 |
模板搭好后,就可以开始录了。录制时我给 AI 演示的是"完整的记账动作":
1. 打开记账表格,定位到最后一行
2. 把一张发票照片的信息,逐项填入对应列
3. 填完核对一遍:日期、类型、项目、金额、备注
4. 确认无误后,保存并关闭
注意第三步——核对。这一步特别重要,我在录制时专门演示了"填完要回头看一遍"这个动作,AI 会把"核对"学成流程的一部分。很多初版技能漏掉核对,数据录错了都不知道,直到月底对账才发现。
第一次实战:单张发票
技能录好后,真正的考验来了。我发了一张高铁票的照片给它,说了句:"这张票帮我记到账上。"接下来发生的事情,我盯着看了半天:
- AI 先放大图片,核对日期——它自己会先看票面日期是不是录制时约定的格式;
- 然后它打开在线表格,确认现有栏位,把数据填到正确的位置——注意,它是先"看表格结构"再"填数据",不是闭着眼睛乱填;
- 填完之后,它把填好的那一行截图给我看,说"已新增一行:2026-01-12,交通,高铁票,553.00 元,A 市—B 市,请确认"。
这一套下来,从发图到完成,大概两分钟。我扫一眼,确认无误,完事。以前这事我得开电脑、开表格、对着票面一个字一个字敲,少说五分钟,还容易敲错。
这里有个细节值得说一下:AI 识别的是"图片里的字",但表格里要填的是"标准化的字段",这两者之间是有映射关系的。我在录制时给 AI 看过"票面信息 → 表格字段"的对应关系,它学完之后就能自己完成映射。你录的时候,也一定要在演示里把这个映射关系做出来,比如一边念"这个 553 就是金额,填到金额这一列",一边把数字填进表格。
字段映射大致是这个意思:
|
票面/单据上的信息 |
表格里的字段 |
说明 |
|
乘车日期 / 开票日期 |
日期 |
统一格式为 YYYY-MM-DD |
|
交通 / 餐饮 / 办公 / 其他 |
类型 |
按约定分类 |
|
车次名 / 消费内容 |
项目 |
简短描述即可 |
|
票价 / 金额 |
金额 |
保留两位小数 |
|
起终点 / 消费场所 |
备注 |
补充说明 |
升级:批量处理多张单据
单张跑通之后,我马上试了个更狠的:一次丢给它三张票,高铁票、出租车票、餐饮发票混在一起。它先逐张放大识别,然后分别归类,检查有没有重复录入,最后一次性新增三行,还自动按日期排好了序。
这个"检查重复"的能力让我印象很深——我原本只录了"逐张识别、逐行填入",它自己推理出了"先判断这批单据有没有重复,再写入"的步骤。这说明录制式 AI 不是死记硬背,它是真的理解了"记账"这个任务的目标,然后在技能框架内自己优化执行方式。
批量处理时需要注意的一点:**一次别丢太多。**我试过一次性丢十张,识别正确率明显下降,个别金额看错了。稳妥的做法是三五张一批,批与批之间让 AI 汇报一次识别结果,你抽查核对。数据这东西,宁可慢一点,不能错一点。
这个案例教会我的三件事
- **模板先行,录制才稳。**表格列头定好了,AI 才知道往哪填。模板混乱,录出来的技能也是乱的。
- **把"核对"录进流程。**录制时演示核对动作,技能就自带质检环节,这是防错成本最低的方式。
- **AI 会自己"加戏",这是好事也是风险。**它自己推导出"查重"这种额外步骤是惊喜,但也可能推导出你不想要的步骤,所以每次执行完的汇报一定要看。
发票记账这个技能,我用了大半年,成了我桌面上的常驻技能。下一章是第三个案例,也是被问得最多的一个——群聊接龙订单怎么自动归档。
第七章 案例三:群聊接龙/团购订单自动归档
前两个案例分别是"网页操作"和"图片识别",第三个案例换个完全不同的场景:群聊消息整理。这个案例是被问得最多的,因为几乎每个当过群主、带过团、收过款的人都经历过那种崩溃——群里几十条"加一",你一条条爬楼、一条条对名字、一条条往表格里抄,抄错一个,对账的时候就是一笔糊涂账。
我自己在一个几十人的社群里组织过几次办公用品的团购,产品不复杂(显示器支架、无线演示器、键盘之类),但收单流程极其折磨人。直到我录了个"接单归档"技能,才把这摊事从"每晚爬楼两小时"变成"发个消息就完事"。
先看看原来的流程有多痛
典型的接单流程是这样的:
1. 群主发布团购通知:产品图 + 价格 + 截止时间
2. 群友陆续回复:"加一""我要一个""2 个,谢谢"
3. 群主爬楼,逐条记录:谁、几点、要什么、数量、金额
4. 截止后,汇总成表格,挨个核对
5. 对账、收款、下单
第 3 步和第 4 步是纯手工活,枯燥、费眼、容易漏。尤其当群消息里还夹杂着闲聊的时候,你得像淘金一样把订单一条条筛出来。我录的技能,就是把"第 3、4 步"接管过来。
录制接单归档技能
录制时,我演示的是"处理一条订单消息"的完整动作:
1. 收到群友下单消息(例如:"9 点 27 分,小陈,无线演示器 1 个,629 元")
2. 从消息里提取:订购人、订购时间、商品、数量、单价
3. 打开订单台账表格,在下一行填入这条订单
4. 核对一遍填好的内容
5. 保存
关键在第 2 步——从一句自然语言里提取结构化字段。我在录制时一边操作一边念:"订购人是小陈,时间是 9 点 27 分,商品是无线演示器,数量 1,单价 629。"让 AI 看到"一句话 → 五个字段"的映射是怎么做的。它学完之后,以后群里来一句"加一,要两个支架",它也能自己抽出"商品:支架,数量:2"。
订单台账的模板长这样:
|
时间 |
订购人 |
商品 |
数量 |
单价(元) |
小计(元) |
状态 |
|
09:27 |
小陈 |
无线演示器 |
1 |
629.00 |
629.00 |
已核对 |
|
09:33 |
阿敏 |
显示器支架 |
2 |
89.00 |
178.00 |
已核对 |
|
09:41 |
大刘 |
键盘 |
1 |
199.00 |
199.00 |
已核对 |
实战:开一场新团购
技能录好后,我模拟了一场完整的团购来验证它。群友陆续下单,我攒到一定数量,跟 AI 说一句:"用接单技能,把群里从 9 点开始的订单整理到台账里。"它就开始干活了:
- 它先翻聊天记录,把含"加一""要 2 个"这类关键词的消息筛出来;
- 逐条提取字段,跟已有台账比对——先查重,9 点 27 分小陈那条已经在台账里了,就跳过,只新增 9 点 33 分之后的;
- 写入表格后,它发现"金额没有加总"——原来我录制的模板里小计列是空的,它自己补了个动作:自动给表格写公式,用单价乘数量算出小计,再在底部加一行总计。
最后一步我当时看到是又惊又喜。惊的是它居然会自己写表格公式,喜的是这正好补上了我模板的漏洞。它用的就是表格软件里最普通的乘法公式和求和公式,但"发现缺了加总、自己补上"这个判断,是它自己推理出来的,不是我教的。
这里有个绕不开的授权环节
AI 要操作表格



