Computer Use 出来以后,AI 不再只是会看,开始会动手了 没有接口的时候,AI 开始看界面、点按钮、把碎动作做完。 原文 https://aifellow.cc/articles/tc03 国内 https://aifellow.cc/articles/tc03 Computer Use 是:系统没有接口的时候,AI 直接看界面、点按钮、填表单,把碎动作做完。它不再只停在内容层。 这是「搭系统实录」第三篇。 前一篇写 MCP,讲的是 AI 怎么通过统一协议调用系统能力。 这一篇写 Computer Use,讲的是另一条更贴近现场、也更容易被低估的路径: 当系统没有接口,AI 能不能直接看界面、点按钮、填表单、完成动作。 过去企业用 AI,主要还停在内容层。 写一段话,改一份材料,总结一篇会议纪要,查一堆资料。这些都很有用,但它们大多还没有真正碰到公司的业务系统。 Computer Use 出来以后,边界变了。 AI 不只是回答你,它开始能进入真实界面,沿着流程往下走。 这件事真正重要的地方,不是 AI 终于会“点鼠标”了,而是公司里大量原本只能靠人坐在电脑前完成的碎动作,第一次有了被重新设计的可能。 ## 它不是一个更聪明的聊天框 Computer Use 的逻辑很直接: 先看屏幕截图,理解界面上有什么;再决定下一步动作;然后通过虚拟鼠标和键盘去点击、输入、滚动;执行完,再重新看屏幕,判断结果对不对。 OpenAI 在 2025 年 1 月发布 Operator,背后的模型叫 CUA,也就是 Computer-Using Agent。OpenAI 对它的描述很明确:模型可以看见浏览器界面,并通过点击、输入、滚动来完成任务。 Anthropic 更早在 2024 年 10 月开放了 Claude 的 computer use 能力,让模型通过截图观察桌面,再用虚拟键鼠操作软件。Anthropic 当时也提醒,这个能力还处在早期阶段,需要开发者在低风险任务里逐步试用。 到 2025 年 7 月,OpenAI 又发布 ChatGPT agent,把网页浏览、深度研究和计算机操作能力放进同一个 agent 模式里。 这些信号放在一起看,说明一件事: AI 正在从“会调用工具”,走向“会操作环境”。 这不是产品名的变化,而是能力边界的变化。 接口能通,就走接口;接口不通,它开始尝试走界面。 ## 它和 RPA 的差别,不在速度,在逻辑 一听到“AI 操作界面”,很多人会想到 RPA。 这个联想不奇怪,但如果只把 Computer Use 理解成新一代 RPA,很容易低估它。 传统 RPA 更像脚本。你提前定义好步骤,它按步骤跑。界面稳定、流程固定、规则清楚的时候,它很有效。 但 RPA 最怕变化。 按钮换了位置,弹窗多了一层,字段名改了一下,页面加载慢了一点,脚本就可能失败。 Computer Use 的起点不是坐标,而是目标。 它不是只记住“点第几个按钮”,而是先看当前界面,再判断哪里像提交按钮、哪里像输入框、下一步应该怎么走。 所以差别不是: RPA 慢,Computer Use 快。 真正的差别是: RPA 执行的是预设步骤,Computer Use 执行的是当前目标。 这句话很关键。 因为企业里有大量流程,并不是完全没有规则,而是规则写得不够干净,系统接口不够完整,界面还经常变。 过去这类流程很难自动化。 现在它们开始变成可讨论对象。 ## 为什么这会打到企业流程 Gartner 在 2025 年 8 月有一个判断:到 2026 年底,40% 的企业应用会集成任务型 AI agents,而 2025 年这个比例还不到 5%。 这个数字不需要被神化,但它说明一个方向: 企业软件不会只把 AI 当成写作助手,它会越来越多地把 AI 放进任务执行链条里。 MCP 解决的是一类问题:系统愿意开放能力时,AI 怎么标准化调用。 Computer Use 解决的是另一类问题:系统还没有开放能力时,AI 能不能先从界面进入流程。 这两条路合在一起,企业 AI 才开始真正接近业务现场。 一条是接口层。 一条是界面层。 接口层更稳,适合长期工程化。 界面层更粗糙,但很可能先碰到那些“每天都有人在做、但一直没人愿意改”的重复动作。 ## 公司里会先被改写的三类动作 不是所有流程都应该先交给 Computer Use。 最先适合试的,通常不是高判断、高风险、高金额的环节,而是三类低判断、高重复、跨系统的动作。 第一类,跨系统搬运。 一个人要从 A 系统查信息,再到 B 系统录入,再到 C 系统提交。真正的价值不在“判断”,而在“跑完”。这类动作最耗人,也最容易被忽略。 第二类,周期性核对。 周报、月报、客户信息同步、项目状态更新。每次都差不多,但每次都要打开几个系统、复制几段内容、核对几个字段。 第三类,流程后的补动作。 会议结束后补纪要,项目推进后改状态,沟通结束后补记录。很多管理动作最后不是输在判断,而是输在这些尾巴没人愿意收。 这些动作有一个共同点: 它们不一定值得单独开发系统接口,但长期让人手工做,又非常浪费。 Computer Use 的价值,恰好出现在这个缝里。 它不一定马上替代系统集成,但它会逼管理者重新看一遍: 公司里到底有多少工作,本质上只是人在替系统补接口。 ## 真正要先画清楚的不是流程,而是边界 Computer Use 一旦进入公司,管理者最该紧张的不是“能不能自动化”。 而是三个更基础的问题。 第一,权限边界。 AI 能看哪些系统?能填哪些字段?能不能点提交?能不能发邮件?能不能改客户资料?能不能触发付款或审批? 这些不是技术细节,是管理授权。 第二,确认点。 哪些动作可以自动完成,哪些动作必须在人确认以后才能继续。尤其是涉及金额、外部承诺、员工信息、客户信息、权限变更的动作,不能因为技术能点,就默认可以点。 第三,审计链。 AI 看了什么,点了什么,改了什么,失败在哪里,为什么重试,谁最终确认。 如果这些追不回来,Computer Use 做得越多,组织反而越失控。 所以我对这件事的判断很简单: Computer Use 降低的是自动化的技术门槛,不是管理门槛。 它越容易上手,越不能绕过权限、确认和追溯。 ## 企业真正该怎么开始 不要一上来就问“能不能替代某个岗位”。 这个问题太大,也太容易把事情带偏。 更好的起点是找三条链路: 第一,找一个每天都有人反复登录、复制、粘贴、核对的流程。 第二,把里面的动作拆成两类:执行动作和判断动作。 第三,只让 AI 先试执行动作,把判断动作和高风险动作留给人。 这才是比较稳的试点方式。 不是为了证明 AI 很强,而是为了验证一件更重要的事: 在你的组织里,哪些动作已经可以从“人亲自点”变成“人授权、AI 执行、人复核”。 这个变化一旦成立,意义就不只是省一点时间。 它会改变公司对流程的理解。 过去流程设计默认执行者是人,所以很多接口、字段、确认点都写得很粗。 以后如果流程里会出现 AI 执行者,流程本身就必须写得更清楚。 谁能看,谁能动,动到哪一步停,失败以后怎么回滚。 这些都会从“上线以后再说”,提前变成流程设计的一部分。 ## AI 正在从内容生产,进入流程执行 如果只把 Computer Use 看成“AI 会操作电脑”,它会显得像一个好玩的功能。 但如果放到企业里看,它更像一个信号: AI 正在从内容生产,进入流程执行。 这一步不会一夜之间改变公司,也不会立刻替代所有人。 但它会把一个以前很模糊的问题推到管理者面前: 当 AI 也能动手,组织里的动作边界到底该怎么重新写。 2026 年 8 月 25 日,字节把这一层做成了产品:豆包工作。打开第一句就是「今天有什么工作要处理」。 参考资料 - OpenAI, Introducing Operator, 2025-01-23: https://openai.com/index/introducing-operator/ - OpenAI, Introducing ChatGPT agent, 2025-07-17: https://openai.com/index/introducing-chatgpt-agent/ - Anthropic, Claude 3.5 Sonnet and computer use, 2024-10-22: https://www.anthropic.com/news/3-5-models-and-computer-use - Gartner, 40% of enterprise applications will be integrated with task-specific AI agents by 2026, 2025-08-26: https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025