为什么大家都在做 Agent 试点,真正跑进组织的却没几个
试点成了不推进的保护色。95% 的项目在损益表上查不到痕迹。
真正跑进组织的 Agent 没几个,是因为试点停在个人电脑上,没有进排班、权限和指标。缺的不是更聪明的模型,是能驻在现场、对损益负责的人。这种人叫 FDE。
MIT 有一份 2025 年的企业调研,听着很刺耳。全球公司在生成式 AI 上花掉的钱里,大约 95% 的项目在损益表上查不到痕迹。不是效果差一点,是查不到它们存在过。
中国公司换了个更体面的说法,叫试点。
试点这两个字,我在现场见得太多了。试点一旦变成目的,就会一直试下去。Agent 现在就卡在这里。不是模型不够聪明,是组织里缺一种人,能把它从个人电脑接进必须经过的流程。这种人有个名字,叫 FDE。
上一篇重写管理里我写过,AI 用得越多,组织反而可能越散。那篇讲的是口径、资产和责任停在每个人自己的电脑里。这篇往下走一步。散完以后,公司通常会做什么?上几个 Agent 试点。然后试点本身,又变成新的保护色。
01 试点成了不推进的保护色
做过管理的朋友都知道,试点这两个字天生安全。可停,可小,不承诺一定怎么样,只说我们在探索。
放在制度、培训、新项目上,有时候是必要的。放在 Agent 上,很容易变成全员的台阶。
IT 可以说我们做了试点,上了几个场景,有调用量,有成功案例。老板也可以说我们没落后。业务觉得可以看。管理部门觉得暂不相关。
你再往下问一句,这些 Agent 有没有进流程,有没有变成组织必须用的环节,有没有改掉谁的工作方式,答案就开始模糊。
上去了是成功。没上去是还在试。没人需要为结果负责,也没人需要为失败担责。
现场服务和连锁里这种事我见太多了。招聘初筛做了个助手,停在经办人自己的电脑里,用人部门还是按老习惯要人。客服知识库接了问答,一线还是先问老人,因为现场口径和库里的对不上。项目日报做了自动汇总,群里照样在催,因为没有它,流程照样能转。
很多 Agent 试点最大的问题,不是 Agent 不够聪明,而是组织从一开始就没打算让它成为必须经过的环节。
02 停在个人电脑上的 Agent,进不了排班表
这块多说两句。
我现在看一个公司的 AI,不太看它发了多少内部案例。我更想看三样东西有没有进组织的操作系统。
- 进没进排班。谁必须用它,什么时候用,不用会怎样。
- 进没进权限。它能看什么数据,能改哪类字段,能不能发通知,能不能触达客户。
- 进没进指标。抽掉它,哪组数会变差。返工、等待、差错、沉淀,有没有被它真正带动。
这三样里缺任何一样,它就还是个人效率,不是组织能力。
上一篇里我写过,一个人用 AI 写得快,不代表公司跑得快。十个人各用各的 AI,有时候反而更乱。Agent 试点把这件事放大了。以前是提示词和文档散在各处,现在是一个会动手的东西停在部门孤岛里,或者停在一个暂时还不想升级的系统接口后面。
a16z 今年有组数据,计算机操作类智能体在 OSWorld 测试上已经到 85%,超过人类测试者大约 72% 的水平。Claude 也把浏览器里的会话升级成可以跨端接着干的 Cowork。技术上,它已经不只是会看,开始会动手了。
会动手以后,试点更危险。因为它能点按钮了,组织还没准备好让谁授权、谁复核、谁停机。
更早一篇写过智能体出错谁负责。那篇把责任链画清楚了。这篇要补的是另一半。责任链画完,还得有人把它接进真实流程。没有人驻在现场,责任链只是一张图。
03 真正缺的不是模型,是能驻场的人
坦率地讲,Agent 试点最大的错觉,是以为最难的是技术。
模型选得对不对,提示词写得好不好,返回准不准,响应快不快。这些当然重要,但它们只是门槛。
真正让它卡在门口的,是现场那些脏问题。数据在哪个系统,字段有几个口径,一线愿不愿意用,法务哪天开始进场,上一个类似项目是怎么黄的,验收时谁签字。
这些问题,坐在总部写方案的人很难一次问清楚。业务部门开会能点头,回到现场又用回老办法。实施团队按计划部署完,指标没动,也算交付完成。咨询顾问可以留下一份建议,建议不负责跑起来。
说到这个,Palantir 很早就撞上过同一条沟。产品是通用的,客户的数据、系统、工作流程没有两家相同。销售说能解决,产品说功能都有,中间缺一种人,把通用能力塞进客户乱七八糟的真实世界里。
他们的答案不是写更厚的实施文档,而是把工程师直接放到现场。内部叫 Delta。后来行业把它叫成 Forward Deployed Engineer,前沿部署工程师,简称 FDE。
04 FDE 这个岗位,藏了十五年
FDE 不是会写代码的咨询顾问,也不是升级版程序员。别的岗位都能交差。只有 FDE 的考卷写在损益表上。
| 岗位 | 对什么负责 |
|---|---|
| 售前 | 签约 |
| 架构师 | 方案 |
| 交付 | 计划 |
| 客户成功 | 续约 |
| FDE | 客户的业务指标 |
这是最大的差别。Demo 好看不算,调用量上升也不算,得是那条流程真的跑起来,差错、等待、返工这些数动了。
Palantir 2016 年出现过一个很反常的结构,现场这批人的数量超过了产品工程师。一个软件公司,驻场的比写产品的还多。听着不可扩展,但它成立,因为客户为问题被解决付的钱,远多于为软件本身付的钱。
大模型把这套模式重新点着了。模型像一个什么都会一点、对你的业务一无所知的高智商实习生。要把它变成合格员工,得有人教它你的业务,还得有人在现场改流程、补数据、盯两周。
供给端也在验证这件事。OpenAI 的 FDE 团队 2025 年初 2 个人,年底扩到 52 人。Anthropic 设了这个岗。a16z 直接称它为科技行业最热门的岗位,2025 年 1 月到 9 月,岗位发布量涨了超过 800%。
薪酬和招聘量同时暴涨,只有两种可能。泡沫,或者市场终于为一直被低估的价值定价了。
我赌后者。
05 组织里谁该干这件事
你可能会说,我们又不是硅谷公司,也不招年薪二十万美元的工程师。
这话对。传统集团不需要照搬 Palantir 的编制名称。但你需要这套能力。
谁能在招聘、客服、工单、排班这些真流程里坐下来,把 Agent 从可有可无的助手,改成必须经过的环节。谁能在进场前把权能、责任、数据三道边界问清楚。谁能接受前两周代码不好看,但指标必须动。
很多公司把这件事拆给了三拨人。IT 管系统,业务提需求,HR 管人。三拨人开会时都同意做 AI,散会后各自回到自己的考核。Agent 就停在中间。
FDE 干的,就是站在这个中间。不是再开一个数字化部门,是让现场出现一个对结果负责的人。他可以懂一点技术,更必须懂业务怎么跑。上午能和信息部门聊接口,下午能和项目经理聊排班为什么接不住。
McGrew 后来讲 FDE 用人,有句话很直白。不要忠诚的执行者和精致的工匠,要能忍受混乱、在模糊里开路的人。看到需求不明确就烦躁,这活会要他的命。看到它就兴奋,才可能把试点做成流程。
回到管理这件事上。我们过去推制度,也吃过同类的亏。总部写得很完整,项目上没有人把它接进晨会、交接班和考核,制度就死在执行层。Agent 比制度更娇气。它不会自己懂现场的潜规则。你不驻场,它就只会停在试点报告里。
06 试点以后只问三件事
如果一定要我给一个建议,我不会先问你试点成不成功。先问这三件。
- 有没有一条流程,是你承认如果抽掉 Agent,这条流程就跑不下去的。
- 有没有一个环节,是你明确说过出错仍要有人兜底,但还是决定交给它的。
- 有没有一组指标,是你承认如果 Agent 没有贡献,这组数就不会变好的。
这三件事只要有一件没做到,Agent 就还在试点。
做到了,才算跑进了组织。
太久的试点,往往不是在证明技术可行,而是在证明组织还没有准备好。准备好的标志也很具体。有人驻在现场,边界写得清楚,流程改过,指标在看。缺这四样,再换一个更强的模型,也只是把试点做漂亮一点。
真正稀缺的不是又一个 Agent 场景。
是能把 Agent 接进流程、权限和指标的人。
这种人,就是 FDE。
你可以先不招这个岗位。但你得承认,组织图上缺了这个位置,试点就会永远停在个人电脑上。
我把 Palantir 怎么藏这个岗、进场 72 小时问什么、尽调那 50 个问题,写成了一本 FDE 蓝皮书。负责人不必把 13 章读完,按失败复盘、影子 AI、进场和契约这条路径走即可。
参考资料
MIT NANDA,The GenAI Divide, State of AI in Business,2025 年 8 月。关键引用点为企业生成式 AI 项目无可衡量 P&L 影响的比例。
BCG,The Widening AI Value Gap, Build for the Future 2025,2025 年 9 月。以及 Scaling AI Requires New Processes, Not Just New Tools,2026 年 1 月。关键引用点为流程重构先于工具堆叠。
a16z,关于计算机操作智能体在 OSWorld-Verified 上的成绩,2026 年 8 月。关键引用点为最佳成绩约 85%,高于人类测试者约 72%。
Anthropic,Claude in Chrome 升级为 Cowork 会话,2026 年 8 月。
OpenAI FDE 团队规模变化,ZenML LLMOps Database 等公开复盘,2025 年。a16z 关于 FDE 岗位热度的论述,2025 至 2026 年。
Palantir Delta / FDE 双轨及 2016 年现场工程师数量反超,公开历史资料及后续 FDE 模式拆解。