去年在公司内分享AIBD,我说未来是Human in AI Loop(流程由 AI 主导,人只在关键处确认)。一年多了,销售、运营、研发,各个领域都出现了非常多AI主导、人类只做兜底确认的全新工作流试点。这些试点跑下来怎么样了呢?
上周出差去一线看一个销售 AI 的试点。团队对 AI 很积极。AI 邀约客户、给线索打标签。中低意向客户拉进群里慢慢聊;高意向客户,销售得在 48 小时内上门。签约以后,AI 还会帮忙装修线上店铺。
这条链路汇报的时候看上去很顺:数据不差,项目组有信心,销售管理者也愿意继续推。但是,和销售面对面之后,大家提到最多的是累。
刚开始,大家觉得挺新鲜,两周过后,开始觉得累。他们最常说的一句话是:“我不太信它标的高意向。”
有些客户被系统标了高意向,销售按要求赶过去,现场却签不了约。可销售原本手里就有自己排好的拜访清单。AI 又塞进来一条 48 小时必须完成的任务,今天的安排就被打乱了。
上门次数是多了,真正有把握的客户却被往后挤,月底的目标反而更难追。
系统本来是来帮销售找客户的,怎么最后把销售搞得更累?
问题不在模型会不会写话术,也不在销售愿不愿意用 AI,问题在“高意向”三个字上。
“高意向”这三个字,谁说了算?
客户回过消息,愿意进群,或者客气地说“可以见面聊聊”,AI都会把它当作信号。
销售看的是另一笔账。一天能拜访的客户有限,他想的是:跑这一趟值不值?客户有没有成交条件?会不会耽误另一个更有把握的客户?
这就是销售每天在做的取舍。更麻烦的是,不同的销售,他的判断结果也不一样,因为他评估的是自己上门成功的概率。
如果不理解这套取舍逻辑,AI 打出来的“高意向”就只是个参考。可以给销售参考,但不能用来指挥销售,更不能强行加一条“48 小时必须上门”的规则。既然每个人的判断都可能不一致,那这个判断谁说了算?以前某个公司试过,电销打电话筛线索,交给地面销售跟进。地面销售常常抱怨电销为了 KPI,把没有成交意向的客户塞进来;电销常常抱怨地面销售能力不行,明明电话里聊得很好、就差临门一脚的客户,却被地面跟丢了。连电销和地面之间的判断都很难达成一致,AI 的“高意向”就很难成为一条可执行的指令。它只会把原来的分歧,更快地推到一线销售面前。产研很努力地优化标签的准确率,但优化的是一个人类都没有对齐评估标准的目标。
有些人会说,最后还是销售确认,不就是 human in the loop 吗?
得看这个“确认”有没有用。如果销售不能拒绝,也不能改优先级,只能接收一条被系统和规则定好的任务,那不是确认,是签收。如果销售能拒绝,系统还能知道他为什么拒绝,这才有意义。
成功率好看,活都是AI干的,为什么销售还是累?
签约以后,AI 会帮销售装修线上店铺,周报上的成功率还不错。可把对话一条条翻出来,看到的是另一回事:AI 每走一步,销售都得提示、改写、纠正。这更像一个需要人带着干活的 AI 实习生。
AI 实习生能帮填信息、能做图、上单,已经很有用了。问题是,具体操作虽然交给了 AI,人并没有闲下来。他得盯着每一步:错在哪,怎么改,下一步该做什么。这部分注意力,没有被算进成本。
报表上的完成率高,不表示人力真的被释放了。
要看人工介入率。一个任务,人工要介入几次才能成功?改一个字、调个格式,算轻的;推翻 AI 的判断,算重的;任务做错了,要撤销重来,成本更高。不能只算 token,销售盯着屏幕的时间也是成本。
人偶尔出来救火,说明系统能扛住大部分日常工作。人天天守在关键节点,那还谈不上把车交给 AI 开。
工具的设计者,离现场有多远?
这个试点的分工很典型:销售管理者提需求,产研把工具做出来,一线销售来用。
每个人都没偷懒,产研也一直和销售在一起,积极解决问题。可提需求的人如果没亲自用 agent 跑过一遍一线销售的完整工作,很难想象“高意向客户 48 小时必须上门”会把销售的一天切成什么样。提需求的人没有一边谈客户,一边盯着群里 AI 和客户的对话;只看完成率,很难体会这种不断介入的消耗。
我喜欢举 Claude Code 的例子。发现问题的人能自己动手改,改完很快就知道有没有用。它给我的启发不是“人人都该自己造工具”,而是设计者离使用现场越近,越容易看见工具到底帮了忙,还是添了负担。销售 agent 很难照搬这种关系。“管理者提需求,产研交付和调教 agent,一线照着用”,调教 AI 的人没做过这份工作,提需求的人也离实际使用场景有点远,大家只能依赖使用者的口头反馈来调整方向,识别真问题自然更难。
策略分析场景的 agent 也类似。调教 AI 的人能看见什么问题、使用者能不能识别它的错漏,都会限制它在实际工作流里的效果。把策略分析 agent 嵌进工作流后,这些限制很快就会露出来。
追求自动驾驶,但先别急着把 AI 当司机
设计一条 human in the loop 的工作流,建议问自己四个问题:
第一,每一步的结果,是否可评估可验证,人与人的判断标准是否一致?
不是要求所有人的判断一模一样,但如果人人一致率就不高,就别急着让 AI 替人下结论。
第二,工作流里有没有反馈信号?
人类拒绝或者纠正了AI,是什么原因,有没有记下来,这个信号有没有回到系统里?反馈是自进化、自学习的前提。反馈越清晰越快速,迭代的速度就能加快。如果没有反馈信号,工作流不会越跑越好,只会原样重复。
第三,实际跑起来,人到底介入了多少?
不能只看成功率,成功率只能说明任务最后做完了,不能说明是谁做完的,人类介入纠正了几次。要看人工介入率、接管率,也要看介入发生在哪一步、花了多少时间、有没有把更重要的工作挤掉。人偶尔处理例外没问题;人天天替 AI 收尾,就不要拿“高成功率”吹嘘。
第四,设计和研发这条工作流的人,真的用过它吗?又对结果负责吗?
不是说研发要去当销售,但至少要以使用者的身份完整走过关键任务,知道一次错误派单会怎样打断销售的一天。更重要的是,设计者、研发和业务负责人不能只为“上线”负责,也得一起为业务结果负责。
这四件事想清楚,AI 才能一点点拿到更多权限。想不清楚,就先让它当副驾:帮人起草、归纳、提醒,做低风险的重复工作。别急着说它在自动驾驶。