
观察过一批企业用 AI 的历程,会发现大家的路径相当一致,基本都走过三个阶段:先是遍地开花的兴奋期,然后收心立规矩,最后开始做减法。每个阶段的主线任务和代价都不一样,判断自己处在哪个阶段,比照搬别家的具体做法更有用。
第一阶段:交学费
这个阶段的典型状态是来者不拒。业务部门提需求,技术部门做 Demo,演示一个比一个惊艳,立项一个接一个。
代价出现在年底盘点的时候:真正跑在生产环境、有人在用的功能屈指可数,而账单已经不小。复盘下来,活下来的功能往往有个共同点——它做的事情足够简单,输入格式相对固定,出错也不太要紧,所以经得起真实流量的摔打。那些演示最惊艳的项目,多数死于对真实数据复杂度的低估。
这个阶段最常见的财务意外是"无人认领的功能"。某个早期上线的功能一直没人管,模型用的是最贵的一档,用量缓慢增长,直到某次对账才被发现这一项的开支已经超过了不少日常办公软件的总预算。这件事带给管理者的教训通常是一句话:没有度量,就没有管理。但这句话要等到吃过一次亏,才真的听得进去。
第二阶段:立规矩
进入这个阶段的标志,是团队开始把注意力从"做新功能"转向"把基础打牢"。主要的动作集中在几件事上。
把分散的模型调用收拢到统一入口,之前散落在各处的直连调用全部迁走。系统提示模板、评测集、推理参数开始纳入版本管理。所有调用带上业务标签,费用能拆到功能粒度。
其中争议最大、后期回报也最大的,通常是强制评测集这一条:要求所有 AI 功能上线前必须有一份自己的评测集,样本从真实流量里抽,不设数量下限但要求能代表业务分布。这个要求刚提出时经常被反对,理由是拖慢上线节奏。坚持几个季度之后,它会变成企业最值钱的一类资产——评估一个新模型或者一次方案调整时,用的是自己积累的、带真实答案的业务样本,几个小时就能给出可信的对比结论,外部榜单和供应商的宣传慢慢就失去了影响力。
第三阶段:做减法
走到第三个阶段的企业,主旋律反而是砍东西。
砍的对象五花八门:有的功能维护成本(数据更新、规则调整、人工抽检)远超它省下的人工;有的功能随着业务变化,场景本身已经消失。砍掉这些之后省出来的未必是钱,更关键的是团队的注意力,可以集中到真正有价值的少数场景上。
另一个方向是"向下"找成本:把调用量最大的固定任务,逐步评估用小模型承接。这件事能不能做得快,完全取决于前两个阶段的积累——评测集规范、训练数据靠谱、灰度机制成熟,切换验证就快;反之每一步都要重新搭基础。
三个阶段的共同规律
把三个阶段连起来看,有两件事值得说。
一是后一阶段的收益,大多建立在前一阶段的投入上。做减法能不能做得果断,取决于立规矩阶段有没有攒下数据;立规矩能不能立得起来,取决于交学费阶段有没有人真的被账单教过一次。跳步的企业往往两头落空。
二是这三个阶段没有终点。模型技术在变,企业在第三阶段形成的判断力也要跟着更新,比如当下一个明确的议题就是:传统做法(评测集、蒸馏、灰度体系)在下一代更强的模型面前会不会过时。主流的判断是不会,甚至更重要——模型越强越便宜,企业内部真正稀缺的东西越是判断力和纪律。工具会换来换去,哪类活值得做、做到什么程度算好、钱应该花在哪,始终是企业自己的功课。














