不重训的代价:过期模型如何悄然破坏生产
模型会悄然退化。基于旧文档训练的支持机器人、缺少新类别的分类器、感觉'通用'的客户模型——过期模型的代价比重训更高。
这个模型在一月运行得很好,反应敏锐、判断准确,客户也很满意。五个月过去,没有人重训过它,大家也都觉得没这 个必要:训练数据还在,模型文件没动过,从外面看一切照旧。
可是有个客户刚刚取消了合同,理由是:"这个 AI 已经不懂我们了。"
客户说得没错,模型确实不再懂他们了。世界一直在往前走,模型却停在了原地。
这就是不重训的代价,而它几乎总是比所有人预想的更高。
场景 1:落后于产品的客服机器人
一家 SaaS 公司在十月上线了一个微调过的客服机器人,训练语料是他们 v2.1 版的产品文档:功能指南、故障排查步骤、API 参考。客户对机器人的满意度是 5 分制的 4.2 分,转人工的比例是 18%。
到了三月,产品已经迭代到 v3.0:新增了三个主要功能,下线了两个功能,设置面板彻底重排,API 也有破坏性变更。
机器人依然按 v2.1 回答。
问新版仪表盘的客户,拿到的是旧版的操作说明;问已下线功能的客户,拿到的是一份针对早就不存在的功能的分步指南;问 API 集成的客户,拿到的接口地址只会返回 404。
五个月不重训之后的数字:
| 指标 | 十月(v2.1) | 三月(v3.0,未重训) |
|---|---|---|
| 客户满意度 | 4.2 / 5 | 3.4 / 5 |
| 转人工比例 | 18% | 31% |
| 每周新增人工工单 | - | +160 |
| 每张人工工单成本 | - | $12.50 |
| 过期模型的月度成本 | - | $8,000 |
每月 8,000 美元只是多出来的那些人工工单的直接成本,还没算客户的不满、流失风险,以及支持团队对"那个只会给我们添活的 AI"越积越深的抵触。
用 v3.0 的文档重训,需要 3 到 4 小时准备数据,加一次微调运行,算力加上半天人力,总共不到 200 美元。而这家公司在有人终于问出"机器人上一次更新是什么时候"之前,已经在五个月里多花了 40,000 美元的支持成本。
场景 2:数不过来类别的分类器
一个运营团队搭了一套工单分类系统。上线时有 8 个类别:账单、技术、账户、物流、退货、产品信息、合规和通用。模型用 3,200 条标注样本微调,准确率做到 94%,表现扎实。
接下来的四个月里发生了三件事:
- 公司推出了订阅套餐,多出一个"订阅"类别
- 客户的反馈请求多到需要单独设一个"反馈"类别
- 合作团队开始接到工单,需要一个"合作"类别
模型认得的还是那 8 个类别,生产环境里已经有 11 个。所有订阅、反馈和合作类的工单,都被硬塞进最接近的现有类别,通常是"通用"或"账单"。
每周的错误分流数字:
| 类别 | 每周工单量 | 被错分到 | 处理延迟 |
|---|---|---|---|
| 订阅 | 85 张 | 账单(70%)、通用(30%) | 平均 +4 小时 |
| 反馈 | 65 张 | 通用(80%)、产品信息(20%) | 平均 +6 小时 |
| 合作 | 50 张 | 通用(60%)、账户(40%) | 平均 +8 小时 |
也就是每周有 200 张工单进错了队列。每一张都要有人读一遍、意识到它排错了地方、重新归类,再转给正确的团队。一张错分工单的平均处理成本是 8.50 美元(3 分钟坐席时间,全负担人力成本按每小时 34 美元计,再加上延迟带来的损耗)。
200 张工单 x 8.50 美元 = 每周 1,700 美元,每月 7,400 美元。
更麻 烦的是,接到错分工单的团队开始不信任这套系统。订阅团队手工翻查每一张"账单"工单,从里面挑出订阅相关的;合作团队干脆设了邮件过滤规则,整套分类系统直接绕过去。两个月之内,三个团队放弃了自动分流,改回人工分诊。
这套分类系统的搭建和部署花了 3,000 美元。四个月不更新的代价:29,600 美元的直接错分成本,外加多个团队弃用自动化这一运营层面的倒退。
把三个新类别补进去重训,每个类别需要 150 到 200 条新的标注样本,加一次微调运行,两天就能收尾。换来的却是四个月不断累积的成本。
场景 3:走掉的那个代理商客户
一家咨询代理商为某个 B2B 客户微调了一个内容生成模型,训练语料涵盖客户的品牌语气、产品术语、客户画像和行业黑话。交付时,客户给输出的相关性和品牌契合度打了 4.5/5 分。
半年之后,客户的业务变了:
- 他们推出了一条新产品线,带着自己的一套术语
- 目标客群从中端市场转向大型企业
- 品牌语气也在演进,从轻松随意转向权威专业
- 行业监管规则变化,需要新的合规表述
模型写出来 的东西还停留在半年前,读着"通用"又"过时"。客户开始大幅改写每一篇生成内容,AI 工具的意义也就消失了。
客户的月度合同金额是 2,000 美元,耐心已经快耗尽。季度回顾会上的原话是:"一开始感觉很棒,可现在放到我们的场景里,它基本上就是个更差版本的 ChatGPT。"
代理商面前有两个选择:花 4 到 6 小时重训模型,或者失去一个年费 24,000 美元的客户。他们选了重训,但已经赔进去两个月的信任,合同也差点整个丢掉。
对代理商来说,教训很直白:微调模型是一份需要持续维护的活资产。维护一停,它就开始贬值。
缓慢退化的模式
模型过期很少大张旗鼓地宣告自己,它走的是一条可预测却安静的路径:
第 1 到 2 个月:性能下降 1% 到 2%,没有人察觉。监控看板一片绿,因为阈值是按重大故障设的。用户可能隐约觉得哪里不对,却说不上来。
第 3 到 4 个月:性能下降 3% 到 5%,重度用户开始注意到。你偶尔会收到"AI 最近好像没那么准了"或者"它处理 X 不如以前"这类反馈,但都是零散的感受,谈不上紧急。
第 5 到 6 个月:性能下降 6% 到 10%,聚合指标上已经看得出来。客户满意度评分下滑,支持工单增加,相关方开始问"这个 AI 到底还管不管用"。到这一步,你已经在收拾残局了。
第 7 个月及以后:模型开始实打实地损害用户体验。它会依据过时的信息,信心十足地给出错误答案。用户对这个模型失去信任,也会连带怀疑 AI 本身的能力。要挽回,重训之外还得把用户信心重新建起来。
复利式的成本表说明了一切:
| 月份 | 准确率下降 | 月度成本(客服机器人示例) | 累计成本 |
|---|---|---|---|
| 1 | -1% | $400 | $400 |
| 2 | -2% | $1,200 | $1,600 |
| 3 | -4% | $3,000 | $4,600 |
| 4 | -6% | $5,200 | $9,800 |
| 5 | -8% | $7,000 | $16,800 |
| 6 | -10% | $8,000 | $24,800 |
到第 6 个月,不重训的累计成本是 24,800 美元。而在第 2 个月做一次重训,算力花 200 到 400 美元,人力 4 到 6 小时。重训的回报率在 100 倍这个量级,远高于一般人猜的 10 倍。
团队为什么不重训
既然重训的价值这么明显,团队为什么会跳过它?有四个原因:
"它还能用。" 模型没坏,不报错,不崩 溃,照样在出结果。缺少主动监控,退化就是看不见的,而团队不会去修一个看起来完好的东西。
没有对应的流程。 最初的微调是一个有截止日期、有交付物的项目;重训是一项没有天然截止日期的长期维护。少了流程,也就是排期、触发条件和负责人,它就不会发生。
数据采集停了。 团队为第一次微调收集并标注了训练数据,模型一上线,采集就停了。现在要重训,得重新组织一轮数据采集,感觉像从头再来一遍。
它不在任何人的职责范围内。 ML 工程师做了模型,产品团队负责这个功能,运维团队管着基础设施。重训夹在三者中间,没有人对它负责,于是没有人做。
预防手册
预防模型过期需要三样东西:排期、监控系统和数据管线。
按计划重训
按你所在领域的变化速度定节奏:
- 每月重训:适用于更新频繁的产品、变化快的行业,或者准确率直接影响满意度的面客应用。
- 每季度重训:适用于数据变化缓慢的稳定领域、内部工具,或者能容忍准确率小幅下滑的应用。
对大多数跑在生产环境里的微调模型,每月一次是合理的默认值。成本很低(2 到 4 小时人力加上算力),保护力度却相当可观。
自动化监控
没有度量就谈不上重训。把下面这几项的自动监控搭起来:
- 准确率指标:对生产输出做轮换抽样,每周跟踪准确率。相对基线下降 2% 就要排查,下降 5% 就立刻重训。
- 用户反馈信号:跟踪点赞/点踩比例、升级率,或者你的应用里任何形式的用户反馈机制。连续两周走低就要排查。
- 分布漂移检测:把进来的请求分布和训练数据的分布做对比。重合度掉到 80% 以下,说明模型面对的世界已经和它训练时明显不同了。
持续采集数据
最重要的习惯是:永远不要停止收集训练数据。每一次生产环境里的交互都是潜在的训练样本。从第一天就把管线搭好:
- 记录模型的所有输入和输出
- 收集用户反馈(更正、评分、升级)
- 定期对生产数据抽样并标注
- 持续把校验过的样本加进训练集
- 重训的触发条件一旦命中,数据已经就位
维持着持续数据管线的团队,重训以小时计。任由数据采集荒废的团队,重训要按周算,前提是他们还愿意重训。
重训的投入产出
这笔账很直白:
每月重训的成本:
- 数据审查与准备:2 到 3 小时
- 微调算力:50 到 150 美元
- 评估与部署:1 到 2 小时
- 合计:3 到 5 小时人力,加每月 50 到 150 美元
每月重训保护住的价值:
- 保住的自动化价值:每月 5,000 到 20,000 美元(视应用而定)
- 省下的支持成本:每月 2,000 到 8,000 美元
- 客户留存:因情况而异,但丢掉一个客户的损失就超过一整年的重训投入
两边根本不在一个量级。每月花 4 小时保护每月 10,000 美元的价值,这是一项必需的投入。
给代理商:重训就是经常性收入
如果你为客户搭建并部署微调模型,重训就是经常性收入业务的地基。
一次性的微调项目对应一笔一次性付款;带每月重训的微调项目对应的是一份长期服务合约。客户拿到一个始终保持敏锐的模型,你拿到可预测的月度收入。
定价要定得合适。单个模型的月度重训,视复杂度收每月 500 到 1,500 美元,覆盖你 3 到 5 小时的人力、算力成本,还留出健康的利润空间。客户付的钱少于一次工单错分事故的代价,你则积累起一批经常性合约。
把微调当作交付物的代理商,收入总在忙闲两极之间摇摆;把微调当作服务的代理商,做的是可持续的生意。区别就在重训。
真正的代价
重训的成本是看得见的:花掉的工时、结算的算力、投入的精力。不重训的成本一直藏着,直到有一天突然显形。它藏在满意度的缓慢下滑里,藏在慢慢变多的支持工单里,藏在那些一声不响就走掉的客户里。
生产环境里的每一个微调模型都在贬值。真正要回答的问题是:你想以低成本主动重训,还是以高成本被动补救。
把排期定下来,把管线搭起来,守住你已经创造出来的价值。
你的模型在一月运行得很好。要确保它到七月依然如此。
延伸阅读
- 微调准确率的模型重训循环:如何组织重训周期
- 用微调模型做经常性收入:模型持续维护的商业模式
- 微调模型的运维生命周期:重训在运维成熟度中的位置
Ship AI that runs on your users' devices.
Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.