Back to blog
    重训模型漂移生产微调质量保证成本分析

    不重训的代价:过期模型如何悄然破坏生产

    模型会悄然退化。基于旧文档训练的支持机器人、缺少新类别的分类器、感觉'通用'的客户模型——过期模型的代价比重训更高。

    Edward Xi Yang

    这个模型在一月运行得很好,反应敏锐、判断准确,客户也很满意。五个月过去,没有人重训过它,大家也都觉得没这个必要:训练数据还在,模型文件没动过,从外面看一切照旧。

    可是有个客户刚刚取消了合同,理由是:"这个 AI 已经不懂我们了。"

    客户说得没错,模型确实不再懂他们了。世界一直在往前走,模型却停在了原地。

    这就是不重训的代价,而它几乎总是比所有人预想的更高。

    场景 1:落后于产品的客服机器人

    一家 SaaS 公司在十月上线了一个微调过的客服机器人,训练语料是他们 v2.1 版的产品文档:功能指南、故障排查步骤、API 参考。客户对机器人的满意度是 5 分制的 4.2 分,转人工的比例是 18%。

    到了三月,产品已经迭代到 v3.0:新增了三个主要功能,下线了两个功能,设置面板彻底重排,API 也有破坏性变更。

    机器人依然按 v2.1 回答。

    问新版仪表盘的客户,拿到的是旧版的操作说明;问已下线功能的客户,拿到的是一份针对早就不存在的功能的分步指南;问 API 集成的客户,拿到的接口地址只会返回 404。

    五个月不重训之后的数字:

    指标十月(v2.1)三月(v3.0,未重训)
    客户满意度4.2 / 53.4 / 5
    转人工比例18%31%
    每周新增人工工单-+160
    每张人工工单成本-$12.50
    过期模型的月度成本-$8,000

    每月 8,000 美元只是多出来的那些人工工单的直接成本,还没算客户的不满、流失风险,以及支持团队对"那个只会给我们添活的 AI"越积越深的抵触。

    用 v3.0 的文档重训,需要 3 到 4 小时准备数据,加一次微调运行,算力加上半天人力,总共不到 200 美元。而这家公司在有人终于问出"机器人上一次更新是什么时候"之前,已经在五个月里多花了 40,000 美元的支持成本。

    场景 2:数不过来类别的分类器

    一个运营团队搭了一套工单分类系统。上线时有 8 个类别:账单、技术、账户、物流、退货、产品信息、合规和通用。模型用 3,200 条标注样本微调,准确率做到 94%,表现扎实。

    接下来的四个月里发生了三件事:

    1. 公司推出了订阅套餐,多出一个"订阅"类别
    2. 客户的反馈请求多到需要单独设一个"反馈"类别
    3. 合作团队开始接到工单,需要一个"合作"类别

    模型认得的还是那 8 个类别,生产环境里已经有 11 个。所有订阅、反馈和合作类的工单,都被硬塞进最接近的现有类别,通常是"通用"或"账单"。

    每周的错误分流数字:

    类别每周工单量被错分到处理延迟
    订阅85 张账单(70%)、通用(30%)平均 +4 小时
    反馈65 张通用(80%)、产品信息(20%)平均 +6 小时
    合作50 张通用(60%)、账户(40%)平均 +8 小时

    也就是每周有 200 张工单进错了队列。每一张都要有人读一遍、意识到它排错了地方、重新归类,再转给正确的团队。一张错分工单的平均处理成本是 8.50 美元(3 分钟坐席时间,全负担人力成本按每小时 34 美元计,再加上延迟带来的损耗)。

    200 张工单 x 8.50 美元 = 每周 1,700 美元,每月 7,400 美元。

    更麻烦的是,接到错分工单的团队开始不信任这套系统。订阅团队手工翻查每一张"账单"工单,从里面挑出订阅相关的;合作团队干脆设了邮件过滤规则,整套分类系统直接绕过去。两个月之内,三个团队放弃了自动分流,改回人工分诊。

    这套分类系统的搭建和部署花了 3,000 美元。四个月不更新的代价:29,600 美元的直接错分成本,外加多个团队弃用自动化这一运营层面的倒退。

    把三个新类别补进去重训,每个类别需要 150 到 200 条新的标注样本,加一次微调运行,两天就能收尾。换来的却是四个月不断累积的成本。

    场景 3:走掉的那个代理商客户

    一家咨询代理商为某个 B2B 客户微调了一个内容生成模型,训练语料涵盖客户的品牌语气、产品术语、客户画像和行业黑话。交付时,客户给输出的相关性和品牌契合度打了 4.5/5 分。

    半年之后,客户的业务变了:

    • 他们推出了一条新产品线,带着自己的一套术语
    • 目标客群从中端市场转向大型企业
    • 品牌语气也在演进,从轻松随意转向权威专业
    • 行业监管规则变化,需要新的合规表述

    模型写出来的东西还停留在半年前,读着"通用"又"过时"。客户开始大幅改写每一篇生成内容,AI 工具的意义也就消失了。

    客户的月度合同金额是 2,000 美元,耐心已经快耗尽。季度回顾会上的原话是:"一开始感觉很棒,可现在放到我们的场景里,它基本上就是个更差版本的 ChatGPT。"

    代理商面前有两个选择:花 4 到 6 小时重训模型,或者失去一个年费 24,000 美元的客户。他们选了重训,但已经赔进去两个月的信任,合同也差点整个丢掉。

    对代理商来说,教训很直白:微调模型是一份需要持续维护的活资产。维护一停,它就开始贬值。

    缓慢退化的模式

    模型过期很少大张旗鼓地宣告自己,它走的是一条可预测却安静的路径:

    第 1 到 2 个月:性能下降 1% 到 2%,没有人察觉。监控看板一片绿,因为阈值是按重大故障设的。用户可能隐约觉得哪里不对,却说不上来。

    第 3 到 4 个月:性能下降 3% 到 5%,重度用户开始注意到。你偶尔会收到"AI 最近好像没那么准了"或者"它处理 X 不如以前"这类反馈,但都是零散的感受,谈不上紧急。

    第 5 到 6 个月:性能下降 6% 到 10%,聚合指标上已经看得出来。客户满意度评分下滑,支持工单增加,相关方开始问"这个 AI 到底还管不管用"。到这一步,你已经在收拾残局了。

    第 7 个月及以后:模型开始实打实地损害用户体验。它会依据过时的信息,信心十足地给出错误答案。用户对这个模型失去信任,也会连带怀疑 AI 本身的能力。要挽回,重训之外还得把用户信心重新建起来。

    复利式的成本表说明了一切:

    月份准确率下降月度成本(客服机器人示例)累计成本
    1-1%$400$400
    2-2%$1,200$1,600
    3-4%$3,000$4,600
    4-6%$5,200$9,800
    5-8%$7,000$16,800
    6-10%$8,000$24,800

    到第 6 个月,不重训的累计成本是 24,800 美元。而在第 2 个月做一次重训,算力花 200 到 400 美元,人力 4 到 6 小时。重训的回报率在 100 倍这个量级,远高于一般人猜的 10 倍。

    团队为什么不重训

    既然重训的价值这么明显,团队为什么会跳过它?有四个原因:

    "它还能用。" 模型没坏,不报错,不崩溃,照样在出结果。缺少主动监控,退化就是看不见的,而团队不会去修一个看起来完好的东西。

    没有对应的流程。 最初的微调是一个有截止日期、有交付物的项目;重训是一项没有天然截止日期的长期维护。少了流程,也就是排期、触发条件和负责人,它就不会发生。

    数据采集停了。 团队为第一次微调收集并标注了训练数据,模型一上线,采集就停了。现在要重训,得重新组织一轮数据采集,感觉像从头再来一遍。

    它不在任何人的职责范围内。 ML 工程师做了模型,产品团队负责这个功能,运维团队管着基础设施。重训夹在三者中间,没有人对它负责,于是没有人做。

    预防手册

    预防模型过期需要三样东西:排期、监控系统和数据管线。

    按计划重训

    按你所在领域的变化速度定节奏:

    • 每月重训:适用于更新频繁的产品、变化快的行业,或者准确率直接影响满意度的面客应用。
    • 每季度重训:适用于数据变化缓慢的稳定领域、内部工具,或者能容忍准确率小幅下滑的应用。

    对大多数跑在生产环境里的微调模型,每月一次是合理的默认值。成本很低(2 到 4 小时人力加上算力),保护力度却相当可观。

    自动化监控

    没有度量就谈不上重训。把下面这几项的自动监控搭起来:

    • 准确率指标:对生产输出做轮换抽样,每周跟踪准确率。相对基线下降 2% 就要排查,下降 5% 就立刻重训。
    • 用户反馈信号:跟踪点赞/点踩比例、升级率,或者你的应用里任何形式的用户反馈机制。连续两周走低就要排查。
    • 分布漂移检测:把进来的请求分布和训练数据的分布做对比。重合度掉到 80% 以下,说明模型面对的世界已经和它训练时明显不同了。

    持续采集数据

    最重要的习惯是:永远不要停止收集训练数据。每一次生产环境里的交互都是潜在的训练样本。从第一天就把管线搭好:

    1. 记录模型的所有输入和输出
    2. 收集用户反馈(更正、评分、升级)
    3. 定期对生产数据抽样并标注
    4. 持续把校验过的样本加进训练集
    5. 重训的触发条件一旦命中,数据已经就位

    维持着持续数据管线的团队,重训以小时计。任由数据采集荒废的团队,重训要按周算,前提是他们还愿意重训。

    重训的投入产出

    这笔账很直白:

    每月重训的成本:

    • 数据审查与准备:2 到 3 小时
    • 微调算力:50 到 150 美元
    • 评估与部署:1 到 2 小时
    • 合计:3 到 5 小时人力,加每月 50 到 150 美元

    每月重训保护住的价值:

    • 保住的自动化价值:每月 5,000 到 20,000 美元(视应用而定)
    • 省下的支持成本:每月 2,000 到 8,000 美元
    • 客户留存:因情况而异,但丢掉一个客户的损失就超过一整年的重训投入

    两边根本不在一个量级。每月花 4 小时保护每月 10,000 美元的价值,这是一项必需的投入。

    给代理商:重训就是经常性收入

    如果你为客户搭建并部署微调模型,重训就是经常性收入业务的地基。

    一次性的微调项目对应一笔一次性付款;带每月重训的微调项目对应的是一份长期服务合约。客户拿到一个始终保持敏锐的模型,你拿到可预测的月度收入。

    定价要定得合适。单个模型的月度重训,视复杂度收每月 500 到 1,500 美元,覆盖你 3 到 5 小时的人力、算力成本,还留出健康的利润空间。客户付的钱少于一次工单错分事故的代价,你则积累起一批经常性合约。

    把微调当作交付物的代理商,收入总在忙闲两极之间摇摆;把微调当作服务的代理商,做的是可持续的生意。区别就在重训。

    真正的代价

    重训的成本是看得见的:花掉的工时、结算的算力、投入的精力。不重训的成本一直藏着,直到有一天突然显形。它藏在满意度的缓慢下滑里,藏在慢慢变多的支持工单里,藏在那些一声不响就走掉的客户里。

    生产环境里的每一个微调模型都在贬值。真正要回答的问题是:你想以低成本主动重训,还是以高成本被动补救。

    把排期定下来,把管线搭起来,守住你已经创造出来的价值。

    你的模型在一月运行得很好。要确保它到七月依然如此。

    延伸阅读

    就本文向 AI 提问

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading