如何按治理标准评估 AI 供应商
大多数 AI 供应商评估都跳过的治理标准:版本控制、审计日志、数据处理、合规支持与退出条款。
大多数企业的 AI 供应商评估都走同一套流程:让模型跑一遍基准任务,针对自己的具体用例评估输出质量,比较报价,再翻一翻安全认证页面。模型表现不错、价格也在预算内,就往下走。
这套流程是必要的,同时也是不完整的。能力基准告诉你模型在你评估那天能 做什么。治理评估告诉你,在企业软件部署实际会持续的 24-36 个月里,你能否安全地依赖这个模型。
下面就是大多数团队跳过的那套框架:六个治理评估维度,每个维度都配上具体要问的问题。
基准测试的陷阱
能力评估这件事已经做得相当成熟。MMLU 分数、GPQA 基准、编码评测、上下文长度测试、多模态能力评估:业界已经有了一整套好用的工具,可以衡量模型在某个时间点上能做什么。
基准测试不会告诉你的是:模型行为发生变化时供应商会不会通知你,你能把版本锁定多久,供应商一旦处理不当你的数据、你在法律上处于什么位置,合规团队需要的审计轨迹你能不能拿到,以及需求变化时退出的难度有多大。
这些问题不会出现在基准排行榜上,但它们决定了你的生产部署能不能长期维持下去。
维度 1:版本控制与变更管理
模型是会变的。安全性重新校准、性能改进、微调更新,这些都会影响模型行为,而其中大部分发生的时候 ,并没有新模型发布那样的高调宣告。
要问的问题:
模型更新如何通知客户? 要听到具体的答案:发邮件给指定联系人、更新 changelog、变更 API 版本头。"我们会发博客"对企业生产环境的依赖来说是一个不可接受的答案。
行为变化影响到生产部署之前,你们提前多久告知? 对企业生产系统来说,少于 2 周都太短。4-8 周比较合理。有些供应商会为签了企业合同的客户提供更长的窗口。
我们能锁定到某个特定的模型版本吗? 大多数供应商都支持。更要紧的是追问一句:能锁多久?3 个月的锁定窗口和 12 个月的锁定窗口是完全不同的两回事。你需要时间来评估新版本、调整提示词,并有计划地完成迁移。
你们的模型弃用时间线是怎样的? 某个模型版本要停用时,你能提前多久收到通知,又能得到什么迁移支持?这直接决定了你该为迁移的工程工作准备多少预算。
新模型版本部署到生产之前,你们提供预发布或预览访问吗? 这一点正日益成为面向企业的供应商的差异化优势。有了预览访问,你可以在新版本影响生产系统之前,先用自己的评测集验证一遍。
维度 2:审计与日志能力
企业 AI 部署需要审计轨迹。监管机构要看,法务团队要用,风险管理岗位有硬性要求。问题在于供应商能不能提供,还是说你得在供应商那点基础的请求日志上,自己再搭一层审计基础设施。
你们记录什么、保留多久、访问权限如何控制? 受监管行业的最低要求是:带时间戳的请求和响应日志,按你的审计留存期保存,并有受控的访问权限。很多供应商默认提供 30-90 天留存,而受监管行业可能需要 7 年。
我们能导出日志,用于自己的合规报告吗? 只存在于供应商系统里的日志,对合规的用处有限。你需要能把结构化日志导出到自己的合规基础设施里。
你们提供审计级别的日志吗? 这意味着日志不可篡改(写入之后无法修改)、带有可验证的时间戳、结构化便于程序分析,并配有保管链文档。这比标准的请求日志要求更高,能达标的供应商是少数。
日志里包含哪些模型版本信息? 出于审计目的,你需要能还原出某一条输出究竟是由哪个模型版本产生的。如果日志里没有足够细粒度的模型版本标识,你的审计轨迹就有一处缺口。