Back to blog
    供应商评估ai-governanceenterprise-ai采购负责任 AI

    如何按治理标准评估 AI 供应商

    大多数 AI 供应商评估都跳过的治理标准:版本控制、审计日志、数据处理、合规支持与退出条款。

    Edward Xi Yang

    大多数企业的 AI 供应商评估都走同一套流程:让模型跑一遍基准任务,针对自己的具体用例评估输出质量,比较报价,再翻一翻安全认证页面。模型表现不错、价格也在预算内,就往下走。

    这套流程是必要的,同时也是不完整的。能力基准告诉你模型在你评估那天能做什么。治理评估告诉你,在企业软件部署实际会持续的 24-36 个月里,你能否安全地依赖这个模型。

    下面就是大多数团队跳过的那套框架:六个治理评估维度,每个维度都配上具体要问的问题。

    基准测试的陷阱

    能力评估这件事已经做得相当成熟。MMLU 分数、GPQA 基准、编码评测、上下文长度测试、多模态能力评估:业界已经有了一整套好用的工具,可以衡量模型在某个时间点上能做什么。

    基准测试不会告诉你的是:模型行为发生变化时供应商会不会通知你,你能把版本锁定多久,供应商一旦处理不当你的数据、你在法律上处于什么位置,合规团队需要的审计轨迹你能不能拿到,以及需求变化时退出的难度有多大。

    这些问题不会出现在基准排行榜上,但它们决定了你的生产部署能不能长期维持下去。

    维度 1:版本控制与变更管理

    模型是会变的。安全性重新校准、性能改进、微调更新,这些都会影响模型行为,而其中大部分发生的时候,并没有新模型发布那样的高调宣告。

    要问的问题:

    模型更新如何通知客户? 要听到具体的答案:发邮件给指定联系人、更新 changelog、变更 API 版本头。"我们会发博客"对企业生产环境的依赖来说是一个不可接受的答案。

    行为变化影响到生产部署之前,你们提前多久告知? 对企业生产系统来说,少于 2 周都太短。4-8 周比较合理。有些供应商会为签了企业合同的客户提供更长的窗口。

    我们能锁定到某个特定的模型版本吗? 大多数供应商都支持。更要紧的是追问一句:能锁多久?3 个月的锁定窗口和 12 个月的锁定窗口是完全不同的两回事。你需要时间来评估新版本、调整提示词,并有计划地完成迁移。

    你们的模型弃用时间线是怎样的? 某个模型版本要停用时,你能提前多久收到通知,又能得到什么迁移支持?这直接决定了你该为迁移的工程工作准备多少预算。

    新模型版本部署到生产之前,你们提供预发布或预览访问吗? 这一点正日益成为面向企业的供应商的差异化优势。有了预览访问,你可以在新版本影响生产系统之前,先用自己的评测集验证一遍。

    维度 2:审计与日志能力

    企业 AI 部署需要审计轨迹。监管机构要看,法务团队要用,风险管理岗位有硬性要求。问题在于供应商能不能提供,还是说你得在供应商那点基础的请求日志上,自己再搭一层审计基础设施。

    你们记录什么、保留多久、访问权限如何控制? 受监管行业的最低要求是:带时间戳的请求和响应日志,按你的审计留存期保存,并有受控的访问权限。很多供应商默认提供 30-90 天留存,而受监管行业可能需要 7 年。

    我们能导出日志,用于自己的合规报告吗? 只存在于供应商系统里的日志,对合规的用处有限。你需要能把结构化日志导出到自己的合规基础设施里。

    你们提供审计级别的日志吗? 这意味着日志不可篡改(写入之后无法修改)、带有可验证的时间戳、结构化便于程序分析,并配有保管链文档。这比标准的请求日志要求更高,能达标的供应商是少数。

    日志里包含哪些模型版本信息? 出于审计目的,你需要能还原出某一条输出究竟是由哪个模型版本产生的。如果日志里没有足够细粒度的模型版本标识,你的审计轨迹就有一处缺口。

    维度 3:战略一致性与使命稳定性

    这个维度在 2026 年变得更受关注,但它一直都重要。你的 AI 供应商是谁、服务的是哪些人、往哪个方向走,会影响他们的模型被训练和优化成什么样子。

    按行业划分,你们的主要客户是谁? 最大客户集中在医疗和金融服务的供应商,和最大客户集中在国防与政府的供应商,训练优先级是不一样的。两者都没有对错之分,但这种优先级与你的用例是否契合,需要你自己判断。

    你们有没有公开承诺过不支持哪些用例? 有明确、公开的用例限制的供应商,说明他们把自己的使命想清楚了,并且落到了可执行的层面。只有"负责任 AI"这类含糊表述而拿不出具体承诺的,对你的风险评估帮助有限。

    你们的融资结构是怎样的,投资人的诉求会如何影响产品方向? 拿了风投的公司会承受进入新市场的增长压力,而这种压力会影响他们卖给谁、开发什么能力。做 3 年期的依赖规划时,弄清楚谁在给这家供应商出钱、他们又期待什么,是有意义的。

    过去 12 个月里,你们签下了哪些重要合同或合作? OpenAI 的美国国防部合同是眼下最显眼的例子,但影响训练优先级的供应商合作和客户关系,往往要隐蔽得多。这个问题能把它们问出来。

    这个维度的答案,帮你判断供应商的战略取向与你所在组织的风险偏好之间的匹配程度,而不是去评判某个具体决定的对错。

    维度 4:数据治理

    这个维度经常被放在安全认证的框架里评估,但认证说明的只是某一时刻的控制措施状态。治理层面的问题要问得更深。

    我们的数据会被用于模型训练吗? 很多供应商已经改成默认不使用的模式,企业数据除非你主动选择加入,否则不进入训练。这一点要明确核实,并且落成书面文字:不只写在隐私政策里,而要写进你的合同。

    我们的数据在哪里处理,有哪些数据驻留选项? 对有数据本地化要求的组织来说,受 GDPR 约束的欧盟客户、所在国有严格数据主权法律的组织、对处理地点有明确规定的受监管行业,这都是一条硬约束,而非偏好。

    账户终止之后,我们的数据会怎样? 你要的是具体答案:终止后 X 天内删除你的数据,并提供书面确认。"我们按隐私政策处理"这种说法不够具体。

    在你们组织内部,谁能访问我们的数据? 支持工程师?数据科学团队?模型训练流水线?把访问面摸清楚。

    过去 24 个月里,你们有没有发生过涉及企业客户数据的安全事件? 直接问,同时独立查证新闻来源。答案本身和供应商的披露态度,都能说明问题。

    维度 5:监管合规支持

    帮助你所在组织履行自身监管义务的合规文档,和供应商自己做到合规,是两件事。两者都重要。

    你们有 EU AI Act 的合规框架吗? 对在欧盟有业务的组织来说,EU AI Act 同时对 AI 提供者和部署者施加了义务。要弄清楚哪些由供应商提供,哪些仍然是你的责任。

    你们能支持我们特定的监管要求吗? 医疗领域:HIPAA、是否提供 BAA,以及临床系统的具体要求。金融服务领域:SR 11-7 模型风险管理指引,以及你所属监管机构对 AI 的具体指导。法律领域:律师协会对 AI 使用的指引。要针对你自己的具体要求提问,而非笼统地问"合规"支持。

    你们提供我们可以用在自己审计里的合规文档吗? 可直接用于审计的材料,比如供应商风险问卷回复、安全评估报告、控制措施鉴证,能为你自己的合规流程省下大量时间。有些供应商会主动为企业客户备好这些,另一些则要你从他们的原始政策文档里自己整理。

    安全事件的披露时限是多久? 监管要求往往规定了通知客户的具体时限(例如 GDPR 下的 72 小时)。要知道供应商会给你什么,以及这是否够你履行自己的通知义务。

    维度 6:退出策略

    没有哪段供应商关系是永久的。监管要求会变,更好的选择会出现,供应商也会做出改变双方关系的战略决定。你的采购框架应该在真正需要退出之前,就先把退出这件事评估清楚。

    如果我们需要切换,模型迁移是什么样子? 要具体:迁移路径是什么,有哪些文档,供应商提供什么支持,一次企业级迁移通常要花多久?

    我们能把微调的成果带走吗? 如果你通过供应商的微调 API 投入做了模型定制,你拿到的是权重,还是只有性能上的好处?有些供应商会把微调后的权重给你,有些则只留给你效果。

    我们所做的定制有多少可迁移性? 系统提示词、少样本示例、检索配置,一般都是可以带走的。微调后的模型权重、自定义函数调用定义、供应商专有功能,可能就带不走。

    如果你们被收购,我们的集成会怎样? 收购对供应商行为的改变,几乎超过其他任何事情。要明确问清楚:你的合同里有哪些针对被收购情形的保护条款。

    模型所有权这条退路

    如果你发现自己在好几个治理维度上都对某家供应商没底,务实的做法往往是换一条路:把 API 用在开发和实验阶段,那里的治理风险是可控的;而对治理确定性真正要紧的生产工作负载,则朝着自有模型去建设。

    当你拥有模型权重时,上面这些治理问题对你的生产系统大多就不再相关了。版本控制就是你自己的版本控制。审计日志就是你自己的审计日志基础设施。战略取向就是你所在组织的取向。数据治理就是你的数据放在你自己的基础设施上。

    通往模型所有权的路径,详见 AI 模型所有权到底意味着什么企业 AI 供应商风险指南 讲的是治理风险在整体风险框架中的位置。

    让评估真正落地

    这套框架只有落进流程里才有用。具体做法是:

    把治理问题加进你标准的供应商问卷。为每个维度建立打分细则。要求对方书面回复,而不只是在销售会议上给一句口头保证。把治理评估结果纳入 AI 采购决策的文档留痕。

    每年复核一次供应商治理评估,供应商发布重大消息时也要复核。像重大政府合同、被收购、大额融资这类供应商的战略决定,都值得启动一次计划外的复核。

    而对于高风险场景,也就是临床、法律、金融和受监管的业务运营,治理评估要拿出评估关键基础设施供应商时同等的严谨态度。因为生产环境里的 AI 就是关键基础设施。

    查看定价 →

    与 Ertas 预约发现会议 →

    就本文向 AI 提问

    Ship AI that runs on your users' devices.

    Free plan with 30 credits/mo, no card required. Paid plans from $10/mo USD.

    Keep reading