如何将AI工作负载从云端迁移到本地:企业手册
分阶段、逐步指南,将AI工作负载从云迁移到本地基础设施。涵盖工作负载分类、基础设施规划、数据管道迁移和常见陷阱。
把 AI 工作负载从云端搬到本地,是一连串审慎的动作,每一步都有各自的风险画像和回报。想一次性全搬完的组织,也就是所谓「大爆炸」式迁移,结局往往是工期延误、预算超支、生产系统被打断。按阶段推进的组织,迁移速度反而更快,运营风险也更低。
本手册讲清楚三件事:云端到本地的 AI 迁移分成哪六个阶段;用什么样的工作负载分类框架,来决定哪些负载该搬、按什么先后顺序搬;以及连经验丰富的基础设施团队也照样会踩的那几个坑。
开始之前:迁移前检查清单
在投入资源之前,先把三个问题答清楚。
1. 你到底花了多少钱? 多数组织把自己的云端 AI 支出低估了 30% 到 50%,因为这笔钱分散在计算、存储、出网流量、托管服务和监控等好几个账户里。把 6 个月的账单数据拉出来,逐条给每一项与 AI 相关的开销归类。周边服务同样要算进去:向量数据库、日志管道、密钥管理服务,还有推理端点前面那台负载均衡器。
2. 你的约束条件是什么? 数据主权要求、延迟 SLA、合规规定、网络架构限制、机房容量,这些都会决定迁移方案的形状。选硬件之前先把它们写下来。
3. 你的时间线是什么? 硬件采购要 4 到 12 周,具体看 GPU 的供货情况。机房准备(供电、制冷、机柜空间)可能更久。如果你要求 30 天内完成迁移,那你已经晚了。从决策到承接生产流量,第一阶段迁移的现实时间线是 8 到 16 周。
阶段 1:审计当前的云端 AI 工作负载与成本
审计阶段产出两份交付物:一份完整的工作负载清单,一份成本归因模型。
工作负载清单
对每一个跑在云上的 AI 工作负载,记录以下内容:
- 负载类型:推理、微调、训练、数据准备、嵌入向量生成、评估
- 计算画像:GPU 型号、实例数量、平均利用率、峰值利用率
- 数据特征:输入数据量、输出数据量、数据敏感度分级、存储占用
- 性能要求:p50/p95/p99 延迟、吞吐(每秒请求数或每秒 token 数)、可用性 SLA
- 依赖项:所消耗的其他云服务(存储、数据库、队列、监控)
- 使用模式:持续运行、定时批处理、按需突发
成本归因
把云端支出的每一块钱都对应到具体的工作负载上。这件事做起来比听上去难,因为云厂商的账单是把各项服务的费用汇总在一起出的。如果你已经打好了成本分摊标签,就直接用标签来拆;如果没有,就从资源用量指标反推出归属关系。
目标是得到这样一张表:
| 工作负载 | 每月计算 | 每月存储 | 每月出网 | 每月其他 | 每月合计 |
|---|---|---|---|---|---|
| 生产推理(模型 A) | 8,400 美元 | 1,200 美元 | 320 美元 | 600 美元 | 10,520 美元 |
| 批量数据准备 | 3,200 美元 | 2,800 美元 | 90 美元 | 400 美元 | 6,490 美元 |
| 微调(每周) | 1,800 美元 | 400 美元 | 20 美元 | 200 美元 | 2,420 美元 |
| 嵌入向量生成 | 2,100 美元 | 600 美元 | 150 美元 | 300 美元 | 3,150 美元 |
| 评估管道 | 400 美元 | 100 美元 | 10 美元 | 50 美元 | 560 美元 |
| 合计 | 15,900 美元 | 5,100 美元 | 590 美元 | 1,550 美元 | 23,140 美元 |
后面每一个决策都建立在这张表上。没有它,你只是在猜。
阶段 2:工作负载分类
并非每个工作负载都该搬到本地。这套分类框架从四个维度逐一给每个负载打分:
| 维度 | 1 分(留在云上) | 3 分(待评估) | 5 分(迁到本地) |
|---|---|---|---|
| 数据敏感度 | 公开或不敏感 | 内部使用,风险低 | 受监管、含 PII、机密 |
| 利用率模式 | 突发型,平均低于 30% | 中等,30% 到 60% | 持续型,高于 60% |
| 延迟要求 | 500ms 以上可接受 | 100ms 到 500ms | 必须低于 100ms |
| 成本走势 | 稳定或下降 | 温和增长 | 年增长超过 20% |
给每个工作负载打分。总分 16 到 20 分的,是立刻迁移的有力候选。10 到 14 分的,列入第二批迁移。低于 10 分的,留在云上。
产出是一份排好优先级的迁移队列。
第一梯队(最先迁移):
- 处理敏感数据的数据准备管道
- 有延迟要求的高利用率推理负载
- 负有数据主权合规义务的负载
第二 梯队(其次迁移):
- 基于专有数据的微调负载
- 面向内部知识库的嵌入向量生成
- 成本持续攀升的批处理
第三梯队(以后再评估):
- 实验性和研发类负载
- 低频批处理作业
- 需求模式难以预测的负载
阶段 3:搭建本地基础设施
把工作负载的各项需求都记录清楚之后,就可以着手确定硬件规格了。
选型参考
- 仅推理(单个 7B 到 70B 模型):1 台服务器,配 4 到 8 块 GPU(L40S 或 A100)
- 推理加微调(单模型,每周微调一次):1 到 2 台服务器,配 8 块 GPU(A100 或 H100)
- 多模型加数据准备:2 到 4 台服务器,GPU 分档混配
- 完整管道(数据准备、训练、推理、评估):4 台以上服务器,按角色专用
基础设施检查清单
- GPU 服务器已下单,交付时间已确认
- 机柜空间已分配,供电充足(GPU 服务器每机柜 30 到 50kW)
- 制冷能力已核实(GPU 服务器发热量很大)
- 网络:服务器之间至少 25GbE,多节点训练用 100GbE
- 存储:活跃负载用高速 NVMe,数据集用 NAS 或 SAN
- 操作系统与驱动:CUDA 工具包、容器运行时(Docker/Podman)
- 编排:带 GPU operator 的 Kubernetes,或裸金属管理
- 监控:Prometheus/Grafana 或同类方案,覆盖 GPU 利用率、温度、显存