China Merchants Bank 凭借基于 Kubernetes 的 AI 训练与推理一体化实践,在 CNCF 最终用户案例研究大赛中胜出
![]() |
全新云原生平台将加速卡算力平均利用率由 35% 提升至超过 60%,每处理 100 万个 token 的推理成本下降逾 60%
核心亮点
- 中国领先商业银行之一 China Merchants Bank 在 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026 的 CNCF 最终用户案例研究大赛中胜出。
- 获奖方案基于 Kueue、KEDA、Prometheus、HAMi 和 Fluid 构建 Kubernetes 统一控制平面,支持 AI 训练、微调和在线推理共享近 1 万张异构加速卡。
- 通过将 99% 的加速卡算力资源纳入统一框架,该行将平均利用率由 35% 提升至超过 60%,并将每处理 100 万个 token(输入和输出合计)的成本降低逾 60%。
- 该行自主研发的 Twinkle 训练框架默认支持 5 个 LoRA 租户共享 1 个基座模型实例,使该配置下的加速卡资源用量减少 80%,训练密度提高至原来的 5 倍。
上海2026年9月8日 美通社 -- Cloud Native Computing Foundation®(CNCF®)今日宣布,中国领先商业银行之一 China Merchants Bank 在 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026 的 CNCF 最终用户案例研究大赛中胜出。
CNCF 首席技术官 Chris Aniszczyk 表示:“随着 AI 工作负载不断拓展至金融等关键基础设施领域,支撑这些负载的核心技术必须发挥更大效能,同时避免成本成倍增长。China Merchants Bank 统一 AI 训练与推理的实践清晰地表明,基于 CNCF 项目构建的可组合、厂商中立基础设施,能够在大规模应用中实现可量化的效率提升。”
China Merchants Bank 的 AI 基础设施团队将 Kubernetes 与 Kueue、KEDA、Prometheus、HAMi 和 Fluid 相结合,构建统一控制平面,让模型训练、微调和在线推理共享近 1 万张异构加速卡。通过与数据中心及其他团队密切协作,该团队将全行 99% 的加速卡算力资源纳入统一框架,使近 1 万张加速卡的平均利用率由 35% 提升至超过 60%。同时,在模型和服务条件可比的情况下,每处理 100 万个 token(输入和输出合计)的成本下降逾 60%。
China Merchants Bank AI 基础设施架构师 PeiXiang Tan 表示:“在 China Merchants Bank,我们通过软件创新释放硬件潜能。平台构建于统一的云原生基础架构之上,集异构算力池化、训练作业调度、推理弹性扩缩容、数据与模型访问加速,以及端到端可观测能力于一体。这使训练和推理能够根据各自工作负载的特点运行,同时保持紧密协同,让每一份算力持续创造更大价值。”
随着 AI 在金融领域的应用场景不断拓展,China Merchants Bank 发现,训练、推理和多租户微调对同一套硬件有着显著不同的需求。分布式训练需要稳定、可预测的算力供给,但在等待其余工作节点或加速卡就绪时,算力可能出现闲置;在线推理则需要根据难以预测的流量变化快速扩缩容。为协调这些相互竞争的资源需求,该行构建了一套可组合架构,在共享基础设施的同时,将训练与推理的运行时解耦:Kueue 负责训练作业的准入、队列和配额管理,避免作业在具备运行条件前预占算力;KEDA 和 Prometheus 根据实时需求信号,对在线推理服务进行扩缩容;HAMi 以细粒度方式为训练和推理两条执行路径分配共享加速卡资源;Fluid 则加速对数据集、模型权重和检查点的访问,减少加速卡等待数据的时间。
China Merchants Bank 自主研发的 Twinkle 训练框架进一步提升了多租户微调的效率,默认支持 5 个 LoRA 租户共享 1 个基座模型实例。通过将基座模型副本数从 5 个减少至 1 个,该配置下的加速卡资源用量降低了 80%,训练密度则提高至原来的 5 倍。
China Merchants Bank 此前曾发布多篇有关 AI 基础设施实践的 CNCF 案例研究。其中一篇详细介绍了基于 Kubernetes 和 HAMi 的调度平台:该平台通过拓扑感知调度,实现了 100% 的硬件资源池利用率,并使分布式训练工作负载的跨机器调度减少 30%。
China Merchants Bank 计划在现有成果的基础上持续推进,重点聚焦四个方向:一是动态调整多租户训练并发度;二是整合利用率、队列状态和时延信号,实施以单位成本为依据的容量管理;三是扩展 KEDA 以支持无服务器推理,使推理服务能够在需求高峰间隙缩容至零;四是扩大基于 HAMi 的异构加速器支持范围,同时接入更多训练和推理后端。
China Merchants Bank 的获奖消息已在 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 的一场主题演讲中现场公布。
如需了解完整的架构实现及后续成效,请阅读 China Merchants Bank 的完整案例研究。
更多资源


最近的上海楼市“神仙打架”,大批单价“15万+”甚至“17万+”豪宅抢跑入市