当前位置:首页 > 报告详情

训推一体潮汐弹性:蚂蚁集团在智算基础设施的池化调度实践 吴伟.pdf

上传人: 散** 编号:1277198 2026-07-11 36页 9.24MB

1、训推体潮汐弹性 蚂蚁集团在智算基础设施的池化调度实践演讲:吴伟蚂蚁集团/级技术专家录010203040506为什么做训推体潮汐弹性?训推体潮汐弹性整体架构关键技术:训推集群升级关键技术:推理服务动弹性关键技术:弹性配额和抢占总结和展望01020304050601为什么做训推体潮汐弹性?蚂蚁集团 AI 业务介绍Ling-2.6-1TLing-2.6-FlashRing-2.6-1TMing-Flash-Omni百灵模型灵光蚂财Agents数据处理预训练(语/多模)后训练(SFT/RL)模型评测模型推理Agent 应GPU 资源分配训练/推理任务调度集群管理和升级任务弹性和抢占 多 AIDC 集群

2、(多云多地域)异构算(NV 卡和国产卡)通智算(GPU+CPU)AI 业务技术流程资源编排AIDCAI 诊室安诊报告解读就医服务闪应灵光圈打电话开眼持仓分析AI 策略AI 选股训推分离的资源管理训练平台推理平台Job controllerWorkflow controllerData managerModel controllerModel routerModel AutoscalerGPU NodeGPU NodeGPU NodeGPU NodeGPU NodeGPU NodeK8s clusterK8s cluster技术栈不同资源墙资源归属不同业务节奏不同常情况下,训练任务晚上任务堆积,

3、法使推理集群的空闲资源活动场景下,推理服务法使训练集群资源来满资源需求常天训练/推理资源情况推理集群 GPU 利率训练任务排队数量训推体的核思路训推体不是简单的任务混部,是在不影响推理 SLO 的同时挤出训练算。训练平台推理平台Job controllerWorkflow controllerData managerModel controllerModel routerModel AutoscalerGPU NodeGPU NodeGPU NodeK8s clusterGPU NodeGPU NodeGPU Node02训推体潮汐弹性案训推体潮汐弹性整体架构03关键技术:训推集群升级集群训推

4、体升级:异构算池化k8s 管控层节点层kubeletcontainerdgpu-device-pluginlog/trace collectorcsi-plugin(data/model/kvcache/image)network plugins(Ethernet/RDMA)etcdapiserverschedulercontrollerswebhooks训练管控Job controllerqueueWorkflow controllerData manager推理管控model controllermodel routermodel autoscalerOS kernelCUDA Drive

5、r任务管控层不统就法实现真正混部:不同版本的库、驱动、内核会让训推任务为不可预测。硬件层GPU/国产卡A/国产卡BHBM/Memory/Disk/OSSNVLink/RDMA/PCIE/Ethernet集群训推体升级:络冲突AIDC 集群节点节点节点节点节点训练任务-A训练任务-A推理服务-B推理服务-B训练任务C推理服务 D参数络(RDMA)业务络(Ethernet)Agent 业务外部服务(oss/image/model)prompt 请求Activation/KVCacheGradientsImage/video/audioImage/video/audio冲突点:南北向出流量竞争训练:

6、拉数据(图/视频)+镜像推理:户流量+拉数据(多模态)+镜像冲突点:参数 RDMA 拥塞训练:梯度传递推理:KVCache 同步+Activation 同步集群训推体升级:络QoS+拓扑调度04关键技术:推理服务动弹性ModelServiceModelService推理服务动弹性:架构图Model Router KVCache-Aware Scheudling Prefill-Decode Aware Rate limit&SLO AwareDeepseek-V4Deepseek-V4Deepseek-V4GLM5.1GLM5.1GLM5.1Model Autoscaler Real-time

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **训推一体潮汐弹性**:蚂蚁集团通过统一K8s集群,解决训练与推理资源墙问题,实现资源混部,提升GPU利用率10%,训练任务等待时间降低20%。 2. **关键技术**: - **集群升级**:异构算力池化,统一管控层(kubelet、CUDA等)和网络QoS,避免RDMA拥塞。 - **推理弹性**:多指标决策(TPS、KVCache利用率等),模型极速启动(优化后Deepseek-R1启动时间从6min降至3min),SLO保障。 - **配额抢占**:高保/低保分级配额,任务级抢占与拓扑感知调度。 3. **成果**:推理服务SLO达标率99%,QPM提升,实际弹性GPU资源利用率优化。 4. **规划**:向全局调度、任务级弹性、万卡/10min级弹性演进。
**训推一体?** **弹性调度?** **GPU利用率?**
客服
商务合作
小程序
服务号
折叠