1、从模型诞生到上线从模型诞生到上线:Ray 在小红书在小红书 AI 数据生数据生产中的算力调度实践产中的算力调度实践演讲人:陈 宇小红书/数据引擎开发工程师关于我关于我Speaker陈陈 宇宇小红书 数据引擎团队数据开发工程师小红书数据引擎小红书数据引擎开发开发工程师工程师,Ray/Flink/DaftRay/Flink/Daft ContributorContributor专注于以 Ray 为统一底座,为 AI 数据生产构建海量、好用、易用的算力供给体系 覆盖训练数据处理、模型后训练、离线批量推理到近线实时推理的全链路。02目录目录Agenda01开篇:为什么一套底座要覆盖全生命周期开篇:为什
2、么一套底座要覆盖全生命周期02Ray Ray 底座能力:统一调度底座能力:统一调度+丰富生态丰富生态03训练数据准备:多引擎协同训练数据准备:多引擎协同04离线刷库:弹性算力的多代演进离线刷库:弹性算力的多代演进05近线增量入库:自研流批引擎近线增量入库:自研流批引擎 Ray Klein Ray Klein06总结:算力供给模式必须匹配业务阶段总结:算力供给模式必须匹配业务阶段一条主线一条主线数据生产数据生产贯穿贯穿模型模型全生命周期全生命周期同一套 Ray 底座,按阶段差异化供给。0301开篇开篇AI数据生产伴随模型的整个生命周期04长在多云环境下的小红书长在多云环境下的小红书海量内容数据
3、多云多地域 分散资源Billion图文笔记社区内容理解10 Billion视频抽帧多模态处理30 Billion物品框电商商品理解多云环境多云环境 业务长在多云/多地域之上 云原生部署,资源天然分散 10w+node 碎片“沙里淘金”业务场景业务场景 社区搜索/商品搜索/内容理解 笔记 Embedding/标签/特征搜索/内容理解:query 召回 排序 结果展示05AI AI 数据生产,贯穿模型研发的完整生命周期数据生产,贯穿模型研发的完整生命周期四个阶段,四种截然不同的算力诉求模型生命周期模型生命周期模型诞生前训练数据准备训练数据准备预训练语料预训练语料SFT SFT 精调数据精调数据稳定
4、常驻稳定常驻+多引擎多引擎模型训练后后训练后训练/RL/RLRollout Rollout 数据生成数据生成+Train+Train 权重计算权重计算Actor Actor 调度调度+弹性弹性 Rollout Rollout模型上线前离线批量刷库离线批量刷库存量数据存量数据一次性批量入库一次性批量入库短期爆发短期爆发+容忍驱逐容忍驱逐模型上线后近线增量入库近线增量入库持续增量数据持续增量数据分钟级实时入库分钟级实时入库持续自适应持续自适应+精确恢复精确恢复核心判断:没有一种供给模式能一劳永逸核心判断:没有一种供给模式能一劳永逸 算力供给必须匹配业务阶段的特征。算力供给必须匹配业务阶段的特征。0
5、602Ray Ray 底座能力底座能力统一调度+丰富生态,一套底座的两块基石08Ray CoreRay Core:把一个集群变成一台:把一个集群变成一台“超级计算机超级计算机”全局资源视图,让调度与通信不再是业务的负担全局资源视图全局资源视图调度器统一掌握集群 CPU/GPU/内存,按需把任务放到最合适的节点任意节点发起任意节点发起任一节点都能发起分布式任务,无中心瓶颈,开发即本地体验高性能通信高性能通信小数据直传、大数据共享内存零拷贝,跨节点搬运开销大幅降低AutoScalerAutoScaler按真实负载自动扩缩容,无需提前规划资源水位09丰富生态:让丰富生态:让“合适的引擎合适的引擎”做
6、做“合适的事合适的事”底座之上,按场景自由组合上层框架Ray Data通用数据并行处理Ray Serve在线/离线模型服务Ray Klein自研流批统一引擎Daft多模态高效格式解析RayDPSpark on Ray 大规模 ShuffleDataJuicer数据质量清洗与过滤关键:业务只写一个脚本,引擎切换由底座统一承接关键:业务只写一个脚本,引擎切换由底座统一承接 框架是手段,统一调度才是底座的价值。框架是手段,统一调度才是底座的价值。10延伸:延伸:RL RL 后训练后训练 Ray Ray 调度调度 Actor+Actor+弹性弹性 Rollout RolloutRollout 占 50