多模态大模型训练长期存在一个让人头疼的矛盾:想省显存就得慢,想快就得烧显存。小红书开源的新方案BigMac,试图把这个问题从”二选一”变成”我全都要”。
BigMac的核心是一套多模态流水并行训练新范式。简单说,它通过一种叫准依赖安全的嵌套流水线设计,重新编排了训练过程中数据和模型的计算顺序,让GPU在同样的时间内干更多的活,还不爆显存。
多模态训练到底难在哪?
多模态模型和纯文本模型不一样。文本模型处理的是一维的token序列,规规矩矩。多模态模型要同时处理文本、图像、视频——不同模态的数据结构不同、计算量不同、内存需求也不同。
打个比方:纯文本训练像是在一条流水线上传送统一规格的零件。多模态训练像是什么?同一流水线上要同时传送零件、布料和液体——每种材料需要的处理时间、容器大小、搬运方式都不一样,一不小心就卡住或者溢出。
传统的流水线并行方法在处理这种”异构”负载时效率很低。要么为了保住显存而空转GPU,要么为了跑满GPU而显存爆炸。BigMac解决的正是这个核心矛盾。
BigMac做了什么?
BigMac的设计思路很巧妙:不是简单地把模型层拆开分到不同GPU上,而是根据多模态负载的特点,设计了一套嵌套流水线调度策略。
它把不同模态的计算任务做了更细粒度的切分和重组,让计算密集型和内存密集型操作错峰执行,GPU始终有活干,但显存峰值被有效压低。
技术上,BigMac提供了全局调度表、无感接口和工具链。对于开发者来说,接入也不复杂——基本能做到”无感切换”。训练脚本改几个参数就能享受到新方案的效率提升。
实测效果
根据小红书公布的测试数据,BigMac在显存占用和训练速度上均优于现有方案。特别是在处理复杂的多模态场景——比如同时训练视觉+语言+视频理解——时,优势更加明显。
在小红书的实际生产环境中,BigMac已经跑通了大规模多模态模型的训练流程,效果验证过关后才选择开源。
开源的意义
小红书在AI领域的存在感这两年越来越强。从dots-note系列推理模型到IMO满分,再到这次开源的BigMac,小红书正在从”社区公司”向”AI公司”转型。
开源BigMac对行业来说有实际价值:多模态是AI的下一波浪潮,但训练基础设施还远没有成熟。一个经过实战验证的流水线并行方案,能让很多团队的模型训练少走弯路。对于中小团队来说,BigMac这样的工具更是直接降低了多模态训练的门槛。
本文地址:https://www.163264.com/14265


微信扫一扫,鼓励一下~