前沿资讯分享|第一期 多模态大模型动态负载训练框架 & CPU-GPU异构具身智能仿真强化学习框架
导读
当前,大模型与具身机器人训练工作中,性能瓶颈已不再局限于算子运算速度。训练负载动态波动、硬件资源静态绑定的矛盾,持续造成算力闲置、显存溢出、流水线阻塞等问题。
本文带来两项前沿训练系统研究成果,分别针对生产级多模态大模型超规模训练、机器人强化学习异构仿真训练场景。两套方案应用场景不同,但核心设计思路保持一致:围绕真实负载需求动态调度算力,突破传统静态资源划分带来的性能局限。
一、MegaScale-Omni:动态负载下的多模态训练系统
研究痛点
主流多模态大模型普遍采用模态编码器搭配LLM主干的基础架构,训练负载存在两层明显波动特征:
第一,多模态大模型训练中,encoder 和 LLM backbone 的压力会随训练阶段快速变化。图像比例升高会压向 ViT,长文本比例升高会压向 LLM,音频或视频比例变化又会带来另一类 encoder bottleneck;
第二,样本长度分布差异显著:不同图像数据集编码长度最大相差2.71倍,音频与文本样本平均长度差距可达17.6倍。Megatron-LM、DistMM等传统静态并行调度方案难以适配持续变化的负载,极易出现单阶段显存溢出、整体训练吞吐大幅下降的情况。

图 1:多阶段训练中的模态比例变化、样本长度变化和吞吐退化
核心设计
MegaScale-Omni 的核心思想是 encoder-LLM multiplexing:encoder 和 LLM colocate 在同一批 GPU 上,通过时间维度分时复用,而不是把资源静态绑定到某个模态或某个 pipeline stage。

图 2:MegaScale-Omni 系统架构
- LSSP:在 microbatch 内按长度划分短/长样本。短样本走 DP,长样本走 SP;通过 temporal state shifting 避免频繁模型 resharding。
- Uniform insertion:将 encoder microbatch 均匀插入不同 LLM stages,避免某个 stage 的 encoder 延迟放大成全局 pipeline bubble。
- Grouped reordering:去中心化 data loader 下,按网络 locality 分组,在组内 all-gather metadata、局部排序并 all-to-all 交换样本。
实验结果
实验包含 512 GPU 的 Cluster-A,以及生产级千卡 Cluster-B。MegaScale-Omni 在不同 GPU scale 和 image-text ratio 下均优于 baseline。
|
GPU Scale |
最高吞吐提升 |
|
64 GPU |
1.54x |
|
128 GPU |
3.30x |
|
256 GPU |
7.57x |
|
512 GPU |
1.98x |
长序列场景下,Workload-C 在 16K / 32K 下最高提升 6.88x / 4.72x;第一 pipeline stage 显存最多降低 2.21x。

图 3:不同规模与模态比例下的训练吞吐提升
二、MuJoCoUni + UniLab:CPU-Sim / GPU-Learn 的机器人 RL 系统
研究痛点
现阶段机器人强化学习主流方案采用全GPU训练架构,物理仿真、轨迹采样、策略更新流程全部运行于GPU。虽能减少数据搬运开销,但仿真任务与模型更新会争抢单卡算力,互相制约训练效率。
该研究提出全新异构协同思路:通过底层批量运行时优化CPU仿真能力,再将仿真采集流程与GPU学习器解耦,实现跨硬件高效协同训练。
核心设计
MuJoCoUni 的核心是 BatchEnvPool:在 C++ 层持有 env pool,通过 thread pool 批量 dispatch MuJoCo calls,降低 Python 高频调用成本,同时保持 env/model across calls。

图 4:MuJoCoUni 架构,BatchEnvPool 在 C++ 层维护环境池和并行 worker
- MuJoCoUni 提供 multi-step 模式,默认只返回 final state / final sensor,减少不必要的数据路径。
- reset(env_ids, initial_state, randomization) 支持 sparse reset 和 reset-time model patching;在 4096 env 下,full reset 从 53ms 降到 partial reset 的 3.5ms。
- UniLab 使用 shared memory ring buffer 解耦 rollout 和 update;APPO 允许 learner 使用稍旧策略数据,从而 overlap collection and update。

图 5:UniLab 系统架构
实验结果
实验显示,CPU simulator 在单步性能上并不弱于 GPU simulator。端到端训练中,UniLab 在多个任务上取得明显加速。
|
Task |
Representative Speedup |
|
G1 Flip |
~3.3x |
|
G1 Walk Flat |
~8.4x |
|
G1 Motion Tracking |
~11.0x |
Training-cycle placement ablation 中,UniLab + MuJoCoUni 的 cycle end 为 39.25 ms,明显低于 UniLab + MJWarp 的 102.37 ms 和 Holosoma + MJWarp 的 94.61 ms。原因是 CPU simulator 与 GPU learner 天然分离,不会争抢同一块 GPU;GPU simulator 如果与 learner update 放在同一块 GPU 上,反而可能相互拖慢。

图 6:UniLab 在代表性机器人控制任务上的端到端训练效率提升
三、本次分享要点总结
1.对于 MegaScale-Omni,值得关注的是它将多模态训练中的动态 workload 作为系统设计的中心问题:通过 encoder-LLM colocation 复用 GPU 资源,用 LSSP 处理长短样本差异,用 uniform insertion 稳定 joint pipeline,并通过 grouped reordering 在去中心化加载下做局部负载均衡。
2.对于 MuJoCoUni + UniLab,值得关注的是它重新评估了机器人 RL 中 CPU simulation 的系统价值:MuJoCoUni 将 MuJoCo 仿真做成 C++ batched runtime,降低 Python/env/reset 开销;UniLab 再通过 shared memory ring buffer 和 APPO 解耦 CPU rollout 与 GPU learner update,使 simulation 和 learning 更充分重叠。
📌 栏目预告
本栏目定期推送大模型、具身智能领域前沿训练系统与学术成果解读,持续分享行业最新科研进展,欢迎持续关注。
更多推荐

所有评论(0)