导读

当前,大模型与具身机器人训练工作中,性能瓶颈已不再局限于算子运算速度。训练负载动态波动、硬件资源静态绑定的矛盾,持续造成算力闲置、显存溢出、流水线阻塞等问题。

本文带来两项前沿训练系统研究成果,分别针对生产级多模态大模型超规模训练、机器人强化学习异构仿真训练场景。两套方案应用场景不同,但核心设计思路保持一致:围绕真实负载需求动态调度算力,突破传统静态资源划分带来的性能局限。

一、MegaScale-Omni:动态负载下的多模态训练系统

研究痛点

主流多模态大模型普遍采用模态编码器搭配LLM主干的基础架构,训练负载存在两层明显波动特征:

第一,多模态大模型训练中,encoder 和 LLM backbone 的压力会随训练阶段快速变化。图像比例升高会压向 ViT,长文本比例升高会压向 LLM,音频或视频比例变化又会带来另一类 encoder bottleneck;

第二,样本长度分布差异显著:不同图像数据集编码长度最大相差2.71倍,音频与文本样本平均长度差距可达17.6倍。Megatron-LM、DistMM等传统静态并行调度方案难以适配持续变化的负载,极易出现单阶段显存溢出、整体训练吞吐大幅下降的情况。

图 1:多阶段训练中的模态比例变化、样本长度变化和吞吐退化

核心设计

MegaScale-Omni 的核心思想是 encoder-LLM multiplexing:encoder 和 LLM colocate 在同一批 GPU 上,通过时间维度分时复用,而不是把资源静态绑定到某个模态或某个 pipeline stage。

2MegaScale-Omni 系统架构

  • LSSP:在 microbatch 内按长度划分短/长样本。短样本走 DP,长样本走 SP;通过 temporal state shifting 避免频繁模型 resharding。
  • Uniform insertion:将 encoder microbatch 均匀插入不同 LLM stages,避免某个 stage 的 encoder 延迟放大成全局 pipeline bubble。
  • Grouped reordering:去中心化 data loader 下,按网络 locality 分组,在组内 all-gather metadata、局部排序并 all-to-all 交换样本。

实验结果

实验包含 512 GPU 的 Cluster-A,以及生产级千卡 Cluster-B。MegaScale-Omni 在不同 GPU scale 和 image-text ratio 下均优于 baseline。

GPU Scale

最高吞吐提升

64 GPU

1.54x

128 GPU

3.30x

256 GPU

7.57x

512 GPU

1.98x

长序列场景下,Workload-C 在 16K / 32K 下最高提升 6.88x / 4.72x;第一 pipeline stage 显存最多降低 2.21x。

图 3:不同规模与模态比例下的训练吞吐提升

二、MuJoCoUni + UniLab:CPU-Sim / GPU-Learn 的机器人 RL 系统

研究痛点

现阶段机器人强化学习主流方案采用全GPU训练架构,物理仿真、轨迹采样、策略更新流程全部运行于GPU。虽能减少数据搬运开销,但仿真任务与模型更新会争抢单卡算力,互相制约训练效率。

该研究提出全新异构协同思路:通过底层批量运行时优化CPU仿真能力,再将仿真采集流程与GPU学习器解耦,实现跨硬件高效协同训练。

核心设计

MuJoCoUni 的核心是 BatchEnvPool:在 C++ 层持有 env pool,通过 thread pool 批量 dispatch MuJoCo calls,降低 Python 高频调用成本,同时保持 env/model across calls。

图 4:MuJoCoUni 架构,BatchEnvPool 在 C++ 层维护环境池和并行 worker

  • MuJoCoUni 提供 multi-step 模式,默认只返回 final state / final sensor,减少不必要的数据路径。
  • reset(env_ids, initial_state, randomization) 支持 sparse reset 和 reset-time model patching;在 4096 env 下,full reset 从 53ms 降到 partial reset 的 3.5ms。
  • UniLab 使用 shared memory ring buffer 解耦 rollout 和 update;APPO 允许 learner 使用稍旧策略数据,从而 overlap collection and update。

图 5:UniLab 系统架构

实验结果

实验显示,CPU simulator 在单步性能上并不弱于 GPU simulator。端到端训练中,UniLab 在多个任务上取得明显加速。

 

Task

Representative Speedup

G1 Flip

~3.3x

G1 Walk Flat

~8.4x

G1 Motion Tracking

~11.0x

Training-cycle placement ablation 中,UniLab + MuJoCoUni 的 cycle end 为 39.25 ms,明显低于 UniLab + MJWarp 的 102.37 ms 和 Holosoma + MJWarp 的 94.61 ms。原因是 CPU simulator 与 GPU learner 天然分离,不会争抢同一块 GPU;GPU simulator 如果与 learner update 放在同一块 GPU 上,反而可能相互拖慢。

6UniLab 在代表性机器人控制任务上的端到端训练效率提升

三、本次分享要点总结

1.对于 MegaScale-Omni,值得关注的是它将多模态训练中的动态 workload 作为系统设计的中心问题:通过 encoder-LLM colocation 复用 GPU 资源,用 LSSP 处理长短样本差异,用 uniform insertion 稳定 joint pipeline,并通过 grouped reordering 在去中心化加载下做局部负载均衡。

2.对于 MuJoCoUni + UniLab,值得关注的是它重新评估了机器人 RL 中 CPU simulation 的系统价值:MuJoCoUni 将 MuJoCo 仿真做成 C++ batched runtime,降低 Python/env/reset 开销;UniLab 再通过 shared memory ring buffer 和 APPO 解耦 CPU rollout 与 GPU learner update,使 simulation 和 learning 更充分重叠。

 

📌 栏目预告

本栏目定期推送大模型、具身智能领域前沿训练系统与学术成果解读,持续分享行业最新科研进展,欢迎持续关注。

 

Logo

社区规范:仅讨论OpenHarmony相关问题。

更多推荐