Meta 为百万 GPU 时代重新设计网络协议:MetaRoCE 如何让 AI 训练不再卡在通信上
Meta 发布全新 RDMA 传输协议 MetaRoCE,通过将智能从交换机转移到网卡端点,解决了大规模 AI 集群中网络通信成为瓶颈的核心问题。
Meta Engineering Blog · 2026年8月25日
Meta 发布全新 RDMA 传输协议 MetaRoCE,通过将智能从交换机转移到网卡端点,解决了大规模 AI 集群中网络通信成为瓶颈的核心问题。
Meta发布自研训练芯片MTIA 300,将网卡和通信引擎直接集成到芯片内部,彻底解决推荐模型训练中通信与计算争抢资源的瓶颈问题。
SkyRL 团队提出 IsoExec,通过统一执行抽象和比特级一致的内核,消除了强化学习训练与推理引擎之间的数值漂移问题,让算法调试和硬件优化变得简单可靠。
NVIDIA NeMo AutoModel无缝接入HuggingFace生态,仅改一行导入代码即可让MoE模型微调吞吐量提升3.4-3.7倍,显存占用下降约30%。
vLLM 推出原生强化学习 API,通过标准化权重同步和异步训练支持,解决了大模型在线强化学习中框架碎片化和部署脆弱的核心痛点。
AWS 详细阐述了支撑大模型从预训练、后训练到推理的全生命周期基础设施,揭示了从单一扩展法则到三大扩展法则的范式转变,以及开源软件栈与云基础设施深度融合的趋势。