Meta 为百万 GPU 时代重新设计网络协议:MetaRoCE 如何让 AI 训练不再卡在通信上
Meta 发布全新 RDMA 传输协议 MetaRoCE,通过将智能从交换机转移到网卡端点,解决了大规模 AI 集群中网络通信成为瓶颈的核心问题。
Meta 发布全新 RDMA 传输协议 MetaRoCE,通过将智能从交换机转移到网卡端点,解决了大规模 AI 集群中网络通信成为瓶颈的核心问题。
AI行业正从模型能力竞争转向算力利用率竞争,闲置GPU如同航空业停场的飞机,成为企业真正的成本黑洞和战略瓶颈。
vLLM 首日支持 TML Inkling 模型,在 4 张 GB200 上实现 380 tok/s 推理速度,完整支持 1M 上下文、多模态输入及多项架构优化。
HuggingFace 将自定义 GPU 内核设为其 Hub 的新仓库类型,通过可复现构建与可信发布者机制解决安全难题,并扩大框架与后端覆盖,为内核生态奠定标准化基础。
Meta分享了一种混合隐私资产分类法:用大模型处理模糊冷启动,但日常执行依赖人工审核的确定性规则,从而在AI时代实现可审计的数据治理。
TTS推理并非单步自回归,而是延迟敏感与吞吐敏感模块的异构流水线,传统大模型优化套路在此失效,需架构感知的定制调度。
vLLM 语义路由器推出 Fusion 原语,让多个模型组成评审团独立推理,再由裁判模型综合出最优答案,将模型组合作为一等公民的服务范式。
AI数据中心对高带宽内存(HBM)的海量需求,正挤占消费电子所需内存的产能,导致未来几年手机等设备成本显著上升。
一个完整案例证明,通过Hugging Face生态与ROCm的无缝结合,开发者可在AMD MI300X GPU上高效微调大模型,打破了NVIDIA CUDA的生态垄断。
OpenAI大幅降价不只是价格战,而是用更聪明的模型(Sol)重写了底层推理内核,成本直降20%,这揭示了一个新趋势:AI正在成为自己基础设施的优化师。
AWS 详细阐述了支撑大模型从预训练、后训练到推理的全生命周期基础设施,揭示了从单一扩展法则到三大扩展法则的范式转变,以及开源软件栈与云基础设施深度融合的趋势。
Anthropic完成650亿美元H轮融资,估值达9650亿美元,标志着AI竞赛进入以天价资本和算力为核心的白热化阶段。
Anthropic通过与SpaceX等巨头达成巨额算力协议,大幅提升了Claude的使用限制,标志着AI基础设施竞赛已从地面延伸至太空。