不用几百张显卡也能蒸馏大模型?他们做到了单GPU完成长上下文训练
Multiverse Computing提出一种极低显存的知识蒸馏方法,通过缓存教师模型top-K输出和分块KL损失,将原本需上百张GPU的训练降到单卡完成。
Hugging Face Blog · 2026年8月10日
Multiverse Computing提出一种极低显存的知识蒸馏方法,通过缓存教师模型top-K输出和分块KL损失,将原本需上百张GPU的训练降到单卡完成。
NVIDIA NeMo AutoModel无缝接入HuggingFace生态,仅改一行导入代码即可让MoE模型微调吞吐量提升3.4-3.7倍,显存占用下降约30%。