不用几百张显卡也能蒸馏大模型?他们做到了单GPU完成长上下文训练 Multiverse Computing提出一种极低显存的知识蒸馏方法,通过缓存教师模型top-K输出和分块KL损失,将原本需上百张GPU的训练降到单卡完成。 Hugging Face Blog · 2026年8月10日