不用几百张显卡也能蒸馏大模型?他们做到了单GPU完成长上下文训练
Multiverse Computing提出一种极低显存的知识蒸馏方法,通过缓存教师模型top-K输出和分块KL损失,将原本需上百张GPU的训练降到单卡完成。
Hugging Face Blog · 2026年8月10日
Multiverse Computing提出一种极低显存的知识蒸馏方法,通过缓存教师模型top-K输出和分块KL损失,将原本需上百张GPU的训练降到单卡完成。
Ben Thompson提议美国立法明确训练数据为合理使用并禁止限制API蒸馏,以应对中国开源模型竞争,揭示AI政策虚伪与变革。