当AI学会“背答案”:语音识别基准测试正在被刷分污染
最新研究揭示,多个顶级语音识别模型并非真正听懂了音频,而是学会了在特定测试集上“背答案”,导致基准分数虚高。
Hugging Face Blog · 2026年8月21日
最新研究揭示,多个顶级语音识别模型并非真正听懂了音频,而是学会了在特定测试集上“背答案”,导致基准分数虚高。
微软推出MIT许可的Whisper风格语音模型VibeVoice,内置说话人分离功能,可在Mac上本地高效处理长达一小时的音频转录。
Hugging Face 引入私有语音数据集以防止模型在公开测试集上“刷分”,旨在让语音识别排行榜更真实地反映模型在实际场景中的鲁棒性。