小米开源首个原生端到端语音大模型

超人 2026-06-23 40 0

扫一扫用手机浏览

文章目录 [+]

9月19日,小米正式开源首个原生端到端语音模型——Xiaomi-MiMo-Audio,它基于创新预训练架构和上亿小时训练数据,首次在语音领域实现基于ICL的少样本泛化,并在预训练观察到明显的“涌现”行为。

据介绍,在通用语音理解及对话等多项标准评测基准中,MiMo-Audio大幅超越了同参数量的开源模型,取得7B最佳性能;在音频理解基准MMAU的标准测试集上,MiMo-Audio超过Google闭源语音模型Gemini-2.5-Flash。

在面向音频复杂推理的基准Big Bench Audio S2T任务中,MiMo-Audio同样超越了OpenAI闭源的语音模型GPT-4o-Audio-Preview。

你可能想看:

相关文章

疑似被攻击!快手深夜关停直播频道

12月23日消息,深夜,快手疑似遭遇攻击,多个直播间出现特殊情况。 鞭牛士发现,目前快手直播频道已关闭。 此前,为应对此事...

AI智能 2026-06-23 61 0