小米声音理解大模型 MiDashengLM-7B 发布并全量开源，22 个公开评测集刷新最好成绩-智造科技有限公司

【导语】8月4日，小米公司正式宣布推出自研声音理解大模型MiDashengLM-7B，并决定全量开源。该模型在速度和精度上实现了显著突破，刷新了多项评测记录。MiDashengLM-7B基于创新的音频描述训练策略，能够统一理解语音、环境声和音乐。作为小米“人车家全生态”战略的关键技术，MiDashengLM不仅提升了用户场景理解的泛化性，还通过自然语言交互提供了更人性化的沟通体验。小米正进一步优化该模型，以期在终端设备上实现离线部署，并拓展更多声音编辑功能。

小米声音理解大模型 MiDashengLM-7B 发布并全量开源，22 个公开评测集刷新最好成绩

　　8 月 4 日消息，小米自研声音理解大模型 MiDashengLM-7B 正式发布，并全量开源。

　　据小米官方介绍，MiDashengLM-7B 速度精度上实现双突破：单样本首 Token 延迟仅为同类模型 1/4、同显存下并发超 20 倍，在 22 个公开评测集上刷新多模态大模型最好成绩（SOTA）。

　　MiDashengLM-7B 基于 Xiaomi Dasheng 作为音频编码器和 Qwen2.5-Omni-7B Thinker 作为自回归解码器，通过创新的通用音频描述训练策略，实现了对语音、环境声音和音乐的统一理解。

　　2024 年，小米发布的 Xiaomi Dasheng 声音基座模型在国际上首次突破 AudioSet 50+ mAP，在 HEAR Benchmark 环境声、语音、音乐三大领域建立领先优势并保持至今(jīn)。

　　Xiaomi Dasheng 在(zài)小(xiǎo)米(mǐ)的(de)智(zhì)能(néng)家(jiā)居(jū)和(hé)汽(qì)车(chē)座(zuò)舱(cāng)等(děng)场(chǎng)景(jǐng)有(yǒu)超(chāo)过(guò) 30 项(xiàng)落(luò)地(de)应(yīng)用(yòng)。行(xíng)业(yè)首(shǒu)发(fā)的(de)车(chē)外(wài)唤(huàn)醒(xǐng)防(fáng)御(yù)、手(shǒu)机(jī)音(yīn)箱(xiāng)全天候监控异常声音、“打个响指”环境音关联 IoT 控制能力，以及小米 YU7 上搭载的增强哨兵模式划车检测等，背后都有 Xiaomi Dasheng 作为核心算法的赋能。

　　MiDashengLM 的训练数据由 100% 的公开数据构成，模型以宽松的 Apache License 2.0 发布，同时支持学术和商业应用。

　　小米表示，不同于 Qwen2.5-Omni 等未公开训练数据细节的模型，MiDashengLM 完整公开了 77 个数据源的详细配比，技术报告中详细介绍了从音频编码器预训练到指令微调的全流程。

　　作为小米“人车家全生态”战略的关键技术，MiDashengLM 通过统一理解语音、环境声与音乐的跨领域能力，不仅能听懂用户周围发生了什么事情，还能分析发现这些事情的隐藏含义，提高用户场景理解的泛化性。

　　基于 MiDashengLM 的模型通过自然语言和用户交互，为用户提更人性化的沟(gōu)通(tōng)和(hé)反(fǎn)馈(kuì)，比(bǐ)如(rú)在(zài)用(yòng)户(hù)练(liàn)习(xí)唱(chàng)歌(gē)或(huò)练(liàn)习(xí)外(wài)语(yǔ)时(shí)提(tí)供(gōng)发(fā)音(yīn)反(fǎn)馈(kuì)并(bìng)制(zhì)定(dìng)针(zhēn)对(duì)性(xìng)提(tí)升(shēng)方(fāng)案(àn)，又(yòu)比(bǐ)如(rú)在(zài)用(yòng)户(hù)驾(jià)驶(shǐ)车(chē)辆(liàng)时实时对用户关于环境声音的提问做出解答。

　　MiDashengLM 以 Xiaomi Dasheng 音频编码器为核心组件，是 Xiaomi Dasheng 系列模型的重要升级。在当前版本的基础上，小米已着手对该模型做计算效率的进一步升级，寻求终端设备上可离线部署，并完善基于用户自然语言提示的声音编辑等更全面的功能。

官方网站-首页

首页

产品

解决方案

客户案例

新闻资讯

技术VC

城市合伙人

关于我们

联系我们

首页

产品

解决方案

客户案例

新闻资讯

技术VC

城市合伙人

关于我们

关于我们

关于我们

联系我们