专栏名称: 智东西
智东西-聚焦智能变革,服务产业升级!作为智能行业新锐媒体,智东西专注五大领域:VR/AR;AI/机器人/无人机;智能汽车/智能出行;智能家居/物联网;智能穿戴/智能医疗,通过内容、活动、报告以及社群等方式助力“智能+”时代的创业和产业升级。
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  智东西

刚刚!阿里发新模型,幻觉率爆降70%

智东西  · 公众号  · 科技媒体  · 2025-09-15 23:39
    

主要观点总结

阿里巴巴通义实验室推出了FunAudio-ASR端到端语音识别大模型,该模型在高噪声场景下的表现得到了优化。它使用了数千万小时的音频数据,融合了大规模语言模型的语义理解能力,提高了语音识别的上下文一致性与跨语言切换能力。该模型在实际应用方面进行了全面优化,支持低延迟流式识别、跨中英文自然切换以及用户可自定义的热词识别,并能够覆盖视频会议、实时字幕、智能终端等多样化应用场景。同时,模型在幻觉和串语种问题上进行了针对性的优化,通过引入Context增强模块和RAG机制,提高了识别效果。此外,模型还针对实际应用需求进行了优化,如流式识别支持、噪声鲁棒性增强等。

关键观点总结

关键观点1: FunAudio-ASR模型通过创新Context模块优化高噪声场景下的表现。

该模型使用数千万小时的音频数据,融合大规模语言模型的语义理解能力。通过打造5大类测试集并结合开源测试集评估模型性能。

关键观点2: FunAudio-ASR在幻觉和串语种问题上进行了针对性的优化。

通过引入Context增强模块和RAG机制,提高识别效果。Context增强模块通过CTC解码器快速生成第一遍解码文本,作为上下文信息输入大语言模型,辅助其理解音频内容。

关键观点3: FunAudio-ASR模型支持个性化定制识别,召回率提升明显。

引入RAG(检索增强生成)机制,在不增加推理复杂度的前提下,将定制化词汇数量扩充到上千个以上。

关键观点4: FunAudio-ASR模型的技术细节和训练过程。

包含音频编码器、音频适配器、CTC解码器和基于大语言模型的解码器四个核心组件。预训练阶段使用了数千万小时的音频数据。进入有监督微调阶段后,使用了数百万小时的多源数据,确保模型在多样化场景下的泛化能力。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照