欢迎访问CEO资讯

腾讯混元发布Hy ASR 3.0 preview:真正懂上下文的语音识别

科技IT 2026-08-05 yu66841

  比特网8月5日消息,日前,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外开放API服务,可应用于智能客服、内容理解、语音搜索等场景。

  与以往“只转写、不理解”的语音识别不同,这一代模型最大的标签是“能理解上下文”,它基于新一代大语言模型 Hy3的语言理解能力,将高精度语音识别与深度语义理解结合起来,让机器不仅能把声音变成文字,还能结合语境判断语义。

  评测数据颇为亮眼:在开源测试集中,Hy ASR 3.0 Preview的多语种词错误率(WER)均控制在3%左右:中文普通话3.34%、英语2.62%、粤语3.12%;在自建评测集的通用语音、方言、上下文理解、专业词汇以及高噪声、耳语等复杂声学场景中,也保持了较低的词错误率。

  从实际体验看,模型重点提升了四项能力:一是通用识别准确率提升,覆盖普通话、方言及中英文混说,减少错字漏字和长音频偏差;二是支持结合Context上下文理解语境,对同音词智能纠错,降低语义误判;三是支持热词注入增强,可快速识别品牌名、产品名、人名与行业术语,减少企业适配和词库维护成本;四是针对高噪声、耳语、低声说话等场景专项优化,复杂环境下仍能稳定转写。

  技术层面,模型采用兼顾效率与性能的MoE架构,基座升级至Hy3;语音侧使用腾讯自研的无监督语音Encoder,以数千万小时无监督语音数据训练,并与大语言模型联合训练,覆盖多种方言、口音和声学环境。腾讯元宝深度参与共研并完成首发接入,用户长按说话即可免费体验相关能力,WorkBuddy等腾讯产品也在陆续接入。

  我们认为,将大模型语义能力引入ASR,是语音识别从转写工具迈向理解助手的合理方向。免费开放有助于生态检验,实际体验仍待多场景长期观察。

(来源:比特网)
The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 CEO资讯 |中华人民共和国增值电信业务经营许可证号:苏B2-20221286

苏ICP备2022030477号-13 |——:合作/投稿联系微信:nvshen2168

|—— TXT地图 | 网站地图 |