AI资讯

腾讯混元发布Hy ASR3.0preview:语音识别迈入“懂语境”新阶段

2026-08-04

今日,腾讯混元正式推出新一代语音识别模型Hy ASR3.0preview,首次将大语言模型Hy3的深度语义理解能力与高精度语音识别深度融合,推动语音识别从“逐字转写、单点优化”向“理解语境、兼容场景、一键直出”跨越。

据官方披露,新模型在多维度评测中表现亮眼:开源评测集上,中文普通话、英语、粤语的词错误率(WER)分别低至3.34%、2.62%、3.12%,整体控制在3%左右;自建评测集覆盖通用识别、10余种方言、上下文语义理解、专业术语识别及高噪、耳语等复杂声学场景,WER同样保持行业领先水平。

QQ20260804-163907.jpg

技术层面,Hy ASR3.0preview的能力升级源于全链路优化:架构上采用兼顾效率与性能的MoE架构,基座升级为Hy3大模型,同时自研无监督语音Encoder,依托数千万小时级语音数据训练,提升声学特征提取能力;预训练阶段实现语音Encoder与大语言模型联合训练,覆盖多方言、多口音、多声学环境的海量数据,通过多阶段能力注入强化方言识别、上下文感知等特性;后训练环节则构建了覆盖20余个方言小片区的SFT数据集,结合多阶段强化学习,针对性解决复杂场景下的误识别、漏识别问题。

目前,Hy ASR3.0preview已上线腾讯云官网对外开放API,可广泛应用于智能客服、内容理解、语音搜索等领域。腾讯旗下AI助手“元宝”已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错、复杂环境稳定转写等功能,相关能力免费开放;WorkBuddy等产品也在陆续接入中。业内认为,此次更新标志着语音识别技术向“更懂用户意图”的方向迈出关键一步,将为多场景语音交互体验带来显著提升。

# HyASR3.0preview # 腾讯混元 # 大语言模型 # 语音识别