騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文
https://www.qbitai.com/2026/08/465973.html📌 【騰訊混元】Hy ASR 3.0 preview 釋出:從「逐字轉寫」演進為「理解語境」
TL;DR:Hy ASR 3.0 結合 Hy3 大模型與 MoE 架構,實現高精度語音識別與上下文語義理解。
傳統語音識別(ASR)往往只能做到「逐字轉寫」與「單點最佳化」,面對同音詞或複雜語境時容易出錯。騰訊混元最新推出的 Hy ASR 3.0 preview,透過將語音識別與深度語義理解融合,讓模型從單純的聽寫轉向具備「理解語境、相容場景、一鍵直出」的新境界。
🧩 MoE 架構結合 Hy3 大模型,強化語義推理
Hy ASR 3.0 preview 的效能提升並非單一模組的功勞,而是結合了架構設計、資料規模化(Scaling)與後訓練(Post-training)的最佳化:
- 架構層面:採用兼顧效率與效能的 MoE(Mixture of Experts)架構,並將基座模型升級至 Hy3,大幅增強了語言理解、上下文建模(Context modeling)與語義推理能力。
- 語音側:透過自研的無監督語音 Encoder,利用數千萬小時級的無監督語音資料訓練,從複雜音訊中提取高品質的聲學表徵。
- 聯合訓練:團隊對語音 Encoder 與大語言模型進行聯合訓練,引入多來源、數千萬小時級的語音資料,涵蓋多種方言、口音與聲學環境。
📊 開源評測集表現:多語種 WER 均控制在 3% 左右
在多語種的詞錯誤率(WER, Word Error Rate)表現上,Hy ASR 3.0 preview 展現了領先競品的實力:
| 語種 | WER (Word Error Rate) |
|---|---|
| 英語 | 2.62% |
| 粵語 | 3.12% |
| 中文普通話 | 3.34% |
此外,在自建的場景化評測(包含通用識別、方言識別、上下文理解、高噪及耳語等複雜聲學場景)中,該模型同樣保持了較低的 WER 水平。
💡 三大核心能力升級:更準、更穩、更聰明
根據騰訊混元釋出的資訊,Hy ASR 3.0 preview 針對使用者體驗進行了四個面向的重點提升:
- 精準捕捉語意:結合上下文(Context)智慧糾錯同音詞,消除語義歧義。
- 提升通用與方言能力:減少錯字、漏字,並針對 10 大方言片區與 20 餘個二級小片區進行 SFT(Supervised Fine-Tuning)資料體系覆蓋。
- 專業場景適配:支援「熱詞注入」功能,幫助模型快速識別品牌、人名及行業術語,降低業務接入成本。
- 複雜環境魯棒性:針對高噪、耳語、悄悄話等多種聲學場景進行專項最佳化,確保穩定表現。
🎯 實務啟示
對於開發者而言,Hy ASR 3.0 preview 的釋出意味著語音識別不再只是「聽寫工具」,而是可以深度整合進工作流的「理解工具」。透過熱詞注入與上下文感知能力,工程師可以更輕易地將其應用於智慧客服、內容理解與語音搜尋等對準確度要求極高的專業場景。目前該模型已透過騰訊雲提供 API 服務。
🔗 來源
- 標題:騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文
- 作者/機構:允中 @ 量子位
- 連結:https://www.qbitai.com/2026/08/465973.html
#ASR #SpeechRecognition #Tencent #HyASR #LLM #MoE #MachineLearning #DeepLearning #SpeechToText #AI
原始資料 量子位 · 收集於 2026-08-05
摘要原文
騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文 允中 2026-08-04 16:58:21 來源: 量子位 元寶已接入 8 月 4 日,騰訊混元正式釋出新一代語音識別模型 Hy ASR 3.0 preview。基於最新一代大語言模型 Hy3 的語言理解能力,Hy ASR 3.0 preview 融合高精度語音識別與深度語義理解能力,在通用識別、上下文感知、多場景魯棒性以及方言覆蓋等核心維度實現全面提升,能夠在更複雜的真實輸入中給出準確、連貫且更接近使用者意圖的轉寫結果,從“逐字轉寫、單點最佳化”演進為“理解語境、相容場景、一鍵直出”。 Hy ASR 3.0 preview 在多個開源評測集和自建評測集上整體表現領先。在開源評測集中,Hy ASR 3.0 preview 在多語種的WER(Word Error Rate, 詞錯誤率)上都控制在3%左右,其中中文普通話 WER 3.34%、英語 WER 2.62%、粵語 WER 3.12%,整體領先競品。 開源評測集表現:Hy ASR 3.0 preview在語種及方言上整體表現領先 在自建評測集上,Hy ASR 3.0 preview在通用識別、方言識別、上下文Context理解、複雜聲學場景(高噪、耳語)等場景化評測中,WER也保持較低水平,整體領先競品。 自建評測集表現:在綜合評測集上取得最低 WER,整體表現領先 從使用者使用的角度,Hy ASR 3.0 preview重點提升了四類能力,包括: 通用識別更準確 :提升通用語音、方言、中英混說等場景下的識別準確性,進一步減少錯字、漏字問題。 更能理解使用者意圖 :結合上下文Context精準捕捉使用者語境,智慧糾錯同音詞,消除語義歧義。 更容易適配專業場景 :支援熱詞注入增強,幫助模型快速識別品牌產品名稱、人名及行業術語,降低業務接入和持續維護成本。 複雜環境下更穩定 :面向高噪、耳語、悄悄話等多種聲學場景下進行專項最佳化,複雜條件下依然保持穩定表現。 架構、資料、後訓練持續增強,提升語音識別能力上限 Hy ASR 3.0 preview的能力提升並非來自單一模組,而是模型架構、資料 Scaling 與後訓練最佳化共同作用的結果。 在架構層面,Hy ASR 3.0 preview 採用兼顧效率與效能的 MoE 架構,並將基座模型升級至 Hy3,進一步增強語言理解、上下文建模和語義推理能力。在語音側,團隊自研無監督語音 Encoder,通過數千萬小時級無監督語音資料訓練,使其能夠從複雜音訊中提取高質量的聲學表徵。 為了持續提升模型的語音建模與理解能力,混元團隊對語音 Encoder 和大語言模型進行聯合訓練,引入數千萬小時級、多來源的語音資料,覆蓋多種方言、口音和聲學環境,並通過高質量資料管線進行精細化標註。在大規模聯合預訓練的基礎上,Hy ASR 3.0 preview 通過多階段能力注入,逐步獲得上下文感知、複雜場景適應和方言識別等能力。 圍繞通用識別、上下文理解和複雜場景魯棒性,團隊構建了高質量的 SFT recipe,覆蓋上下文context、專業名詞、不同聲學環境以及多樣人群語音。針對方言識別能力,SFT 資料體系進一步覆蓋 10 大方言片區和 20 餘個二級小片區。 在此基礎上,團隊進一步引入多階段強化學習,分別針對通用轉寫準確性、Any-context 上下文能力和複雜長尾場景進行最佳化,降低模型在複雜聲學環境中的誤識別和漏識別問題。 目前Hy ASR 3.0 preview已上線騰訊雲官網對外提供 API 服務,可廣泛應用於智慧客服、內容理解、語音搜尋等場景。 元寶深度參與共研並已完成首發上線,使用者開啟元寶按住說話即可體驗方言識別、上下文智慧糾錯與複雜環境穩定轉寫等能力提升,語音輸入更準、更穩,且免費開放;WorkBuddy 等產品也在陸續接入中。 體驗地址: 騰訊混元: https://aistudio.tencent.com/visual 騰訊雲: https://cloud.tencent.com/document/product/1093/135476 版權所有,未經授權不得以任何形式轉載及使用,違者必究。 騰訊混元 允中 WorkBuddy重大升級,AI時代的Office來了 2026-07-30 國產算力正在進入Token標準化時代 2026-06-18 為什麼最有價值的AI討論總發生在知乎? 2026-06-17 一個模型控制手腳腰身!機器人終於學會全身協同幹精細活了 2026-06-16 相關閱讀
由 tencent/hy3:free 自動生成