量子位 ★ 82 3 min

AI語音進入“表演時代”:阿里Qwen-Audio-3.0-TTS登頂全球權威榜單

资讯Qwen

🔗 https://www.qbitai.com/2026/07/455658.html

📌 【阿里巴巴 Qwen-Audio】從「能說話」進化到「會表演」,Qwen-Audio-3.0-TTS 登頂權威榜單

TL;DR:Qwen-Audio-3.0-TTS 透過細粒度標籤控制與方言強化,在 Artificial Analysis 榜單奪冠。

隨著 AI 語音技術的演進,我們正從「機器讀稿」進入「情感表演」的新時代。阿里巴巴最新釋出的 Qwen-Audio-3.0-TTS 透過更精準的控制能力,讓合成語音不再只是生硬的讀音,而是具備情緒起伏與場景感的表達。

🧩 從角色設定到「細粒度」情緒控制

上一代版本已支援 freestyle(自由風格模式),使用者只需透過提示詞(Prompt)如「資深客服」或「足球解說員」即可控制情緒與場景。而新一代模型 Qwen-Audio-3.0-TTS 在控制精度上有了質的飛躍:

  • 結構化標籤控制:使用者可以直接在文本中嵌入如 [gasp](抽一口氣)、[giggles](輕笑)、[angry](憤怒)等標記。
  • 精準到字級的控制:這種設計讓控制精度從整段的情緒,細化到「哪個字後面該倒吸一口氣」,極大提升了敘事、遊戲與配音場景的表現力。

📊 多語種與方言的雙重突破

Qwen-Audio-3.0-TTS 在多語種能力與方言表現上進行了專項最佳化:

  • 多語種 SOTA 表現:在 CV3-Eval 的 16 種語言測試中,該系列在 10 種語言中獲得 SOTA(State-of-the-Art,當前最佳);在「說話人相似度」評測中,Plus 版本更是取得全勝。
  • 方言強化訓練:針對模型容易出現「普通話腔」的痛點,研究團隊設計了專門的方言強化訓練,使模型在韻律與聲調上接近母語者,目前已覆蓋廣東、重慶、東北、陝西、上海、四川、雲南等 20 種方言。

🚀 針對不同需求提供兩款版本

為了平衡即時性與高品質需求,模型分為兩個版本:

  1. Flash 版本:面向即時互動場景,首包延遲(First Packet Latency)達到 300ms 級別。
  2. Plus 版本:面向高品質生成,音訊輸出從 24kHz 提升至 48kHz,品質達錄音棚與影視配音規格。

⚠️ 具備強大的聲學魯棒性

傳統語音克隆通常要求原始音訊必須在安靜環境錄製,但 Qwen-Audio-3.0-TTS 透過真實聲學模擬訓練,在克隆流程中嵌入了語音增強能力,能在高噪聲、高混響的條件下過濾幹擾,僅保留目標音色。

🎯 實務啟示

對於需要高品質配音、遊戲 NPC 語音或專業有聲書製作的開發者,Qwen-Audio-3.0-TTS 的細粒度控制與高取樣率(48kHz)提供了極高的創作自由度。目前這兩款模型已在阿里雲百鍊開放呼叫。

🔗 來源

#AI #TTS #Qwen #Alibaba #SpeechSynthesis #MachineLearning #ArtificialIntelligence #Multilingual #VoiceCloning #DeepLearning

tencent/hy3:free 自動生成