量子位 ★ 86 3 min

螞蟻百靈釋出新一代原生混合推理模型Ling-3.0-Flash

資訊螞蟻百靈

🔗 https://www.qbitai.com/2026/07/461149.html

📌 【螞蟻百靈】新一代 Ling-3.0-Flash 釋出:以 5.1B 計算量挑戰高智效比

TL;DR:Ling-3.0-Flash 透過混合注意力架構與專家壓縮技術,實現小體量、高智慧的推理效能。

當模型參數規模不再是衡量智慧的唯一指標,如何透過精密的架構設計,在降低算力開銷的同時提升推理能力?螞蟻百靈最新釋出的 Ling-3.0-Flash 給出了答案。

🤔 以更小的計算成本,對標規模更大的模型

Ling-3.0-Flash 採用了極具效率的設計,其總參數量為 124B,但在單次計算中僅需啟用 5.1B 參數。這種設計讓模型在基礎推理、指令遵循及長文本處理等核心指標上,能夠對標甚至超越參數規模達其 2 至 3 倍的行業領先模型,展現出極高的「智效比」與落地價效比。

🧩 底層架構重新設計:混合注意力與專家壓縮

實現「小體量、高智慧」的關鍵,在於模型底層計算架構的創新:

  • 混合注意力架構:放棄單純堆砌參數,在預訓練階段即採用混合注意力設計,以 5:1 的比例交替堆疊 KDA(Kimi Delta Attention)線性注意力層與 MLA 層,平衡長上下文效率與模型能力。
  • KDA 技術升級:將上一代的 Lightning Attention 升級為 KDA,透過在 Delta Rule 的狀態更新中引入細粒度對角門控(diagonal gating),提升處理長文件與程式碼庫時記住關鍵資訊的精準度。
  • 專家啟用比例壓縮:進一步壓縮單次計算的專家啟用比例,將每個 Token 的專家啟用比例從前代的 1/32 壓縮至 1/64,進一步提升效率槓桿。

🤖 針對 Agent 場景的深度優化

為了讓 AI Agent 在複雜任務中更穩定,Ling-3.0-Flash 進行了兩大層面的強化:

  1. 訓練環境優化:擴展了超過 10,000 個真實互動訓練環境,並優化了複雜任務的自我糾錯與長程規劃機制,解決了大任務中容易「跑偏」或斷檔的問題。
  2. 配套協作架構
    • 降低延遲:引入叢集級分級快取(cluster-level hierarchical cache),避免長對話中的重複計算,將長輸入下的首字響應延遲降低 60% 至 80% 以上。
    • 提升穩定性:升級後的多智慧體協同架構(multi-agent collaboration architecture)允許不同 Agent 分工協作並相互校驗,減少單一模型的誤判風險。

🎯 實務啟示

對於需要高頻線上服務與真實業務落地的工程師而言,Ling-3.0-Flash 展現了「輕量化模型也能處理複雜邏輯」的可能性。其透過架構優化降低對昂貴算力的依賴,同時透過多 Agent 協作機制提升了任務完成的穩定性,是開發高效能 AI Agent 的重要技術參考。

🔗 來源

#AI #MachineLearning #LLM #AntGroup #Ling3.0 #AI_Agent #DeepLearning #AttentionMechanism #Inference #TechNews

tencent/hy3:free 自動生成