量子位 ★ 103 3 min

114B參數、6B啟用,Sand.ai剛剛開源全球首個千億MoE影片生成模型

資訊首頁輪播影片生成

🔗 https://www.qbitai.com/2026/08/466847.html

📌 【Sand.ai 重磅開源】首個千億 MoE 影片生成模型 MAGI-2-preview 登場

TL;DR:千億參數 MoE 架構,單次僅啟用 6B 參數,生成 10 秒 1080P 影片成本僅需 5 毛錢。

影片生成模型正面臨一個「不可能三角」:模型要更大、影片要更長,但成本必須可承受。若使用傳統稠密模型(Dense Model),隨著參數與序列長度增加,運算與儲存成本將會呈爆炸式成長。

🤔 打破影片生成的 Scaling 困境

影片模型不同於文本模型,每一幀都需要拆解為大量空間 patch,且需記錄連續幀之間的動作、物體關係與鏡頭變化,序列長度極長。Sand.ai 透過 MoE(Mixture of Experts,混合專家模型)架構,將模型總容量與單次計算量解耦,實現了大規模參數與低成本推理的平衡。

🧩 MAGI-2-preview 的核心技術架構

為了讓千億級 MoE 在影片生成上真正跑通,Sand.ai 從底層進行了全面重構:

  • 單流架構 (Single-stream Architecture):不同於傳統將影片與音訊分開處理再用 cross-attention 黏合,MAGI-2-preview 讓文本、影片與音訊進入同一個 Transformer,在每一層自注意力機制中直接進行資訊交換,實現更細微的音畫對應。
  • 極致細粒度的 Multi-Head LatentMoE
    • 將 3072 維的隱藏表示拆分為 12 個 256 維的 head,每個 head 獨立進行路由。
    • 在 36 層網路中,每層擁有 3072 個獨立專家單元。
    • 每個 token 在每個 head 內選擇 6 個專家,合計啟用 72 個小專家,讓模型能實現更精細的能力組合。
  • 自研 MagiMoE kernel 與並行策略
    • 開發 MagiMoE kernel 庫,將路由、排序與專家計算整合,減少視訊記憶體搬運。
    • 採用 Head Parallel 策略,在路由前就按 head 分配計算至不同裝置,確保通訊量不會隨啟用專家數波動,解決超長序列的通訊瓶頸。
  • 混合最佳化器:針對不同性質參數採用不同更新節奏,矩陣參數使用 Muon,專家參數使用 AdamW。

📊 高效能與低成本的實測表現

  • 極低成本:以 8 卡 H100 為例,生成一段 10 秒 1080P 影片的成本約為 0.5 元人民幣,僅為業界主流模型的十分之一。
  • 頂尖排名:在 AA 影片生成榜單中排名第 6,僅用 6B 啟用參數便能達到接近第一梯隊的效果。

💡 從「刪減資料」轉向「組織資料」

在資料處理上,MAGI-2-preview 不再追求過度過濾後的精簡集,而是優先擴大有效資料的規模以保有廣度,再透過精準標註將資料組織起來,讓模型學習場景、動作與聲音間的對應關係。預訓練負責覆蓋資料分佈,後訓練則專注於偏好對齊、可控性與安全性。

🎯 實務啟示

對於開發者與研究者而言,這次開源具有極高的戰略價值:

  1. 研究維度升級:研究者能直接解剖千億級影片 MoE 的專家分工、路由穩定性與 Scaling 規律。
  2. 私有化部署選擇:對於金融、醫療、工業等對資料敏感的行業,開源模型提供了在本地進行微調與部署的可能性。
  3. 產業競爭新標準:影片生成將從單純的比拼畫質,演進到比拼模型是否可持續訓練、介面是否受單一平臺控制。

🔗 來源

#AI #VideoGeneration #MoE #MachineLearning #OpenSource #SandAI #MAGI2 #DeepLearning #ComputerVision #Transformer

原始資料 量子位 · 收集於 2026-08-06
來源原標題
114B參數、6B啟用,Sand.ai剛剛開源全球首個千億MoE影片生成模型
作者
鹭羽
原始標籤
資訊 · 首頁輪播 · AI · 影片生成
原始連結
https://www.qbitai.com/2026/08/466847.html

摘要原文

114B參數、6B啟用,Sand.ai剛剛開源全球首個千億MoE影片生成模型 鷺羽 2026-08-05 15:05:41 來源: 量子位 10秒1080P,成本只要5毛錢 鷺羽 發自 凹非寺 量子位 | 公眾號 QbitAI 再牛的大模型,也要放到行業面前公開露個面,才算真交卷。 現下,就有這樣一支清華系團隊再展鋒芒,規模不大、實力卻不小—— 搶先用 MoE架構 把影片生成模型捲上 千億參數 ,程式碼權重還全!開!源! 模型一齣,直接刷屏國內外科技圈。那麼大,那麼強,說開源就開源。 且先來看看生成效果一探究竟: 影片連結:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 如何?最近爆火的AI漫劇,聲臺形表四角俱全。 亦或是來一場酣暢淋漓的長鏡頭,視角跟隨人物動作切換自如。 影片連結:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 鬧歸鬧,商業場景也不在話下。 影片連結:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 光這運鏡、對焦和人物表現,拉出去和閉源第一梯隊同臺PK,也照樣能打。 不賣關子了,這便是 Sand.ai 的最新力作—— MAGI-2-preview 。繼Magi-1橫空出世後,新模型又一次瞄準開源C位。 模型總參數114B,單次前向只啟用約6B。 按8卡H100當下的行情算,要生成一段10秒1080P影片,其成本僅需5毛錢,差不多隻有行業主流模型的 十分之一 。 Benchmark排名也相當亮眼,MAGI-2-preview在AA影片生成榜單排名 第六 。僅用6B啟用參數,效果就已經非常接近第一梯隊。 好好好,這下影片生成行業,又多了一個千億級新變數。 影片模型Scaling不能照抄LLM 這一變,直擊影片生成模型的 Scaling 路線。 其實這個問題現在看來挺剛需的,做大模型,最怕的事情就是錢不夠燒。 文本模型倒還好,處理的都是離散token,疊參數、加算力,模型就能越滾越強。但影片模型呢?面對的卻是 一整個動態世界 。 每一幀畫面都要被拆成大量空間patch,連續幀還要記錄人物動作、物體關係和鏡頭變化。如果再疊加文本、音訊等資訊,序列長度直接超級加倍…… 如果還用稠密模型,Scaling的訓推成本簡直想都不敢想。 模型要更大、影片要更長、成本還要可承受,這三件事就是擺在影片生成面前的近乎 「不可能三角」 。 圖片由AI生成 當然,解法不是沒有—— MoE 。 所謂MoE,就是把模型容量和單次計算部分解耦。模型可以繼續擁有百億千億的總容量,但每次推理只啟用其中一小部分,成本相對可控。 但影片MoE也有自己的麻煩,首先卡住的是 通訊 。 傳統專家並行會先為token選出Top-K專家,再把token送到專家所在的GPU。換言之,只要啟用專家數越多,需要運輸的資料就越多。 對於本就擁有超長序列的影片模型,這部分通訊成本很快就會蓋過專家計算本身。 更別提 訓練穩定性 ,動態變化的路由、隨時波動的專家負載,以及需要處理的多模態資料,都會讓大模型Scaling過程中常見的問題,在影片MoE上 成倍放大 。 因此影片生成的Scaling路徑,跟大語言模型不完全是一回事。 單純遷移MoE不管用,還要扛得住超長序列和跨卡通訊,同時保證音訊、影片、文本在同一套系統裡順暢協作。 說白了,得從底層開始一點點 重構 。 行業裡很少有人能做到。要說將影片MoE從紙上談兵搬到千億參數影片模型上, Sand.ai是第一個 。 讓千億MoE模型真正跑起來 要想跑通,架構和系統缺一不可。 先打地基,MAGI-2-preview延續了Sand.ai在daVinci-MagiHuman中驗證過的 單流架構 —— 文本、影片和音訊進入同一個Transformer,然後在每一層自注意力裡直接交換資訊。 傳統做法裡,是影片走影片的,音訊走音訊的,最後再靠cross-attention(交叉注意力)把兩邊粘起來。 而MAGI-2-preview是從第一層開始,畫面和聲音就在 共同建模 ,從而更適合處理細微的音畫對應關係,效果be like: 影片連結:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 這樣設計還另有額外的好處,統一主幹能夠讓延遲和維護成本比模型串聯低得多,也更 天然適配MoE擴展 。 有了框架,再把專家顆粒度推到極致。 MAGI-2-preview採用Multi-Head LatentMoE的思路,將3072維的隱藏表示拆成12個256維head,再讓 每個head獨立路由 。 同一個token由此被拆進多個低維子空間,有的head更關注人物外觀,有的處理動作和時序,各司其職。 於是在36層主體網路裡,每層總共3072個獨立專家單元,每個token在每個head內選擇6個專家,合計啟用 72個 小專家。 看起來同時呼叫的專家變多了,但每個專家處理的子空間尺寸更小,分工更細, 模型能夠拼湊出更多能力組合 。 作為參照,DeepSeek-V4-Pro等主流MoE大模型的每層專家數大多還停留在幾百個,MAGI-2-preview直接推到了三千級別。 這麼細的專家,單靠通用MoE是實現不了的,還需要一套完整的 自研infra 。 Sand.ai自己寫了 MagiMoE kernel庫 ,把路由、排序、專家計算整條鏈路壓在一起,減少中間結果的視訊記憶體搬運。 還針對Multi-Head MoE的計算形態,前向和反向過程都做了專門最佳化。 並行策略 也重新設計了。 Head Parallel在路由發生之前就按head把計算分配到不同裝置,裝置間傳輸的是形狀固定的head表示,而不是路由後數量不斷變化的專家token。 通訊量不隨啟用專家數波動,影片的長序列就不再是要命的瓶頸。 最佳化器 同樣做了混合設計。矩陣參數用Muon,專家參數用AdamW,不同性質的參數用不同的更新節奏。 最後一環是 資料 。 很多團隊做資料是層層過濾,最後留一個乾淨但窄的資料集。 但生成模型需要的恰恰相反,要的就是多樣性,見得越多,生成才能越逼真。 MAGI-2-preview的思路是從 「刪減」 轉向 「組織」 。 先擴大有效資料的規模,儘量保留廣度,再通過更精準的標註把資料組織起來,讓模型依次學會不同場景、動作、聲音之間的對應關係。 預訓練和後訓練的分工 也隨之變化。 預訓練負責儘可能完整地覆蓋資料分佈,讓基礎模型吃全,後訓練則回到自己更擅長的部分,處理偏好對齊、可控性、安全性和產品適配。 影片連結:https://mp.weixin.qq.com/s/Wtw4Ui4whdGEQ8vyWQ3Ipg 至此,MAGI-2-preview得以跑通 一整套Scaling系統 。 通過模型結構、通訊機制、底層infra和資料體系協同設計,在擴大總容量的同時,把單次啟用參數控制在可執行範圍內。 當然,這裡的6B啟用參數並不等於一款6B稠密模型的實際成本,專家通訊、路由、視訊記憶體和部署方式仍會產生額外開銷。 但作為一款 開源的千億級影片模型 ,效果已然next level~ 尤其是開源,其帶來的變化,要比想像中大得多。 開源不只是「秀肌肉」 過去開源的影片模型大多都是百億級,千億參數直接改變的是整個行業的遊戲規則。 對於 研究者 而言,這是第一次能夠真正解剖千億級影片MoE。 專家如何分工、路由是否穩定、通訊怎樣組織、Scaling規律能否復現,這些問題終於有了公開研究物件。 不必隔著論文空想,這對學術界和中小研究團隊是實打實的基礎設施升級。 對 企業 來說,開源意味著多了一個私有化部署和行業微調的選項。 尤其是金融、醫療、工業等資料敏感行業,資料能否留在本地、模型能否針對業務繼續訓練,重要性並不亞於一次生成效果。 再把視線放大至整個 行業 ,開閉源的競爭維度也將被重新定義。 以前是單純效果比拼,比誰的畫質好、誰更便宜,往後模型能否繼續訓練以及介面是否被單一平臺控制,都將成為對比指標。 一旦開源模型在效果上持續逼近閉源,影片生成也大機率會走上語言模型的老路—— 閉源靠產品體驗和服務穩定性,開源靠部署、控制和開發者生態。 兩條路線,終於開始在更多層面正面碰撞。 在這背後,是 Sand.ai 的非共識再一次得到驗證。 從自迴歸影片生成,到音畫同出,再到千億MoE開源,團隊選擇的道路總是人跡罕至。 這與團隊背景不無關係。 Sand.ai創始人 曹越 是清華大學特等獎學金獲得者、Swin Transformer共同一作,曾聯合創辦光年之外,也曾在智源研究院負責多模態與視覺研究。 團隊其它成員也個個都是頂尖技術流出身,這樣的技術基因,決定了團隊 更願意把資源押在基礎模型和底層infra ,更關注模型的本質,而不是追著熱點跑。 創新工場董事長李開復也曾公開推薦該團隊,稱其為 「AI影片生成界的DeepSeek」 。 這一次則更為激進。 Sand.ai首次將千億參數、MoE和開放權重三件事捏在一起,再用一整套自研系統讓它真正跑起來。 所以這不僅僅是場技術釋出,也是一個團隊對 “影片模型應該怎麼做” 的立場表達。 誠然,MAGI-2-preview還不是影片生成的最終答案,還需等待正式版繼續交卷。 但它先把這件事給做實了—— 千億級MoE,不只屬於語言模型。 也歡迎行業內外借由開源驗證。 開源地址: https://github.com/SandAI-org/MAGI-2-preview 版權所有,未經授權不得以任何形式轉載及使用,違者必究。 AI 影片生成 鷺羽 米哈遊蔡浩宇AI創業生變 2026-07-31 Opus 5遊戲提示詞爆火!24小時復刻3A巨作 2026-07-29 全球首個Agentic擴散模型來了:邊行動邊糾錯,128K上下文追平自迴歸 2026-07-28 菲爾茲獎得主王虹,也發過NeurIPS 2026-07-24 相關閱讀

tencent/hy3:free 自動生成