量子位 ★ 90 4 min

阿里Qwen3.8正式釋出,程式設計與辦公再進化,推理更快更穩定

資訊阿里巴巴

🔗 https://www.qbitai.com/2026/08/465215.html

📌 【阿里 Qwen3.8 正式釋出】從補全程式碼到自主交付專案,邁向系統級自主規劃

TL;DR:Qwen3.8 採用 2.4T 規模 MoE 架構,在 Coding 與辦公效能大幅提升,位居全球第一梯隊。

阿里巴巴正式釋出新一代基座大模型 Qwen3.8,這不僅是參數規模的擴張,更展現了從單純的程式碼補全,演進到能夠自主執行長週期、複雜任務的系統級能力。

🤔 總參數量達 2.4 兆,效能躋身全球第一梯隊

Qwen3.8 系列的旗艦模型 Qwen3.8-Max 展現了極強的競爭力,在權威第三方榜單 Arena 中,其表現僅次於 Anthropic 的 Claude 系列。

🧩 稀疏 MoE 架構與混合注意力機制

Qwen3.8-Max 透過架構創新,實現了效能與效率的平衡:

  • 架構設計:採用稀疏 MoE (Mixture of Experts) 架構與混合注意力機制 (Hybrid Attention) 的聯合最佳化。
  • 參數規模:總參數量達到 2.4T (2.4 兆),其中啟用參數為 95B。
  • 核心優勢:在提升推理效率與速度的同時,大幅強化了模型在複雜任務中的表現。
  • 多模態能力:支援視覺理解,上下文長度 (Context Length) 高達 1M Tokens。

📊 多項權威評測取得突破

Qwen3.8-Max 在多項關鍵指標上刷新紀錄:

  • 程式設計 (Coding):在 PaperBench 評測中取得 93.0 分,較前代提升 28.2 分;CodeArena 排名全球第四。
  • 智慧體 (Agent) 能力:在 OSWorld-Verified 評估智慧體電腦操作能力時,以 86.1 分位居主流模型首位。
  • 視覺推理:在 BabyVision 評測中取得 82.0 分,表現超出部分主流模型近兩倍;Vision Arena 排名全球第二。
  • 通用能力:指令遵循 (IF Bench) 82.8 分、科學推理 (GPQA Diamond) 92.6 分。

💡 從「輔助開發」進化到「自主交付專案」

目前的程式設計模型已不再僅限於寫好函式或補全程式碼。Qwen3.8 展現了「自主程式設計」的突破:

  • 自主專案交付:模型可以從一個空資料夾出發,在無需人類干預的情況下,自主完成一個長達十數天的真實專案。
  • 迴圈工程 (Loop Engineering):例如透過建立自進化的智慧體框架 “oh-my-cli”,實現從零開始搭建、編排任務並自動執行的流程。
  • 長週期任務處理:在數位晶片設計或商業模擬運營等高精密、高動態環境中,透過「執行 → 反饋 → 迭代」的自適應閉環,實現策略的深度重構。

💼 大幅提升專業辦公 (Cowork) 的生產力

Qwen3.8 透過強化學習 (RL) 擴展,能穩定交付生產級的專業成果:

  • 法律任務:原本需一週標註千餘個條款的任務,Qwen3.8 僅需一小時即可完成。
  • 影片分析:能精準拆解 160 小時以上的比賽錄影,並輸出戰術畫像與報告。
  • 金融研究:能自主調動並行智慧體,進行量化策略研究、回測並動態修正。

🎯 實務啟示

對於開發者而言,Qwen3.8 的釋出意味著 AI 的角色正從「工具」轉向「代理人 (Agent)」。隨著模型具備長週期自主規劃與視覺程式設計 (Visual Coding) 能力,未來工程師的工作重心將從「撰寫程式碼」轉向「編排與監督智慧體工作流」。此外,Qwen3.8-Max 的 API 已上線,並預計於下週開源 Qwen3.8-Max 與 Qwen3.8-27B。

🔗 來源

#Qwen #Alibaba #LLM #MoE #Agent #Coding #MachineLearning #ArtificialIntelligence #ComputerVision #Productivity

原始資料 量子位 · 收集於 2026-08-03
來源原標題
阿里Qwen3.8正式釋出,程式設計與辦公再進化,推理更快更穩定
作者
量子位的朋友们
原始標籤
資訊 · 阿里巴巴
原始連結
https://www.qbitai.com/2026/08/465215.html

摘要原文

阿里Qwen3.8正式釋出,程式設計與辦公再進化,推理更快更穩定 量子位的朋友們 2026-08-03 12:58:17 來源: 量子位 阿里巴巴正式釋出新一代基座大模型Qwen3.8,整體效能處於全球大模型第一梯隊。Qwen3.8-Max預計下週開源,同時還將開源 Qwen3.8-27B。 8月3日,阿里巴巴正式釋出新一代基座大模型Qwen3.8,總參數量2.4萬億,在程式設計(Coding)和專業辦公(Cowork)方面能力大幅提升。今日放榜的權威三方榜單Arena中,阿里Qwen模型僅次於Anthropic的Claude系列,整體效能處於全球大模型第一梯隊。目前,Qwen3.8的API已上線千問AI平臺,並接入阿里今日同步推出的Agent產品“千問辦公”。Qwen3.8-Max預計下週開源,同時還將開源 Qwen3.8-27B。 今日起,全球開發者都可通過千問AI平臺獲得Qwen3.8的API服務,國內每百萬Tokens輸入12元、輸出36元,隱式快取命中僅1.5元,而輸入與輸出的國際價格僅為Opus5的40%與24%,實現相近智慧更高性價比。 圖說:權威三方榜單Arena全球排行榜更新 此次釋出的是千問大模型系列中尺寸最大、效能最強的旗艦模型Qwen3.8-Max,它支援視覺理解,上下文長度達1M Tokens。在模型架構上,Qwen3.8通過稀疏MoE架構與混合注意力機制的聯合最佳化,首次將千問大模型的總參數量拓展至2.4T,啟用95B,獲得了更高的推理效率、更快的推理速度,整體效能也迎來新突破:在科研復現評測PaperBench等程式設計智慧體評測中,Qwen3.8-Max較上代模型大幅提升28.2分,以93.0分錄得評測新高;在WideSearch、Agent’s Last Exam等通用智慧體評測中,新模型分別取得81.9分和52.4分,位居前沿。同時,Qwen3.8在指令遵循IF Bench評測中斬獲82.8分,科學推理GPQA Diamond取得92.6分,系列通用能力均位居前列;在視覺推理BabyVision評測中,Qwen3.8-Max在無工具條件下取得82.0分,超出部分主流模型近兩倍,在評估智慧體電腦操作能力的OSWorld-Verified評測中,Qwen3.8-Max以86.1分位居主流模型首位。 程式設計能力(Coding)是前沿大模型的核心能力之一,Qwen3.8實現了自主程式設計的新突破。 在權威CodeArena榜中,Qwen3.8位居全球第四。2年前的前沿模型能寫好函式、補全程式碼,成為程式設計師的有力幫手,而如今,Qwen3.8可以從一個空資料夾出發,自主完成一個十數天的真實專案交付,全程無需人干預。只需一句“建立一個自進化的智慧體Harness”,Qwen3.8就像個資深的工程師,從零開始,自主搭建迴圈工程(Loop Engineering)框架,編排智慧體自動領取和執行任務,人類工程師還可通過釘釘給Qwen3.8提出新要求。Qwen3.8獨立程式設計執行約 16 天后,做出了一個Hermes Agent級別的、真實可用的自進化智慧體框架“oh-my-cli”,目前該專案現已完全開源,完整過程公開儲存在 GitHub 倉庫裡,可供所有人檢視。 Qwen3.8可勝任廣泛的、真實的專業工作任務(Cowork)。 面對完全不同的專業任務、評判標準和計算需求,Qwen3.8通過真實環境和算力的聯合強化學習(RL)擴展,實現了數百種高價值、高頻專業任務的真實表現提升,在主流的智慧體框架中均可穩定可靠地交付生產級成果:一支法務助理團隊在數百份法律文件中標註千餘個相關條款,需要一週時間,Qwen3.8一小時內就能做完;一個籃球資料分析團隊逐幀標註160個小時以上的比賽錄影,Qwen3.8數十分鐘就可精準拆解這8400多個攻防回合,並一次性輸出球員戰術畫像和教練報告;一個金融研究團隊基於數年的專業知識積累,蒐集資本市場全面、即時的變動,才能依次完成的量化策略研究,Qwen3.8自主調動並行的智慧體,連續工作數小時後交付完整的 ETF 輪動策略,並持續分析回測、動態修正、最後實現規模化盈利。 在長週期任務中,Qwen3.8湧現出系統級自主規劃與全棧閉環自適應學習能力。無論是在高精密、強物理約束的數字晶片設計,還是在高度動態、博弈激烈的商業模擬運營中,Qwen3.8均能通過“執行-反饋-迭代”的自適應閉環,在數千輪的超長程互動中實現演算法與策略的深度重構。 Qwen3.8除了擁有強大的文本和推理能力,還提高了AI視覺理解能力的極限 。在權威Vision Arena榜單中,Qwen3.8-Max排名全球第二。Qwen3.8不僅能讀懂200頁的財報PDF、看懂超100小時的長影片,還能將這些“看到”的知識和資訊反饋到工作全流程去,幫助模型思考得更周全。在千問團隊構建的“應用復刻”基準RecreationBench長程任務中,模型沒有原始碼,也無法聯網,只通過互動與反饋去理解這個應用,卻能從零復刻出整個應用。這表明,Qwen3.8已經展現出前沿水準的混合多模態智慧體能力,通過“迭代程式設計—互動反饋”的反覆迴圈,將視覺程式設計(Visual Coding)推向新的高度。 據瞭解,阿里真武M890超節點也已成功適配Qwen3.8,通過晶片、雲平臺與千問大模型的全鏈路最佳化,顯著提升推理效率、降低推理成本,在Agentic推理場景中最多可實現1.5倍效能提升。 本文由阿里巴巴提供,量子位獲授權轉載,觀點歸原作者所有。 版權所有,未經授權不得以任何形式轉載及使用,違者必究。 阿里巴巴 量子位的朋友們 當品牌開始爭奪AI的答案:翰智GEO入場 2026-08-03 2026中國科創投資夏季峰會暨陝西科創產業生態大會圓滿落幕 2026-08-03 阿里“千問辦公”開啟公測 2026-08-03 學習強國做了個AI社群,兩週鋪進68座城市 2026-07-31 相關閱讀

tencent/hy3:free 自動生成