量子位 ★ 89 3 min

PPIO正式釋出“Fusion融合模型”:用十分之一的價格超越頂級模型的智商

資訊PPIO

🔗 https://www.qbitai.com/2026/08/467834.html

📌 【PPIO 新功能】用 1/10 的成本超越旗艦模型?Fusion 融合模型開啟「呼叫層」智慧增量

TL;DR:PPIO 推出 Fusion 融合模型,透過多模型並行與編排,以低成本實現媲美頂級模型的智慧。

當單一模型在程式碼生成、數學推理或長文件理解等維度出現「偏科」,且難以自我發現「幻覺」時,工程師該如何應對?PPIO 提出了一個新思路:智慧的提升不一定要依賴增加模型參數,也可以發生在「呼叫層」。

🤔 單一模型架構在 Agent 時代的瓶頸

隨著模型迭代極快,開發者面臨三大挑戰:

  • 模型偏科:沒有任何一個模型能在所有維度(如數學、翻譯、程式碼)同時領先。
  • 幻覺難以偵測:錯誤答案與正確答案在語氣與格式上往往難以區分,單模型架構缺乏第二視角來攔截錯誤。
  • Agent 鏈路風險:在 Agent 任務中,一旦某個步驟因單一模型的視角遺漏或幻覺出錯,後續所有步驟都會隨之走偏,產生高昂的返工成本。

🧩 Fusion 融合模型:將請求轉化為「專家會診」

不同於僅做簡單轉發的傳統 API 閘道器,PPIO 的 Fusion 融合模型會在內部組織多個模型進行協作。其運作流程包含四個步驟:

  1. 請求分發:閘道器將問題同時發送給多個參考模型(Advisors)。
  2. 並行作答:各模型獨立運作,互不干擾。
  3. 思考編排:這是關鍵步驟,透過提取共識、標記分歧、排除錯誤並壓縮上下文,將多方論證彙整。
  4. 融合作答:主模型(Aggregator)基於整理後的資訊生成最終回覆。

💡 智慧增量來自「編排」而非單純的參數規模

這種架構不僅解決了偏科與幻覺問題,還帶來了效能與成本的優勢:

  • 低延遲:由於是並行執行,等待時間取決於最慢的一個模型,不會隨模型數量線性增加。
  • 高穩定性:若某個模型呼叫失敗,閘道器會自動跳過,增加鏈路抗抖動能力。
  • 高成本效益:透過複用已獲得的參考結果,避免重複消耗 Token,實際成本增幅遠低於直覺預期。

📊 以 1/10 成本超越 Claude Fable 5

在專門評估複雜深度研究任務的 DRACO 基準測試中,PPIO 展示了極高的價效比:

評估項目PPIO Fusion 融合模型Claude Fable 5 (單模型)
參考模型Kimi K3, GLM 5.2, MiniMax M3-
融合主模型DeepSeek V4 Flash-
DRACO 評分57.3455.14
總成本¥57.59¥566

實驗證明,即便參與融合的模型單獨看都不是各領域榜首,透過編排層的組織,依然能實現智慧水平的跨越。

🎯 實務啟示:Agent 生產力的公式

PPIO 提出一個關鍵公式:Agent 生產力 = Token 智慧密度 × Agent Loop 時長。 在 Agent 任務中,模型呼叫頻率極高且對延遲、穩定性與成本極度敏感。透過在呼叫層提升「Token 智慧密度」,開發者可以在不依賴單一模型更新的情況下,實現更聰明的 Agent 應用。

🔗 來源

#AI #LLM #PPIO #FusionModel #Agent #MachineLearning #AIArchitecture #DeepLearning #TechNews #ModelFusion

原始資料 量子位 · 收集於 2026-08-07
來源原標題
PPIO正式釋出“Fusion融合模型”:用十分之一的價格超越頂級模型的智商
作者
量子位的朋友们
原始標籤
資訊 · PPIO
原始連結
https://www.qbitai.com/2026/08/467834.html

摘要原文

PPIO正式釋出“Fusion融合模型”:用十分之一的價格超越頂級模型的智商 量子位的朋友們 2026-08-07 09:39:16 來源: 量子位 8月6日,PPIO正式推出智慧模型閘道器新功能Fusion 融合模型。 跟僅做簡單請求轉發的傳統 API 閘道器不同, Fusion 融合模型會將每次呼叫變成一場“專家會診”——閘道器會將複雜任務同時分發給多個各有所長的“專家模型”並行作答,再通過思考編排與交叉驗證,由主模型融合生成最終答案。 Fusion 模型以智慧優先、兼顧價效比:通過工程化的融合手段,把回答質量穩定在頭部旗艦模型梯隊,同時把成本控制在中低梯隊。在 DRACO 深度研究基準測試中, PPIO 用三個開源模型融合後的評分超越了 Claude Fable 5,而成本僅為後者的十分之一。 Fusion 融合模型證明,智慧的提升不再只發生在參數層,它也可以發生在呼叫層。 為什麼 Agent 時代不能只依賴一個模型? 2026 年,大模型市場進入密集迭代期。Claude、GPT、Kimi、GLM 等主流模型幾乎每季度都有新版本釋出,排行榜的頭部位置頻繁更替。對應用開發者而言,可選的模型越來越多,但每個模型都有各自的短板。 從評測資料看,所有的模型能力均存在偏科,並且偏科的方向各不相同。程式碼生成、長文件理解、數學推理、多語言翻譯,當前沒有一個模型在所有維度上同時領先,排行榜頭部位置按任務型別切分後屬於不同的模型。 比偏科更難應對的是幻覺。模型產生幻覺時無法自我發現,錯誤答案和正確答案在語氣、格式、流暢度上沒有區別,模型不會對自己不確定的部分做出標記。法律條款解讀、醫療建議、金融合規這類場景中,錯誤一旦被採納,糾錯成本遠高於重新生成一次答案,而單模型架構下不存在第二個視角來攔截這個錯誤。 偏科和幻覺的根源在於,單個模型對同一問題只有一條推理路徑,一條路徑只能看到一面。複雜問題往往存在多個切入角度,單一路徑的遺漏,只有引入另一條獨立路徑才能發現和補上。 這三個限制在 Agent 場景中的代價尤其大。Agent 逐步執行任務,步驟之間存在依賴關係,一旦某個關鍵步驟因為偏科、幻覺或視角遺漏出錯,後續整條鏈路跟著走偏,產生的返工成本包含錯誤之後所有步驟消耗的 Token。 模型越來越多、迭代越來越快,但單模型的這三個限制不會因為換一個更新的模型就消失,它們是架構層面的問題,需要在架構層面解決。 多模型融合推理:讓每個模型都發揮更大價值 Fusion 融合模型就是為解決上述問題而生的。使用者傳送一次請求,閘道器在內部組織多個模型各自獨立作答,再將這些答案經過篩選和融合後返回一份最終回覆。 市面上常見的 API 閘道器做的是轉發,請求進來,選一條線路發出去,閘道器本身不改變答案的質量。 PPIO 智慧模型閘道器在轉發之外增加了一層編排,讓多個模型的產出在返回之前經過比對和融合,因此閘道器本身成為智慧增量的來源。 一次完整的 Fusion 融合模型呼叫在閘道器內部走四步。 請求分發。 閘道器把問題同時發給多個參考模型。 並行作答。 各個模型獨立作答,互不干擾。 思考編排。 提取共識,標記分歧,排除錯誤,同時壓縮上下文。 融合作答。 主模型基於整理後的多方論證生成最終回覆。 其中第三步決定融合的質量。多個模型給出一致結論的地方互相印證,降低了偏科帶來的盲區;出現衝突的地方被標記出來進一步推敲,為攔截幻覺提供了第二視角;不同推理路徑彙總後覆蓋面大於任何一條單獨路徑,補上了單模型視角遺漏的部分。經過這一步整理,主模型定稿時面對的資訊量遠大於原始問題本身,因此融合結果的質量高於其中任何一個參考模型的單獨作答。 由於多個模型同時執行,等待時間取決於最慢的一個,不會隨模型數量線性增長,因此引入更多視角並不意味著成倍增加延遲。同時,某個模型呼叫失敗時閘道器會跳過該模型繼續完成融合,多路徑的結構反而讓整條鏈路比單模型呼叫更抗抖動。在 Agent 的多輪互動中,同一回合內已獲得的參考結果會被複用,避免重複消耗 Token,所以實際成本增幅遠低於“呼叫了多個模型”這個直覺判斷。每次呼叫經過的模型、消耗的 Token、耗時和成本全部留痕可查,使得智慧水平的變化可度量、可追溯。 用1/10的價格超越頂級模型的智商 在 DRACO 深度研究基準測試(專門評估 AI 智慧體執行複雜深度研究任務的能力)中,PPIO 以 Kimi K3、GLM 5.2、MiniMax M3 為參考模型(Advisors)、DeepSeek V4 Flash 為融合主模型(Aggregator)進行融合模型推理: 評分 57.34 分 ,超越 Claude Fable 5(55.14 分); 總成本僅 ¥57.59 ,是 Claude Fable 5(¥566)的 約 1/10 。 值得一提的是,參與融合的這三個模型單獨拿出來都不是各自賽道的榜首,效能提升的部分是由於編排層產生的。這說明智慧增量可以來自呼叫層的組織方式,不必全部依賴基座模型的參數規模。 Agent 時代,模型呼叫邏輯正在被重構 在 2026 年世界人工智慧大會(WAIC)期間,PPIO 聯合創始人兼 CEO 姚欣提出了 Agent 時代的核心公式: Agent 生產力 = Token 智慧密度 × Agent Loop 時長。 Token 智慧密度決定 Agent 每一步決策的質量上限,Agent Loop 時長決定它能持續執行多久、完成多複雜的任務。 過去提升 Token 智慧密度,只能被動等下一代模型釋出。但是現在,模型的選擇權在使用者手裡,沒有人會被綁死在某一個模型上。PPIO Fusion 融合模型在呼叫層做編排提升智慧密度,讓使用者無感實現智慧的提升。 Agent 的使用方式與人差異很大。人偶爾提問,Agent 高頻呼叫工具、長上下文持續互動、多模型協同,對延遲、穩定性和成本的敏感度遠高於傳統場景。執行主體從人換成 Agent,模型的服務物件隨之重構。 規模上這套能力已經過驗證。截至 2026 年 6 月,PPIO 日均 Token 呼叫量超 1.2 萬億,較 2025 年同期增長超 8 倍。根據灼識諮詢統計,在中國獨立 AI 雲端計算服務提供商中,PPIO 日均 Token 消耗量排名第一。今年 PPIO 入選中國信通院首批“企業級 Token 服務效能攀登基線”,通用場景下跑出 TPS ≥ 55 個/秒、TTFT ≤ 0.9 秒、呼叫成功率 ≥ 99.9% 的指標。 讓大模型從“用得起”走向“用得聰明”,讓大模型從“單智慧”走向“融合智慧”,這是 PPIO 智慧模型閘道器正在做的事。 本文由PPIO提供,量子位獲授權轉載,觀點歸原作者所有。 版權所有,未經授權不得以任何形式轉載及使用,違者必究。 PPIO 量子位的朋友們 阿里影片大模型Wan3.0開啟公測:文件、ppt也能變影片 2026-08-07 螞蟻集團開源Avernet,讓人與智慧體像組織一樣高效協作 2026-08-07 美學升維,流暢突破:榮耀MagicOS11雙架構重塑體驗 2026-08-06 Artificial Analysis榜單:阿里Qwen3.8Agentic能力得分全球第一 2026-08-06 相關閱讀

tencent/hy3:free 自動生成