科大訊飛釋出星火Token Factory,打造企業級AI模型智慧路由與治理新底座
https://www.qbitai.com/2026/07/457359.html📌 【科大訊飛】推出星火 Token Factory:解決企業 AI 規模化落地中的成本與治理挑戰
TL;DR:星火 Token Factory 透過智慧路由與推理引擎,協助企業在多模型環境下達成成本最佳化與高效運營。
隨著企業將 AI 深度融入研發、生產與客服等核心業務,大模型應用已從單點試點轉向多場景協同。然而,面對模型種類激增、呼叫成本攀升及系統穩定性要求提高等問題,企業正從單純的「模型能力建設」轉向「AI 基礎設施建設」,尋求如何讓模型能力真正融入業務體系並實現統一管理。
🤔 面對規模化應用的管理難題
當前企業在推動 AI 規模化時,普遍面臨以下挑戰:
- 資源利用率不彰:不同任務(如簡單的文本分類 vs. 複雜的長檔案分析)對模型能力需求差異巨大,若統一使用高階模型,會導致 Token 成本過高。
- 管理複雜度提升:多模型並行執行對系統穩定性、安全治理與運營監控提出了更高要求。
- 部署成本壓力:在國產化私有部署場景下,如何提升算力利用率是降低成本的關鍵。
🧩 星火 Token Factory:介於應用與模型間的中間層
星火 Token Factory 定位為企業應用與大模型之間的統一中間層,提供「接入—治理—觀測—運營」的完整閉環,核心能力包含:
💡 智慧路由:根據任務複雜度精準匹配資源 平臺會綜合考慮 Prompt 長短、規則預置、自定義規則、對話輪次、Session 親和性等多維度特徵來判定任務複雜度,將請求分為 L1 至 L3 三個等級。
- 匹配機制:綜合「質量、成本、延遲、可用性、安全等級」五個因子,讓簡單任務使用高價效比模型,複雜任務匹配高能力模型。
- 效能表現:決策平均延遲可控制在 100 毫秒以內。
💡 推理引擎:針對昇騰硬體進行端到端最佳化 針對國產化私有部署場景,該引擎針對昇騰(Ascend)硬體特性進行了深度工程最佳化:
- 記憶體最佳化:透過模型壓縮與精度最佳化技術,降低視訊記憶體(Video Memory)佔用,以承載更大規模模型與長上下文。
- 計算與通訊:融合核心計算運算元,並對通訊進行排程重排,實現計算與通訊的並行重疊。
- 快取管理:透過分散式 KV Cache 管理與上下文感知(Cache-Aware)策略,提升長上下文與高併發下的快取命中率。
- 解碼加速:引入並行解碼加速機制,縮短生成密集場景的端到端延遲。
📊 實測成效:推理效率提升 5 倍
在相同硬體條件下,針對主流開源模型的基準測試顯示:
- 推理效率:相較於開源 vLLM-Ascend 框架提升約 5 倍。
- 延遲最佳化:首 Token 延遲(First Token Latency)降低 30%–40%。
🎯 實務啟示
對於正在進行 AI 規模化轉型的企業,建立一個具備「智慧路由」能力的基礎設施,能有效解決「一刀切」使用高階模型所帶來的預算浪費。同時,針對特定硬體(如昇騰)進行底層推理最佳化,是提升國產化私有部署效能與降低總體擁有成本(TCO)的關鍵路徑。
🔗 來源
- 標題:科大訊飛釋出星火Token Factory,打造企業級AI模型智慧路由與治理新底座
- 連結:https://www.qbitai.com/2026/07/457359.html
#AI #LLM #MachineLearning #iFLYTEK #TokenFactory #AIInfrastructure #SmartRouting #InferenceOptimization #Ascend #EnterpriseAI
由 tencent/hy3:free 自動生成