Latent Space ★ 113 3 min

[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model

🔗 https://www.latent.space/p/ainews-black-forest-labs-flux-3-multimodal

這是一篇產業新聞型別的技術報導。

📌 【Black Forest Labs 重磅釋出】FLUX 3 登場:多模態流模型挑戰現有 SOTA 基準

TL;DR:Black Forest Labs 推出 FLUX 3,具備多模態生成能力與原生音訊,挑戰現有頂尖模型。

雖然 OpenAI 近期推出了 ChatGPT Voice 與 OpenAI Presence,但在技術影響力上,Black Forest Labs (BFL) 剛釋出的 FLUX 3 Video 顯然更具里程碑意義。這家在 2024 年推出 Flux 1 後便暗示過影片能力的團隊,終於透過全新的「Self Flow」架構,將多模態生成推向新高度。

🧩 Self Flow 架構:實現全模態的整合輸出

FLUX 3 的核心技術在於其「Self Flow」架構,這讓模型能同時處理多種模態,且所有輸出皆具備「原生音訊生成」(native audio generation)的能力。

其核心功能包含:

  • 影像轉影片 (Image-to-video):可從起始幀進行動畫化,或將影像作為視覺參考。
  • 影片轉影片 (Video-to-video):從參考影片中保留核心元素(例如同一個角色),並將其放入新的場景或語境中。
  • 影片與音訊生成續接 (Generative video-audio continuation):根據輸入的影片與音訊進行續接生成。
  • 關鍵幀轉影片 (Keyframe-to-video):在定義好的時刻之間實現受控的轉換。
  • 代理鏈結 (Agentic chaining):將單個片段鏈結成更長的、包含多個鏡頭的序列。

📊 具備高風格多樣性與強大的文字生成能力

FLUX 3 在視覺風格的覆蓋範圍極廣,從寫實的隨手拍攝影片 (candid camcorder footage) 到動畫與電影感畫面皆能輕鬆駕馭。此外,它在文字排版生成 (typography generation) 與動態設計方面也展現了強大實力。

根據目前的觀察,FLUX 3 的多項功能已達到目前業界最頂尖(SOTA)的水準,足以與 Grok Imagine 等前沿實驗室的模型一較高下。

💡 開發者關注:開源版本即將推出

除了強大的模型能力,社群最關注的莫過於開放權重。目前已知 BFL 正在準備釋出開發者版本(Dev version)的開源權重,這將為開發者提供強大的開發基礎。此外,團隊同時宣佈了 FLUX3-mimic,進一步證明瞭 FLUX 3 的技術影響力。

🎯 實務啟示

對於需要整合影像與音訊的開發者來說,FLUX 3 的原生音訊生成與多模態整合能力,大幅簡化了從視覺到聲響的對齊流程。隨著開發者版本(Dev version)的推出,預計將會對影片生成與角色一致性的工作流產生深遠影響。

🔗 來源

#AI #BlackForestLabs #FLUX3 #GenerativeVideo #Multimodal #SelfFlow #MachineLearning #ComputerVision #OpenWeights #AIVideo

tencent/hy3:free 自動生成