程式忍者PGNinja

Hacker News

FLUX 3 Image 推出,精準控制影像生成佈局

· FLUX 3 Image 能依文字與方框精準控制畫面佈局,單張生成最高 4K 解析度影像。

FLUX 3 Image 是 Black Forest Labs 推出的影像生成與編輯模型,屬於該公司 FLUX 3 系列的一部分。這個模型要解決的問題是,過去的 AI 繪圖工具很難精準控制畫面裡每個物件的位置,FLUX 3 Image 讓使用者能用文字描述,也能用更精細的版面設定來生成圖片。

使用者可以在一張 0 到 1000 的座標格線上畫出方框,替每個方框填上描述文字,模型就會把對應內容畫在指定區域裡。它也支援像素級的局部編輯,能同時修改多個元素,例如改變顏色、置換物件或調整位置,同時保留畫面其他部分不受影響。模型最高可輸出 5456 乘 3072 像素的 4K 影像。

官方說明這個模型是「原生訓練來理解版面與構圖」的,所以能辨識元素之間的空間關係,編輯局部時能維持整體一致。目前 FLUX 3 Image 以商用授權方式提供給需要大量生成影像的企業,可透過官方 Playground 或 API 使用,並非直接公開原始碼。

對正在學程式或對 AI 繪圖有興趣的孩子,這則新聞比較偏產業面,模型本身沒有公開原始碼可以下載練習,但「用座標格線精準控制畫面」的概念,很適合用來說明程式裡常見的座標與區域概念,是生活中數學與程式結合的例子。

AI影像生成技術產品

其他新聞