7月24日,BlackForestLabs宣布以Early Access方式推出Flux3多模态基础模型,该模型采用统一架构联合学习图像、视频和音频。Flux3基于Self-Flow学习框架扩展,同步训练视频、图像和音频,扩大至多模态生成与理解任务。该模型能在单次生成中输出最长20秒的视频,并附带原生音频,支持文生视频、图生视频、视频生视频等多种功能。
在性能方面,Flux3在带声音的10秒、720p视频人工评测中表现优异,对比GrokImagineVideo、Seedance2.0和GeminiOmniFlash的胜率分别为69%、52%和52%。此外,BlackForestLabs正与MimicRobotics合作,研究将Flux3用作机器人行为预测模型。在图像能力方面,Flux3可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。


