🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 科技 采集 2026-07-24T10:30:08+00:00

FLUX 3 多模态AI模型登场:支持单次生成20秒多样化视频

原始标题:FLUX 3 多模态 AI 模型登场:支持单次生成 20 秒多样化视频

来源
ithome
发布时间
2026-07-24T06:48:04
采集批次
2026-07-24-10
字数
513
URL 指纹
59d33eb1b54c6541

📌 AI 总结(210 字)

Black Forest Labs于7月23日发布FLUX 3多模态基础模型,采用统一架构联合学习图像、视频与音频。该模型基于Self-Flow自监督流匹配框架训练,单次可生成最长20秒带原生音频的视频,支持文生视频、图生视频、视频生视频、多镜头串联等多种功能。在带声音的720p视频评测中,FLUX 3对比Grok Imagine Video胜率达69%,并正与Mimic Robotics合作探索机器人行为预测应用。
📄 正文(513 字)
Black Forest Labs 昨日发布博文,宣布以 Early Access 方式上线推出 Flux 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。

在训练方面,该模型基于 Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在 FLUX.1 和 FLUX.2 系列基础上,扩大至多模态生成与理解任务。

FLUX 3 可在单次生成中输出最长 20 秒的视频,并附带原生音频。官方表示该模型支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话,以及多镜头串联。

性能方面,在带声音的 10 秒、720p 视频人工评测方面,结果显示,FLUX 3 对比 Grok Imagine Video 的胜率为 69%,对比 Seedance 2.0 的胜率为 52%,对比 Gemini Omni Flash 的胜率也为 52%。

在机器人方向,Black Forest Labs 正与 Mimic Robotics 合作,研究将 FLUX 3 用作机器人行为预测模型。

图像能力方面,官方称 FLUX 3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。