模型发布

FLUX 3 统一图像、视频与动作预测,视频仍为早期访问

统一多模态路线已经公布,但目前可申请的只有 FLUX 3 Video 早期访问。

2026年7月24日 · 周五深度报告中置信重要度 4/5

本文要点

  • FLUX 从图像模型路线扩展到图像、视频和音频的联合训练。
  • 视频生成进入早期访问,图像与开放权重仍在后续计划中。
  • 动作预测被纳入同一骨干的扩展方向,并先通过选定合作方验证。

阅读辅助

先看数字、证据和来源,再读正文。

3 类联合训练模态
最长 20 秒单次视频时长
4 条 Claim Audit

FLUX 3 在同一训练路线中联合学习图像、视频和音频。

5 个时间点

背景研究 · BFL 在 Self-Flow 中探索用同一架构对齐多模态生成与表征学习;该页面只作技术背景。

6 个来源5 个非 X 来源

FLUX 3 值得关注,因为 Black Forest Labs 首次把自己的主线从图像生成推向了统一的视听建模,并把动作预测接到了同一技术叙事上。当天同时公布的是研究路线、视频早期能力和后续交付计划,完整产品尚未开放。

可核实的范围很清楚:BFL 的官方博客发布于 2026 年 7 月 23 日 15:00 UTC;公司称 FLUX 3 同时从图像、视频和音频中学习,能够联合生成带原生音频的视频;FLUX 3 Video 已可申请 Early Access。与之对应,模型总页仍显示 Coming Soon,图像早期访问被安排在未来数周,动作预测只向选定研究与商业合作方推进。

能力证据还没有达到公开模型发布的完整程度。BFL 没有同步参数规模、训练配比、价格、API 文档、权重许可或完整技术报告。博客中的视频偏好率由厂商自行公布,官方也明确称模型与评测框架仍在开发,结果属于初步评估。

这让开发者和企业买方需要先判断“现在能拿到什么”。创作者可以申请视频早期访问;研究团队可以观察统一表征与动作预测路线;但任何需要预算、延迟、稳定性、可部署权重或独立质量数据的采购决定,都还缺少关键输入。

发布边界先于能力清单

FLUX 3 的公告把四类能力放在同一张路线图上,但它们处于不同阶段。把这些状态压成一句“FLUX 3 已发布”会掩盖最重要的信息:只有视频入口已经开放,而且仍是 Early Access。

能力官方披露的技术状态截至本期的开放状态不能据此推出
视频与音频可从文本、图像或视频参考生成带原生音频的视频FLUX 3 Video 可申请早期访问已全面 GA,或任何账号都能调用公开 API
图像可合成与编辑多种风格、比例和分辨率的图像官方称未来数周开放早期访问当前已经可用,或已达到最终发布质量
动作预测可原生预测动作,也可把视频骨干微调成专用动作模型通过 mimic 等选定合作方推进已公开机器人 API、通用权重或标准化部署方案
开放权重骨干计划支持内容生成和动作预测FLUX 3 Dev 列入未来数周至数月计划权重、许可证和训练代码已经发布

博客的元描述写着“Now available in Early Access”,如果脱离正文容易被理解成整个 FLUX 3 产品族已经开放。正文给出的精确状态是 FLUX 3 Video is now available in Early Access;图像段落使用的是“will open up an early access phase in the following weeks”。模型页顶部的 Coming Soon 又进一步确认,完整模型并未全面可用。

发布计划也没有给出精确日期。BFL 只说未来数周至数月将逐项开放视频与音频 API、私有权重、合作方动作预测、图像 API、图像私有权重,以及用于内容创作和动作预测的开放权重骨干。报道因此不能把路线图项目写成当天已交付能力。

三种模态如何进入同一训练路线

BFL 对技术动机的解释是,不同模态是同一物理世界的不完整投影。图像提供空间结构,视频恢复时间和动态,音频补充视觉无法直接捕捉的声学因果关系;这些信号共同约束模型,迫使其学习比单一模态更一致的世界表示。

FLUX 3 建立在 Self-Flow 路线上。BFL 将 Self-Flow 描述为在同一基础架构中对齐多模态生成与理解的方法,并称 FLUX 3 在此基础上扩大算力和数据规模,同时训练视频、图像与音频。这里的“统一”指联合训练和共享的底层路线,不足以证明面向用户的所有能力已经由一个完全相同、可直接调用的检查点提供。

官方列出的当前视频能力包括文生视频、图生视频、视频到视频、视听续写、关键帧到视频、多语言对话,以及把片段串成更长多镜头序列。单次生成最长可到 20 秒并带原生音频;“数分钟序列”则依赖多个片段组合,不应误写成一次调用就能生成数分钟连续视频。

图像能力处于更早阶段。BFL 称模型在中期训练的初步评估中相对早期 FLUX 版本有明显改进,尤其涉及复杂提示和文字生成,但没有公开可复核分数。官方同时写明,图像结果还会在发布前继续改进,因此它更接近能力预告,而不是成熟产品验收。

厂商预评测提供了什么信号

BFL 用 10 秒、720p、带音频的文生视频片段进行了早期比较。官方称,FLUX 3 在与 Grok Imagine Video 的比较中最高获得 69%偏好率,对 Kling v3 Pro 为 60%,对 Seedance 2.0 和 Gemini Omni Flash 均为 52%;对 Runway Gen-4.5 和 Luma Ray 3.2 分别为 77%93%

这些数字能说明 BFL 已经用一组竞品对照检查自己的视频输出,也说明音频不是后加的独立展示项。但它们不能支持“FLUX 3 已被独立证明领先”。博客没有同步完整提示集、样本数、评审人数、随机化方法、置信区间、失败样本和竞品具体调用配置;不同服务的版本、默认设置与安全过滤也会影响结果。

评测要素已披露仍缺失
样本形态10 秒、720p、带音频的文生视频完整提示集与样本量
结果形式与多款产品的成对偏好率评审构成、盲测流程与置信区间
模型阶段模型与评测框架仍在开发可长期复现的版本号
产品条件FLUX 3 Video 进入早期访问API 参数、价格、速度和并发

偏好评测还有一个结构性限制:它把画面、运动、声音和整体观感压成一个选择,却不告诉读者模型在哪类错误上失败。对生产使用者而言,人物一致性、口型与语音同步、物理连续性、文字准确性、提示遵循、版权过滤和长镜头漂移需要分别测量。厂商给出的总偏好率适合当作候选信号,不适合代替任务级验收。

动作预测是延伸方向,不是已开放产品

BFL 为动作预测描述了两条路线。一条把原生动作预测直接纳入 FLUX 3;另一条把预训练视频骨干当作理解动态的基础,再用有限的任务数据微调专用动作模型。前者是一项架构主张,后者已经通过与 mimic robotics 的合作形成 FLUX-mimic。

FLUX 3 主博客与 FLUX 3 x mimic 文章的页面元数据都标注为 2026 年 7 月 23 日 15:00 UTC,所以机器人合作不是拿旧项目为当天发布凑背景,而是同批披露的一部分。Mimic 文章称,FLUX-mimic 是建立在 FLUX 3 骨干上的视频—动作模型,相关机器人已经在 Audi 测试和部署;这仍是 BFL 与合作方的陈述,不是 Audi 发布的独立生产报告。

Self-Flow 研究被用于解释这条路线。BFL 称相关实验中,动作预测达到给定成功率所需训练步数约为不使用 Self-Flow 的视频模型的一半;Mimic 文章又引用 mimic-video 工作中视频—动作模型相对视觉—语言—动作模型最高 10 倍样本效率。两个数字来自不同实验背景,不能相乘,也不能外推为 FLUX-mimic 在 Audi 的实际提效。

动作预测的真正门槛也不同于视频生成。生成视频的坏样本可以丢弃,机器人错误动作会产生设备、人员和停线风险。要把“共享世界表示”变成可采购能力,还需要任务定义、现场成功率、异常恢复、动作约束、人工接管、仿真到现实偏差和安全认证。当天材料尚未给出这些生产口径。

早报观点

FLUX 3 最有价值的变化,是 BFL 不再把视频视为图像产品旁边的一条独立功能线,而是把图像、声音、时间动态和动作放进同一个表征问题。对一家以图像模型成名的公司而言,这扩大了它可以争夺的市场,也把技术评价从“单张图是否好看”推向“跨时间和跨模态是否一致”。

但路线统一不等于产品统一,更不等于能力已经完成交付。模型页仍是 Coming Soon,图像入口尚未开放,动作预测只在合作项目中出现,开放权重也只是计划。此时过度强调机器人愿景,会把最容易验证的产品事实——视频早期访问——淹没在尚未公开复现的架构叙事里。

更稳妥的判断是,BFL 已经给出一条从内容生成走向世界建模的路线,并用视频早期访问和 FLUX-mimic 展示两个出口;真正决定这条路线含金量的,将是同一骨干能否在公开条件下同时保持视听质量、动作样本效率和部署安全。价格、权重、第三方评测与生产指标缺一不可。

何时能从路线图进入可验证产品

视频早期访问首先要补齐公开接口条件。若 BFL 发布 API,外部团队才能在同一提示、分辨率、时长和音频设置下测试偏好率,并记录延迟、拒绝率、失败率和单位成本。私有权重访问也需要说明部署门槛、使用许可和安全限制。

图像与开放权重骨干的进度能够检验“统一”的实际含义。值得观察的是,它们是否共享同一检查点、同一编码方式和同一能力更新节奏,还是以多个专用模型共享预训练表示。两种方案都可能有效,但对研究复现、缓存设计、硬件预算和微调方式的影响完全不同。

动作预测需要更严格的合作方数据。FLUX-mimic 若要从案例走向证据,应公开 Audi 场景中的任务种类、试验次数、成功定义、异常恢复频率、人工干预和安全边界,并把实验室结果与生产部署分开报告。只有这样,“在机器人上运行”才不会被误读成已经具备通用工业自动化能力。

训练数据披露也是后续缺口。BFL 的通用透明度页面称 FLUX 家族使用自有混合文本和图像数据,包括第三方购得数据、标注服务、使用数据、合成数据与内部生成数据;它没有针对 FLUX 3 单独解释视频、音频与机器人数据的来源和授权。随着模型从图像扩展到声音、视频和动作,数据许可、人物声音权利与生产现场数据边界都需要更具体的说明。