FLUX 3 是什么?功能、Early Access 与上线进度详解
基于已公布资料梳理 FLUX 3:Black Forest Labs 面向图像、视频、原生音频与动作的多模态模型,以及已确认能力和仍待公布的信息。
FLUX 3 是 Black Forest Labs 推出的新一代多模态模型家族,目标是在同一个系统中生成和理解图像、视频、音频与动作。它不只是一次图像模型升级:BFL 将其描述为一个跨视觉和音频联合训练的基础模型,并计划分阶段开放视频生成、图像生成与编辑、动作预测等能力。
最容易被误读的是它的开放状态。FLUX 3 目前尚未全面开放,但也已经不只是传闻或占位页面。Black Forest Labs 于 2026 年 7 月 23 日正式发布 FLUX 3 公告,并为 FLUX 3 Video 开启有限 Early Access。Image Early Access 计划在随后数周启动。正式开放日期、公开 API 价格和完整技术规格仍未公布。
MuseFable 目前还不能直接生成 FLUX 3 内容。你可以先查看实时进度并加入 FLUX 3 候补名单,模型在本站可用时,我们会向你的账户邮箱发送一封通知。
FLUX 3 与此前模型有什么不同?
此前的 FLUX 系列主要以图像生成和编辑见长。FLUX 3 将范围扩展到图像、视频和音频的联合学习。BFL 表示,这种共享训练让模型可以混合不同输入与输出模态,而不是为每一种任务调用互不相关的独立模型。
这对跨媒体工作流很重要。参考图片可以指导视频,已有视频可以把同一个角色带入新场景,声音则能与画面一起生成,而不是在不了解画面事件的情况下事后配上去。
BFL 将 FLUX 3 与 Self-Flow 研究路线联系起来。这项方法旨在同一个架构内对齐多模态生成与理解。公司尚未发布完整的 FLUX 3 模型卡、训练细节、参数量或推理需求,因此公告之外的技术说法都应视为暂定信息。
已确认的 FLUX 3 Video 能力
FLUX 3 Video 是第一个进入 Early Access 的分支。根据 BFL 公告,它支持:
- 带原生音频的文生视频。
- 从起始帧或视觉参考进行图生视频。
- 使用参考片段进行视频转视频。
- 基于现有视频与音频继续生成后续内容。
- 在指定关键帧之间生成可控过渡。
- 多语言对白和广泛的视觉风格。
- 单次生成最长 20 秒的视频。
- 将多个片段串联为更长的多镜头序列。
BFL 的初步评测使用了 10 秒、720p、带音频的视频。公司公布了与多个当前视频模型的偏好对比结果,同时也明确表示模型和评测框架仍在持续改进。这些是厂商发布的早期结果,并非独立基准测试。
Image、Action 与 Dev 版本
FLUX 3 Image 面向多种风格、画幅和分辨率的图像生成与编辑。BFL 强调,相比此前 FLUX 版本,新模型对复杂提示词和多语言文字渲染的处理有所提升。Image Early Access 计划在首轮 Video 开放后启动。
FLUX 3 Action 将同一个世界模型基础用于动作预测。BFL 同时在开发原生动作预测能力,以及从视频基础模型派生的专用模型。首个公开合作方是 mimic robotics。这个分支目前面向研究和指定商业伙伴,并不是普通创作工具已经可以使用的功能。
FLUX 3 Dev 是计划开放权重的多模态基础模型。BFL 已在发布路线中列出它,但尚未公布许可协议、模型权重、硬件要求或发布日期。在官方条款公布前,不应假设它会完全沿用旧版 FLUX Dev 的许可方式。
FLUX 3 发布了吗?
准确说法是:部分能力已进入有限 Early Access。
- FLUX 3 Video: 已通过 BFL Early Access 向部分用户开放。
- FLUX 3 Image: 计划在随后数周进入 Early Access。
- FLUX 3 Action: 计划向指定研究和商业伙伴开放。
- FLUX 3 Dev: 已公布为未来开放权重的多模态基础模型。
- 公开价格和通用 API: 尚未公布。
一篇较早发布的 Kie.ai 介绍记录了模型处于占位页面阶段时的线索和疑问。它发布在 BFL 完整公告之前,因此其中“尚无正式发布或候补入口”等描述已在 7 月 23 日晚些时候被官方信息更新。它适合用于了解公告前的背景,不应作为当前开放状态的主要来源。
FLUX 3 与 FLUX.2 有什么区别?
FLUX.2 聚焦图像生成和编辑。FLUX 3 保留图像能力,同时把视频、原生音频和动作预测纳入同一个多模态基础模型。更大的变化是架构范围:FLUX.2 是图像模型家族,而 FLUX 3 被定位为理解视觉与物理序列的模型。
这并不表示 FLUX 3 现在一定是更合适的生产选择。FLUX.2 和其他已发布模型拥有明确接口、价格和运行限制,FLUX 3 仍处于受限访问阶段,公开规格也不完整。
等待期间可以用什么?
如果你现在就要制作图像或视频,可以先使用已发布模型,并保持工作流可迁移:
- 使用 GPT Image 2 生成图像,完成提示词驱动的图像创作与编辑。
- 使用 Seedance 2.0 Fast 生成视频,快速制作视频草稿。
- 创建一个产品内容包,把图像、视频、语音与文案组合起来。
- 把脚本制作成一条AI 解说视频。
这些工具可以先验证提示词、参考素材、品牌规则和审核步骤。等到 FLUX 3 可以在本站稳定使用时,模型就能进入已有工作流,而不必让团队围绕尚未发布的规格从头设计流程。
常见问题
现在可以在本站使用 FLUX 3 吗?
暂时不能。MuseFable 只会在接入稳定、价格与运行限制明确后,将模型标记为可用。你现在可以先加入 FLUX 3 候补名单。
FLUX 3 会生成音频吗?
会。BFL 表示 FLUX 3 Video 会随视频一起生成原生音频,包括多语言对白和与画面事件相对应的声音。
FLUX 3 视频最长多少秒?
BFL 表示单次可生成最长 20 秒的带音频视频。其公开的初步评测使用了 10 秒、720p 输出。
FLUX 3 是开源模型吗?
BFL 已公布未来会推出开放权重的 FLUX 3 Dev 基础模型,但权重、许可协议、发布日期和硬件要求尚未发布。
FLUX 3 价格是多少?
公开 API 价格尚未公布。在 BFL 或受支持服务商正式公布费率前,任何具体价格都只是猜测。