Black Forest Labs abre FLUX 3 Video API con audio nativo y renderizado preliminar

El modelo genera clips HD de 20 segundos a partir de texto, imágenes o video, con escalado a Full HD, diálogo multilingüe y sonido sincronizado.

By · Published

Primary source: Black Forest Labs on X

Why it matters

FLUX 3 Video moves Black Forest Labs from image generation into a costly, competitive API market while testing its larger bet on one backbone for media and robotics.

Black Forest Labs opens FLUX 3 Video API with native audio and draft rendering

Robin Rombach (@robrombach), cofundador y CEO de Black Forest Labs, abrió FLUX 3 Video al acceso general de la API el 4 de agosto, dando a los desarrolladores un nuevo modelo para generar video y audio sincronizado a partir de texto, imágenes, fotogramas clave o un clip existente.

https://x.com/bfl_ai/status/2084693191484469305

poster=/api/storage/public-objects/tweet-videos/black-forest-labs-flux-3-video-api-native-audio-poster-fd4aaa24.jpg|Video de @bfl_ai en X

Black Forest Labs anunció el lanzamiento en un hilo en X y detalló la implementación en una publicación de lanzamiento. La versión inicial está disponible a través de la API de Black Forest Labs y socios de distribución seleccionados. Genera clips de hasta 20 segundos en HD, con salida Full HD producida mediante upscaling.

Rombach construyó Black Forest Labs con investigadores como Andreas Blattmann y Patrick Esser después de que su trabajo en difusión latente ayudara a producir Stable Diffusion, el modelo de imágenes abierto que consolidó su posición en la IA generativa. Andreessen Horowitz describió a los fundadores como co-creadores originales de la serie de modelos Stable Diffusion cuando respaldó a Black Forest Labs en 2024. Black Forest Labs opera desde Freiburg, Alemania, y San Francisco.

FLUX 3 Video es el primer movimiento de Black Forest Labs, ampliamente disponible, más allá del mercado de generación de imágenes donde el nombre FLUX ganó adopción. La documentación de FLUX 3 enumera tres modos de lanzamiento: text-to-video, image-to-video y video continuation. Las solicitudes image-to-video pueden fijar múltiples imágenes como cuadros, mientras que video continuation acepta hasta cuatro segundos de video y audio existentes antes de generar lo que sigue.

El modelo puede crear múltiples tomas y ángulos de cámara en una sola generación. Black Forest Labs también dice que puede renderizar texto dentro de las escenas, generar sonido ambiental y efectos, y producir diálogo con sincronización labial en idiomas como English, Chinese, Spanish, French, German, Japanese, Portuguese, Russian, Italian, Indonesian, Turkish, Hindi y Punjabi.

La documentación describe FLUX 3 como un modelo en vista previa incluso cuando Black Forest Labs llama a la versión inicial de generación de video generalmente disponible. La edición de video y un sistema de referencia más amplio que use imágenes y videos siguen en la hoja de ruta. La API actual admite clips a 24 cuadros por segundo, incluida salida Full HD a 1920 por 1088 para una relación de aspecto 16:9.

Borrador primero, renderizado después

Black Forest Labs está emparejando el modelo con un modo Draft diseñado para reducir el costo de probar prompts. Un borrador produce una vista previa más rápida, y un usuario puede entonces enviar ese resultado para un renderizado de calidad completa que preserva los sujetos, la composición y el movimiento de la versión aprobada.

Black Forest Labs dice que el modo Draft cuesta $0.06 por segundo, situando una vista previa de 20 segundos en $1.20. La calculadora pública de precios mostró por separado una tarifa de $0.17 por segundo para su configuración HD seleccionada el día del lanzamiento, o $0.85 por cinco segundos. Ese flujo de trabajo ataca un gasto persistente en video generativo: los creadores a menudo pagan por varias generaciones completas antes de encontrar una dirección usable.

El sistema de borrador a render también le da a Black Forest Labs una distinción de producto más allá de la calidad de salida. Una vista previa de bajo costo que lleve de forma fiable su composición al clip final puede hacer que FLUX 3 sea más fácil de colocar dentro de publicidad, storyboarding y otras cadenas de producción donde la repetibilidad importa tanto como una muestra impresionante.

Las afirmaciones de benchmark de Black Forest Labs permanecen internas

Black Forest Labs dice que los evaluadores humanos prefirieron FLUX 3 en sus evaluaciones internas de text-to-video e image-to-video. La publicación de lanzamiento del 4 de agosto afirma que el modelo empató con Seedance 2.0 de ByteDance en generación image-to-video y superó a los otros sistemas que Black Forest Labs probó. El anuncio de acceso anticipado del 23 de julio reportó tasas de preferencia del 77% frente a Runway Gen-4.5 y del 93% frente a Luma Ray 3.2.

Esos resultados son evaluaciones dirigidas por la empresa más que benchmarks independientes. Black Forest Labs también dijo que el arnés de evaluación y el modelo aún estaban en desarrollo durante el acceso temprano, lo que limita conclusiones directas sobre cómo se compara el lanzamiento en precios, tiempos de generación y cargas de trabajo de producción.

FLUX 3 apareció por primera vez en acceso anticipado el 23 de julio, cuando Black Forest Labs lo presentó como un modelo fundacional multimodal entrenado conjuntamente con imágenes, video y audio. La misma arquitectura base se está adaptando para la predicción de acciones a través de FLUX-mimic, un modelo de robótica desarrollado con mimic robotics y probado en tareas de manufactura en Audi.

Esa arquitectura muestra hacia dónde Rombach está llevando a Black Forest Labs. La generación de video es el primer lanzamiento comercial de un modelo pensado para abarcar creación de medios, percepción y control robótico. Black Forest Labs dice que la generación y edición de imágenes seguirá, junto con FLUX 3 Dev, una versión de pesos abiertos planificada (open-weight) del backbone multimodal.

La expansión cuenta con un respaldo de capital sustancial. En diciembre de 2025, Black Forest Labs recaudó una Serie B de $300 millones con una valoración post-money de $3.25 mil millones, codirigida por Salesforce Ventures y AMP. Participaron Temasek, Bain Capital Ventures, Air Street Capital, Visionaries Club, Canva y Figma Ventures, junto con respaldos existentes como a16z, Nvidia, Northzone, Creandum, Earlybird, BroadLight Capital y General Catalyst.

FLUX 3 Video pone ese financiamiento detrás de un desafío directo a Runway, Luma, Kling, Seedance y los modelos de video de Google. Black Forest Labs entra con investigadores que ayudaron a definir la generación abierta de imágenes, una estrategia de distribución para desarrolladores ya establecida y un modelo diseñado para combinar imagen, movimiento y sonido en una sola solicitud. El lanzamiento del 4 de agosto comienza la prueba más difícil: si ese pedigrí de investigación puede traducirse en cargas de trabajo recurrentes de API para video.

Reader comments

Conversation for this story loads after sign-in.