IA

Presentan FLUX 3, un modelo de IA que genera video, imagen y audio a la vez

El nuevo sistema multimodal aprende de imágenes, videos y sonido en una sola arquitectura y ya supera a modelos como Runway Gen-4.5 y Luma Ray 3.2 en pruebas comparativas de generación de video.

Por Administrador 2 min de lectura28 visualizaciones

Un nuevo modelo de inteligencia artificial llamado FLUX 3 propone entrenar simultáneamente con imágenes, video y audio dentro de una misma arquitectura, en lugar de tratar cada tipo de dato por separado. La idea central es que ninguna modalidad por sí sola alcanza para representar el mundo real: las imágenes captan estructura espacial, el video aporta la dimensión temporal y el movimiento, y el audio revela relaciones causales entre fenómenos físicos y su sonido que la imagen no puede mostrar.

Según sus desarrolladores, cuando el modelo aprende de todas esas fuentes al mismo tiempo, las restricciones mutuas entre ellas —que el sonido coincida con el impacto, que el movimiento respete la masa de los objetos, que el futuro se derive del pasado— mejoran la calidad de lo que genera. El sistema se apoya en una técnica llamada Self-Flow, pensada para alinear de forma eficiente la generación y la comprensión multimodal dentro de una misma base técnica.

Video con audio nativo y comparaciones frente a otros modelos

FLUX 3 puede generar videos de hasta 20 segundos con audio incorporado en una sola pasada, a partir de texto o de referencias visuales como imágenes o clips existentes. En evaluaciones preliminares, realizadas con clips de 10 segundos en 720p, el modelo fue comparado contra otros sistemas de generación de video:

  • Preferido frente a Runway Gen-4.5 en el 77% de los casos
  • Preferido frente a Luma Ray 3.2 en el 93% de los casos
  • Preferido frente a Grok Imagine Video hasta en el 69%
  • Resultados más parejos frente a Kling v3 Pro, Happy Horse v1 y v1.1, Seedance 2.0 y Gemini Omni Flash, con preferencias de entre 52% y 60%

Los propios responsables del proyecto aclaran que estas cifras son preliminares y que esperan mejoras adicionales durante la etapa de acceso anticipado. Entre los puntos fuertes que destacan figuran la captura de expresiones faciales, la asociación entre sonidos y eventos físicos, y capacidades multilingües. El modelo también permite armar secuencias de varios minutos manteniendo la consistencia de los personajes entre escenas mediante referencias visuales.

La versión de video, FLUX 3 Video, ya está disponible en una fase de acceso anticipado. La versión para generación y edición de imágenes, que según los primeros resultados mejora el manejo de instrucciones complejas y la generación de texto en múltiples idiomas respecto a versiones anteriores, se abrirá en acceso anticipado en las próximas semanas.

Un mismo modelo para robótica y predicción de acciones

Además de la generación de contenido, FLUX 3 incorpora capacidades de predicción de acciones, pensadas para su uso en robótica. Esto se trabajó por dos vías: integrando predicción de acciones directamente en el modelo mediante Self-Flow, y usando su base de video como punto de partida para entrenar modelos especializados con poca información adicional.

En esa segunda línea, la empresa de robótica mimic robotics fue una de las primeras en acceder al modelo y desarrolló junto a sus creadores FLUX-mimic, un sistema que combina la base de FLUX 3 con la experiencia de mimic en manipulación robótica de precisión. Según se informó, esta tecnología ya está siendo probada en tareas de producción real en la automotriz Audi.

Los desarrolladores anticiparon que en las próximas semanas y meses irán liberando de forma escalonada nuevas capacidades construidas sobre la misma base multimodal, cada una precedida por una etapa de acceso anticipado para recabar comentarios y realizar pruebas de seguridad. También prometieron publicar más detalles técnicos sobre el enfoque utilizado.

Publicidad

Comentarios

Ingresá para comentar — leer es gratis, comentar también.

Todavía no hay comentarios. Sé el primero en opinar.

Notas relacionadas