Alibaba lanzó Wan3.0, un modelo que genera clips de hasta 30 segundos a partir de documentos, presentaciones, páginas web y hojas de cálculo. La propia compañía reconoce que todavía debe mejorar la precisión de los textos que aparecen en pantalla.
Alibaba lanzó oficialmente Wan3.0, una nueva versión de su modelo de inteligencia artificial para generar videos que incorpora una característica poco habitual entre estas herramientas: además de recibir instrucciones escritas, imágenes, audio o videos, puede utilizar documentos, presentaciones, páginas web y planillas como material de origen.
El sistema puede, por ejemplo, recibir los datos de una hoja de cálculo y transformarlos en gráficos animados dentro de un video, o tomar un informe escrito y convertirlo en una presentación audiovisual narrada. Los clips pueden durar hasta 30 segundos en una única generación, el doble de los 15 segundos admitidos por Wan2.7, su antecesor.
La compañía china había abierto una versión pública de prueba de Wan3.0 el 6 de agosto. Este lunes 24 completó su lanzamiento y lo incorporó comercialmente a Alibaba Cloud Model Studio, su plataforma de desarrollo de herramientas de inteligencia artificial.
De una planilla o un PDF directamente a un video
Wan3.0 admite archivos DOC, XLS, PPT, PDF, TXT, KEY, Pages, Numbers y Markdown, además de enlaces a páginas web. Cada generación permite utilizar un archivo o enlace de hasta 100 MB y un máximo de 50 páginas.
La diferencia frente a los generadores tradicionales de video está en que el usuario no necesita describir desde cero mediante un prompt todo lo que quiere mostrar.
Una presentación puede funcionar como fuente para producir un video; un documento utilizado en una capacitación puede convertirse en material audiovisual; un informe empresarial puede transformarse en un resumen narrado y los números almacenados en una planilla pueden utilizarse para crear gráficos animados.
El usuario acompaña ese archivo con una indicación que determina qué debe hacer el modelo con la información. La IA interpreta entonces el contenido y decide cómo organizarlo dentro de los diferentes planos y escenas del video.
Esto abre un uso diferente al de herramientas pensadas principalmente para crear secuencias cinematográficas a partir de una descripción. El modelo puede recibir información estructurada que ya existe y utilizarla como punto de partida para construir una pieza audiovisual.
El problema: una IA puede cambiar los datos
La posibilidad de cargar una planilla y obtener automáticamente una animación plantea, sin embargo, un problema especialmente relevante cuando el material contiene números, estadísticas o información que necesita reproducirse con exactitud.
Un video puede lucir correcto y, al mismo tiempo, incluir una cifra equivocada, modificar una palabra o representar incorrectamente un gráfico.
Y Alibaba reconoce una de esas limitaciones.
Según la documentación publicada por la empresa, la precisión del texto generado dentro de las imágenes todavía necesita mejoras. La compañía también señala que continúa trabajando sobre la calidad del audio producido por el sistema.
Por eso, convertir automáticamente una hoja de cálculo o un informe en un video no equivale necesariamente a reproducir sus datos de manera exacta.
La documentación técnica de Wan3.0 asegura que el modelo mejoró la representación de gráficos, interfaces y contenidos digitales, pero no publica una medición independiente sobre la tasa de errores al trasladar cifras, textos o tablas desde un documento al video final.
En materiales comerciales o creativos una pequeña desviación puede resultar secundaria. En un informe financiero, una presentación académica, un contenido periodístico o una capacitación, en cambio, cambiar un porcentaje, una fecha o una cifra puede modificar completamente la información original.
Videos más largos y varias referencias al mismo tiempo
Wan3.0 también amplió de 15 a 30 segundos la duración máxima que puede generar de una sola vez. La IA analiza además la instrucción del usuario y puede sugerir cuánto debería durar el video según el contenido solicitado.
Otra de sus novedades es la posibilidad de combinar distintas referencias. El usuario puede proporcionar imágenes, videos, audio y documentos para indicarle al modelo qué personajes, objetos, escenarios o estilos quiere conservar.
Uno de los problemas habituales de los generadores de video es precisamente la continuidad: un personaje puede cambiar de rostro o ropa entre escenas, un objeto puede modificar su forma o un escenario transformarse al cambiar el plano.
Alibaba asegura que Wan3.0 mejoró ese aspecto y puede conservar con mayor estabilidad rasgos de los personajes, vestimenta, objetos, espacios y estilo visual a lo largo de una generación.
El sistema produce videos en resoluciones de 480p, 720p y 1080p. El acceso mediante la API de Alibaba Cloud tiene un precio inicial de USD 0,05 por segundo en 480p, USD 0,10 en 720p y USD 0,20 en 1080p. Un video completo de 30 segundos en la máxima resolución cuesta, por lo tanto, USD 6 según las tarifas publicadas por la compañía.
Desde el comienzo de las pruebas públicas, Alibaba afirmó que Wan3.0 ya fue utilizado para producir cortometrajes, contenidos publicitarios, videos turísticos y musicales.
La posibilidad de convertir directamente documentos y planillas amplía ahora ese campo de aplicación. Pero también traslada a los videos generativos un problema conocido de otros sistemas de inteligencia artificial: cuando el resultado contiene información y no solamente imágenes, que parezca correcto no significa necesariamente que lo sea.
