Alibaba ha presentado Wan 3.0, su nuevo modelo de inteligencia artificial para generar vídeos a partir de instrucciones escritas, imágenes, clips, audios o documentos. La herramienta, que ya está disponible en beta pública a través de Model Studio, permite crear escenas de hasta 30 segundos con movimiento de cámara, diálogos y efectos sonoros integrados. Este lanzamiento llega pocas semanas después de que la compañía china presentara Qwen 3.8-Max, su modelo de lenguaje de gama alta, y refuerza su apuesta por el contenido multimedia generativo.
La función más llamativa de Wan 3.0 es su capacidad para transformar una presentación de PowerPoint, un PDF o una página web en un vídeo narrado. El usuario solo tiene que escribir un prompt, adjuntar el material de referencia y la IA se encarga de construir una pieza audiovisual con explicaciones habladas, animaciones y una puesta en escena automática. Esta característica abre la puerta a convertir documentos técnicos o materiales formativos en vídeos sin necesidad de edición manual.
Múltiples referencias y duración ampliada
Una de las mejoras más destacadas de Wan 3.0 frente a su predecesor es el soporte para múltiples tipos de referencia. El modelo puede combinar en una misma petición hasta diez imágenes, cinco clips de vídeo y cinco archivos de audio, además de un documento o una página web que sirvan como contexto. Esto permite crear escenas complejas con una coherencia narrativa mucho mayor que en versiones anteriores.
La duración máxima de los clips se ha duplicado, pasando de los 15 segundos de Wan 2.7 a los 30 segundos actuales. No obstante, el usuario puede ajustar la extensión de forma manual, segundo a segundo, o dejar que el sistema recomiende una duración adecuada según la complejidad de la instrucción. Las resoluciones de salida disponibles son 480p, 720p y 1080p, con relaciones de aspecto fijas o adaptables para distintas plataformas.
Audio generado automáticamente y sincronizado
Otra novedad relevante es que Wan 3.0 genera audio por defecto. Los personajes pueden hablar o cantar de forma sincronizada con la escena, y la IA también incorpora sonidos ambientales que se ajustan al contenido visual. Esta capacidad es especialmente útil para vídeos explicativos, anuncios breves o materiales de formación, donde la coordinación entre imagen y sonido resulta esencial. Si el usuario lo prefiere, también es posible solicitar un clip sin audio para añadir posteriormente una locución o banda sonora.
La sincronización entre labios, movimientos y efectos sonoros ha mejorado notablemente, reduciendo las inconsistencias que eran habituales en generaciones anteriores. Esto convierte a Wan 3.0 en una herramienta práctica para crear videotutoriales, demostraciones de software o contenidos para redes sociales sin necesidad de un equipo de producción.
Conversión de documentos y limitaciones
La función estrella de Wan 3.0 es la conversión de presentaciones y documentos en vídeos narrados. La IA puede leer un PDF, una presentación o una página web y utilizar su contenido como base para generar una secuencia audiovisual. Por ejemplo, un PowerPoint con varias diapositivas puede transformarse en un vídeo que explique sus puntos principales mediante escenas, texto en pantalla y voz. Sin embargo, existe una limitación importante: en cada generación solo se puede introducir un documento o una página web, pero no ambos a la vez.
Alibaba también ha mejorado la representación de elementos digitales, como interfaces de software, gráficos en movimiento y texto integrado en la imagen. Este tipo de contenido suele ser problemático para los generadores de vídeo, pero Wan 3.0 reduce las distorsiones entre fotogramas, lo que facilita la creación de vídeos técnicos y formativos con una precisión visual aceptable.
Disponibilidad y orientación profesional
Wan 3.0 está disponible en beta pública a través de Model Studio, la plataforma de desarrollo de IA de Alibaba Cloud. Al encontrarse todavía en fase de pruebas, el rendimiento y los tiempos de generación pueden variar. La compañía orienta esta herramienta a profesionales que necesitan producir anuncios cortos para redes sociales, materiales de entrenamiento para robots o conversión de documentos técnicos en vídeos narrados. También contempla su uso en el ámbito corporativo, donde la generación automática de vídeos a partir de presentaciones puede ahorrar horas de trabajo.
El lanzamiento de Wan 3.0 se produce en un momento en el que la generación de vídeo por IA está ganando protagonismo. A diferencia de otros modelos que aún no han salido de fase experimental, Alibaba ha optado por ofrecer acceso público desde el primer día, lo que permite a los usuarios probar la herramienta y reportar fallos. Esta estrategia contrasta con la de otros competidores, que han sido más cautelosos a la hora de lanzar sus sistemas.
En definitiva, Wan 3.0 se presenta como una solución versátil para crear vídeos a partir de múltiples fuentes, con audio sincronizado y una duración máxima de 30 segundos. Su capacidad para convertir documentos en piezas audiovisuales la convierte en una opción atractiva para empresas y creadores de contenido, aunque la limitación de una sola fuente por generación y la resolución máxima de 1080p dejan margen de mejora. La beta pública ya está activa, y será interesante ver cómo evoluciona el modelo en los próximos meses.