Este mes, OpenAI anunció un nuevo sistema de IA generativa llamado Sora, que produce vídeos cortos a partir de indicaciones de texto. Si bien Sora aún no está disponible para el público, la alta calidad de los resultados de muestra publicados hasta ahora ha provocado tanto entusiasmado y preocupado reacciones.
El vídeos de muestra publicados por OpenAI, que según la compañía fueron creados directamente por Sora sin modificaciones, muestran resultados de mensajes como «video fotorrealista de primer plano de dos barcos piratas luchando entre sí mientras navegan dentro de una taza de café» e «imágenes históricas de California durante la fiebre del oro†.
A primera vista, a menudo es difícil decir que son generados por AIdebido a la alta calidad de los videos, texturas, dinámica de escenas, movimientos de cámara y un buen nivel de consistencia.
El director ejecutivo de OpenAI, Sam Altman, también publicó algunos videos en X (anteriormente Twitter) generados en respuesta a indicaciones sugeridas por los usuarios, para demostrar las capacidades de Sora.
¿Cómo funciona Sora?
Sora combina características de herramientas de generación de texto e imágenes en lo que se llama «unmodelo de transformador de difusión.»
Los transformadores son primero un tipo de red neuronal. introducido por Google en 2017. Son más conocidos por su uso en grandes modelos de lenguaje como ChatGPT y Google Gemini.
Los modelos de difusión, por otro lado, son la base de muchos generadores de imágenes de IA. Funcionan comenzando con ruido aleatorio e iterando hacia una imagen «limpia» que se ajuste a un mensaje de entrada.


Se puede hacer un vídeo a partir de una secuencia de dichas imágenes. Sin embargo, en un vídeo la coherencia y consistencia entre fotogramas son fundamentales.
Sora utiliza la arquitectura transformadora para manejar cómo se relacionan los marcos entre sí. Si bien los transformadores fueron diseñados inicialmente para encontrar patrones en tokens que representan texto, Sora usa tokens que representan pequeños fragmentos de espacio y tiempo.
Liderando la manada
Sora no es el primer modelo de conversión de texto a video. Los modelos anteriores incluyen Emú por meta, Generación 2 por pista, Difusión de vídeo estable por Stability AI, y recientemente Lumière por Google.
Lumiere, estrenada hace apenas unas semanas, reclamado producir mejores vídeos que sus predecesores. Pero Sora parece ser más poderoso que Lumiere al menos en algunos aspectos.
Sora puede generar vídeos con una resolución de hasta 1920 × 1080 píxeles y en una variedad de relaciones de aspecto, mientras que Lumiere está limitado a 512 × 512 píxeles. Los videos de Lumiere duran alrededor de 5 segundos, mientras que Sora hace videos de hasta 60 segundos.
Lumiere no puede hacer videos compuestos de múltiples tomas, mientras que Sora sí. Sora, al igual que otros modelos, también es capaz de realizar tareas de edición de vídeo, como crear vídeos a partir de imágenes u otros vídeos, combinar elementos de diferentes vídeos y ampliar vídeos en el tiempo.
Ambos modelos generan vídeos ampliamente realistas, pero pueden sufrir alucinaciones. Los videos de Lumiere pueden reconocerse más fácilmente como generados por IA. Los videos de Sora parecen más dinámicos y tienen más interacciones entre elementos.
Sin embargo, en muchos de los vídeos de ejemplo, las inconsistencias se hacen evidentes tras una inspección minuciosa.
Aplicaciones prometedoras
Actualmente, el contenido de vídeo se produce filmando el mundo real o utilizando efectos especiales, lo cual puede resultar costoso y llevar mucho tiempo. Si Sora está disponible a un precio razonable, la gente podría empezar a utilizarlo como software de creación de prototipos para visualizar ideas a un coste mucho menor.
Según lo que sabemos sobre las capacidades de Sora, incluso podría usarse para crear videos cortos para algunas aplicaciones en entretenimiento, publicidad y educación.
OpenAI documento técnico sobre Sora se titula «Modelos de generación de vídeo como simuladores mundiales». El artículo sostiene que versiones más grandes de generadores de vídeo como Sora pueden ser «simuladores capaces del mundo físico y digital, y de los objetos, animales y personas que viven en él». dentro de ellos.»
Si esto es correcto, las versiones futuras pueden tener aplicaciones científicas para experimentos físicos, químicos e incluso sociales. Por ejemplo, se podría comprobar el impacto de tsunamis de diferentes tamaños en diferentes tipos de infraestructura y en la salud física y mental de las personas cercanas.
Lograr este nivel de simulación es un gran desafío y algunos expertos dicen que un sistema como Sora es fundamentalmente incapaz de hacerlo.
Un simulador completo necesitaría calcular reacciones físicas y químicas en los niveles más detallados del universo. Sin embargo, simular una aproximación aproximada del mundo y hacer vídeos realistas para los ojos humanos podría estar al alcance de la mano en los próximos años.
Riesgos y preocupaciones éticas
Las principales preocupaciones en torno a herramientas como Sora giran en torno a su impacto social y ético. En un mundo ya plagado de desinformaciónherramientas como Sora pueden empeorar las cosas.
Es fácil ver cómo la capacidad de generar videos realistas de cualquier escena que puedas describir podría usarse para difundir noticias falsas convincentes o arrojar dudas sobre imágenes reales. Puede poner en peligro las medidas de salud pública, utilizarse para influir en las elecciones o incluso cargar al sistema judicial con posible evidencia falsa.
Los generadores de vídeo también pueden permitir amenazas directas a individuos específicos, a través de deepfakes, particularmente los pornograficos. Estos pueden tener terribles repercusiones en las vidas de las personas afectadas y sus familias.
Más allá de estas preocupaciones, también existen cuestiones de derechos de autor y propiedad intelectual. Las herramientas de IA generativa requieren grandes cantidades de datos para el entrenamiento, y OpenAI no ha revelado de dónde provienen los datos de entrenamiento de Sora.
Por este motivo también se han criticado los grandes modelos de lenguajes y los generadores de imágenes. En los Estados Unidos, un Un grupo de autores famosos ha demandado a OpenAI. por un posible mal uso de sus materiales. El caso sostiene que los grandes modelos lingüísticos y las empresas que los utilizan están robando el trabajo de los autores para crear contenido nuevo.
No es la primera vez en la historia reciente que la tecnología se adelanta a la ley. Por ejemplo, la cuestión de las obligaciones de las plataformas de redes sociales a la hora de moderar el contenido ha generado un acalorado debate en los últimos años, gran parte del cual gira en torno a Sección 230 del Código de EE. UU..
Si bien estas preocupaciones son reales, según la experiencia pasada no esperaríamos que detuvieran el desarrollo de la tecnología de generación de videos. AbiertoAI dice está «tomando varias medidas de seguridad importantes» antes de poner a Sora a disposición del público, incluido trabajar con expertos en «información errónea, contenido de odio y prejuicios» y «crear herramientas para ayudar a detectar contenido engañoso».
Vahid Pooryousefcandidato a doctorado en Interacción Humano-Computadora, Universidad Monash y Lonni BesançonProfesor Asistente en Visualización de Datos, Universidad de Linköping
Este artículo se republica desde La conversación bajo una licencia Creative Commons. Leer el artículo original.

