Don McClean siempre ha tenido que compartir «American Pie». Desde su lanzamiento en 1971, la exitosa canción ha resurgido en versiones de Madonna, parodias de Weird Al Yankovic, serenatas de presidentes de corea del sursubtramas en películas de maravillae incluso la CIA técnicas de tortura. Pero hoy en día, los principales imitadores de McClean ni siquiera son humanos.
Puedes interrogar a los culpables por ti mismo. Simplemente cargue ChatGPT de OpenAI y solicite al generador de texto que «escriba la letra de una canción sobre el día en que murió la música». Invariablemente, la salida de la herramienta escupirá letras o temas de «American Pie». – y a veces el mismo coro.
Esta regurgitación surge a pesar de que el aviso no hace ningún pedido para “American Pie” o la historia que lo inspiró: el accidente aéreo de 1959 que mató a los pioneros del rock and roll Buddy Holly, Ritchie Valens y The Big Bopper.
Es una prueba más de que ChatGPT no puede crear cualquier cosa verdaderamente original. En cambio, el sistema está más cerca de un algoritmo de remezcla. La verdadera creatividad está en sus datos de entrenamiento, que se extraen de la web sin consentimiento.
Dr. Max Little, un AI Un experto de la Universidad de Birmingham describe la herramienta como una «máquina de infracción». Se burla de cualquier sugerencia de que los modelos de lenguaje grandes (LLM) sean creativos de forma independiente.
«Este no es el caso porque no pueden producir nada en absoluto sin estar entrenados en cantidades astronómicas de texto», dice Little a TNW.
Es un enfoque omnipresente en la IA generativa. Riguroso tenerA mostrado que los LLM pueden regurgitar grandes fragmentos de su texto de formación original, incluidos párrafos textuales de libros y poemas. Precisamente la semana pasada, un informe encontradoque el 60% de los resultados GPT-3.5 de OpenAI contenían plagio.
El problema tampoco se aplica únicamente a los generadores de texto. Desde las imágenes de Stable Diffusion hasta la música de Google Lyria y el código de GitHub Copilot, las herramientas GenAI en todas las modalidades pueden producir resultados de una calidad asombrosa y una familiaridad inquietante.
Su mimetismo plantea una amenaza existencial para las industrias creativas. También representa una amenaza para la industria GenAI.


Los artistas dicen que la implacable marcha de GenAI está pisoteando sus convenciones de derechos de autor. Como era de esperar, las empresas de tecnología no están de acuerdo. Sus defensas suelen invocar la doctrina del «uso legítimo».
Los detalles varían según la jurisdicción, pero un principio central del “uso justo” es que los productos tienen un propósito y carácter “transformador”. En lugar de limitarse a copiar o reproducir sus datos de entrenamiento, añaden algo nuevo y significativo. Al menos, eso es lo que los líderes de GenAI sostienen en los tribunales.
Stability AI, la startup con sede en el Reino Unido detrás del generador de imágenes Stable Diffusion, hizo ese argumento el año pasado a la Oficina de Derechos de Autor de EE. UU. Abierto AI También citó la doctrina en una moción reciente para desestimar dos demandas colectivas.
Varios autores, incluida la comediante Sarah Silverman y la novelista canadiense Mona Awad, habían demandado a la empresa por supuestamente capacitar a LLM en conjuntos de datos adquiridos ilegalmente.
Debido a que su trabajo fue integrado en ChatGPT, dijeron que la herramienta en sí era un «trabajo derivado» cubierto por derechos de autor.
OpenAI rechazó el reclamo. Según el equipo legal de la startup, «el uso de materiales protegidos por derechos de autor por parte de innovadores de manera transformadora no viola los derechos de autor». Un juez también desestimó la acusación de que cada salida de ChatGPT es derivada.
Pero cuando los resultados son idénticos a los datos de entrenamiento, las aguas legales comienzan a enturbiarse. La reproducción es una base dudosa para la transformación. También es un fenómeno común.
Además de American Pies, las herramientas GenAI han regurgitadoA escenas de cine, Personajes de caricatura, Juegos de vídeo, diseños de productosy código.
También han copiado periódicos, lo que puede conducir a un punto de inflexión.
“Naturaleza transformadora†, mi ojo, @OpenAI.@Disney No lo voy a ver de esa manera. https://t.co/t0A0lfM6f9 pic.twitter.com/0XX51yQjN2
– Gary Marcus @ AAAI 2024 (@GaryMarcus) 29 de diciembre de 2023
En diciembre, el New York Times demandó a OpenAI y a su socio comercial Microsoft. El medio de noticias alega que el uso no autorizado de sus artículos en datos de capacitación viola los derechos de propiedad intelectual (PI). Expertos Legales describir la demanda como «el mejor caso hasta ahora que alega que la IA generativa es una infracción de derechos de autor».
Los abogados del NYT destacaron la «similitud sustancial» entre el contenido del medio y los resultados de ChatGPT. Para fundamentar el reclamo, proporcionaron 100 ejemplos del robot que reproduce los informes del periódico.
«En cada caso, observamos que la salida de GPT-4 contiene grandes extensiones que son idénticas al texto real del artículo de The New York Times», dijeron en su denuncia.
Su demanda también cuestiona otro aspecto clave del “uso justo”: el impacto en el mercado de la obra original.


Según los demandantes, OpenAI no sólo replica el contenido del NYT, sino que también lo explota para competir en los mismos mercados. Al mismo tiempo, la empresa desvía el tráfico del sitio web del periódico.
Como prueba, señalan Navegar con Bing, una función premium impulsada por la misma tecnología detrás de ChatGPT. La herramienta puede resumir las recomendaciones de productos hechas por los revisores del NYT. Al ofrecer a los usuarios esta información, dijeron los abogados, OpenAI elimina su incentivo para visitar el artículo original. Esto también significa que no hacen clic en los enlaces de productos que generan ingresos para el editor.
«No hay nada 'transformador' en utilizar el contenido del Times sin pago para crear productos que sustituyan al Times y le roben audiencia», declara la denuncia.
Naturalmente, los gigantes de GenAI no están de acuerdo.
OpenAI respondió a la demanda con reproche entrada en el blog. La empresa sospecha que el El NYT «instruyó al modelo para que regurgitara» o «seleccionó sus ejemplos de muchos intentos».A
Industria Los conocedores han coincidido. Daniel Jeffries, director de inteligencia de Stability AI, describió las indicaciones de la demanda como «obviamente manipulado.» Él dicho las copias se produjeron «casi con certeza» mediante una técnica llamada recuperación de generación aumentada (RAG), que optimiza los resultados de LLM accediendo a fuentes externas de información.
“Corren el riesgo de destruir industrias creativas que dependen de los derechos de autor.
Cualquiera sea el método, OpenAI dijo rLa erurgitación es un «bicho raro» eso la empresa estaba «trabajando para llegar a cero». Pero los críticos cuestionan las competencias de los mecanismos preventivos.
Pequeños puntos a favor de la reproducción de ChatGPT de “American Pie”.
“A veces, la infracción directa y literal de los derechos de autor… es detectada por el algoritmoY se presenta una advertencia”, dice.
«Sin embargo, todavía se puede hacer que el algoritmo produzca resultados que estén claramente plagiados de los datos de entrenamiento, ya que en este caso, el tema de la letra es siempre el accidente de Holly/Valens/Bopper en 1959».
Por raro que sea en ChatGPT, la regurgitación está muy extendida en las herramientas GenAI. Cuando se demuestra que duplican sus datos de capacitación y luego compiten en el mismo mercado, los cimientos del uso legítimo parecen inestables.
Ben Maling, director asociado del bufete de abogados de propiedad intelectual EIP, sigue de cerca la inestabilidad. Salidas que son Las copias textuales o derivados de sus datos de entrenamiento amenazan con «otra posible infracción de derechos de autor», advierte. Tanto el sistema como el usuario final podrían ser responsables de los daños.
«Muchos de los grandes proveedores de IA están tan preocupados por el potencial de esto para ahuyentar a los clientes que están ofreciendo [assurances] prometiendo defenderlos contra acciones de infracción”, dijo Maling a TNW por correo electrónico.
Esa no es la única evidencia de preocupación en OpenAI. El mes pasado, el abanderado de GenAI le dijo al Parlamento británicoesoA es «imposible» crear AI herramientas como ChatGPT sin material protegido por derechos de autor. Buscando protección legal, la empresa solicitó una exención especial para la práctica.
La solicitud aumentó los temores sobre la regurgitación de datos de entrenamiento.
Si los políticos eximieran a OpenAI, la startup «sería libre de copiar y remezclar cualquier texto original desde cualquier lugar y en cualquier momento», dice Little. Como resultado, corren el riesgo de «destruir las industrias creativas que dependen de los derechos de autor para siquiera existir».
La regurgitación de GenAI no es necesariamente terminal. Los analistas han prescrito numerosos tratamientos para esta incómoda aflicción.
Uno fue creado por Ed Newton-Rex, ex vicepresidente de audio de Stability AI. Durante su paso por la startup, Newton-Rex desarrolló Stable Audio, un generador de música basado en contenido con licencia. El hombre de 36 años quiere que otras empresas sigan su ejemplo.
«Es posible que se ralentice un poco la industria de la IA, porque tendrían que dedicar más tiempo, más dinero y más esfuerzo a la concesión de licencias», dice Newton-Rex a TNW. “Pero, francamente, en el proceso se salvarían las industrias creativas. Creo que hay una amenaza existencial aquí”.
Los artistas que enfrentan esta amenaza han aplicado un antídoto más extremo: el veneno.
El método de entrega más popular es una herramienta llamada Hierba mora. Este software “envenena” los datos de entrenamiento aplicando cambios invisibles a las imágenes. Cuando las empresas descartan las creaciones sin consentimiento, pueden alterar los resultados del modelo de IA.
El método ha demostrado ser popular. W.A los cinco días de estar disponible, Nightshade superó las 250.000 descargas.
No obstante, Little espera que la IA siga regurgitando American Pies. Duda que las herramientas entrenadas con contenido creativo extraído puedan alguna vez escapar del problema del plagio. «Porque, por diseño», dice, «son sólo algoritmos que mezclan sus datos de entrenamiento».
Uno de los temas de la Conferencia TNW de este año es Ren-AI-ssance: The AI-Powered Rebirth. Si desea profundizar en todo lo relacionado con la inteligencia artificial o simplemente experimentar el evento (y saludar a nuestro equipo editorial), tenemos algo especial para nuestros leales lectores. Utilice el código TNWXMEDIA al finalizar la compra para obtener un 30% de descuento en su pase de negocios, pase de inversionista o paquetes de inicio (Oreja & Aumentar proporcionalmente).

