contenido youtube ia dilemas y derechos creadores

El oscuro secreto detrás del entrenamiento de modelos IA: YouTube no lo aprobaría

El uso de contenido de YouTube para entrenar modelos de inteligencia artificial (IA) se ha convertido en un tema candente, y no precisamente por razones positivas. Grandes nombres de la tecnología, como Apple, Salesforce y Anthropic, están en el ojo del huracán por haberse aprovechado de una base de datos repleta de vídeos de YouTube, sin que los creadores tuvieran conocimiento o consintieran tal uso.

¿Qué es «The Pile» y por qué es problemático?

«The Pile», un gigantesco conjunto de datos creado por la organización sin ánimo de lucro EleutherAI, fue pensado originalmente para proporcionar una herramienta útil a quienes no cuentan con recursos para rivalizar con los gigantes tecnológicos. Sin embargo, ha terminado siendo la fuente secreta de muchas grandes compañías.

El dilema aquí es que, a medida que el contenido generado por IA se multiplica exponencialmente, resulta cada vez más complicado compilar datasets que no incluyan material ya generado por estas inteligencias. Además, esta práctica plantea serias preguntas sobre el uso justo y los derechos de propiedad intelectual, agravada por los múltiples litigios en curso que alegan que tal scraping podría considerarse uso justo, lo cual aún no ha sido dilucidado en tribunales.

Las voces detrás de los vídeos

Los creadores de contenido de YouTube, quienes dedican tiempo y recursos a producir su material, se sienten traicionados por el uso no autorizado de su trabajo. David Pakman, creador de «The David Pakman Show», manifestó su frustración afirmando: «Este es mi medio de vida, y he dedicado tiempo, recursos, dinero y esfuerzo de mi equipo en crear este contenido.»

Julia Walsh, CEO de la productora Complexly, conocida por proyectos como SciShow, también expresó su insatisfacción: «Nos molesta saber que nuestro contenido educativo, cuidadosamente producido, ha sido usado de esta forma sin nuestro permiso.»

Para muchos creadores, la idea de que sus vídeos sean utilizados para entrenar modelos de IA sin su consentimiento parece ser un claro abuso de confianza.

¿Es legal el scraping de contenidos en YouTube?

Otra cuestión preocupante es si esta práctica violenta los términos de YouTube, que prohíben expresamente el acceso a vídeos por «medios automatizados». Sid Black, fundador de EleutherAI, reveló que había utilizado un script para descargar subtítulos a través de la API de YouTube, algo que, según él, funciona de manera similar a cómo lo haría un navegador web.

Empresas como Anthropic, que ha entrenado modelos con este dataset, defienden que no hay violación alguna. Jennifer Martinez, portavoz de la empresa, aclaró: «The Pile incluye un subset muy pequeño de subtítulos de YouTube… Los términos de YouTube cubren el uso directo de su plataforma, lo cual es distinto del uso del dataset The Pile.»

Google y la cronología de las acciones

En respuesta a estas prácticas, Google ha declarado haber tomado medidas a lo largo de los años para prevenir el scraping abusivo y no autorizado, aunque no ofreció detalles específicos. La situación recuerda otros incidentes en los que empresas de IA han sido criticadas por entrenar modelos con datos de YouTube, siendo OpenAI un caso notable, al parecer habiendo utilizado datos de YouTube para entrenar herramientas como ChatGPT. Sundar Pichai, CEO de Google, incluso señaló en una entrevista que el uso de vídeos de YouTube para entrenar modelos como el video-generador Sora podría haber violado los términos de YouTube.

Un reciente comunicado de Apple aclaró que su modelo OpenELM, entrenado con datos de The Pile, no se utiliza en Apple Intelligence ni en otras características dirigidas a los consumidores.

En definitiva, mientras que la revolución de la IA continúa, estas prácticas generan un considerable debate sobre los derechos de los creadores de contenido. Las compañías tecnológicas podrían tener que replantearse sus estrategias y buscar nuevos enfoques que respeten los derechos de autor, garantizando así un uso ético y justo de los datos.

Noticias similares

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *