La guerra legal entre Reddit y Anthropic: cuando la IA se lleva tus datos sin permiso
Reddit ha decidido llevar a Anthropic a los tribunales, acusando a la empresa de inteligencia artificial de algo que podría parecer técnico pero que tiene implicaciones enormes para todos: entrenar sus modelos de IA con datos personales de usuarios de Reddit, incluyendo publicaciones que estos habían borrado expresamente.
El centro de la controversia: tus datos borrados nunca se fueron
La situación es bastante clara. Mientras que empresas como OpenAI y Google han llegado a acuerdos con Reddit para licenciar datos (pagando por ello y comprometiéndose a respetar normas de privacidad), Anthropic ha optado por el camino más corto: tomar lo que quiera sin pedir permiso ni respetar las reglas básicas.
Lo más grave no es solo el acceso no autorizado a contenidos públicos, sino que Anthropic aparentemente ha conservado en sus sistemas publicaciones que los usuarios habían decidido borrar. Esto rompe la premisa fundamental de confianza de cualquier plataforma social: que cuando borras algo, realmente desaparece.
¿Por qué es tan importante el derecho a borrar?
Imagina que escribes algo en Reddit en un momento de vulnerabilidad, compartes una foto que luego te arrepientes, o simplemente cambias de opinión sobre un tema. Debería ser tu derecho eliminar ese contenido, ¿no? Pues según la demanda, Anthropic no respeta ese derecho básico.
La API de Cumplimiento de Reddit está diseñada precisamente para esto: cuando un usuario borra algo, la plataforma notifica automáticamente a las empresas licenciatarias para que también eliminen ese contenido de sus sistemas. Una función que Anthropic, al no tener acuerdo, simplemente ignora.
Anthropic: la hipocresía del «caballero blanco»
Lo irónico es que Anthropic se ha posicionado públicamente como una empresa de IA ética, centrada en la seguridad y los valores. Reddit no ha dudado en señalar esta contradicción en su demanda, calificándola como una empresa de doble moral que se presenta como «el caballero blanco de la industria de la IA» mientras vulnera derechos básicos.
El valor económico en juego
No estamos hablando de pequeñas cantidades. Anthropic ha recibido inversiones multimillonarias (unos 8.000 millones de dólares solo de Amazon desde 2023) y está firmando acuerdos comerciales para integrar su chatbot Claude en productos como la renovada Alexa.
Todo esto mientras, según Reddit, se beneficia de modelos entrenados con contenido ajeno sin compensar a quienes lo crearon ni respetar sus derechos. Como señala la demanda: «Anthropic obtiene ganancias significativas de una tecnología nacida del contenido de Reddit, a expensas de Reddit».
La mentira descubierta: el raspado continuo
Otro elemento demoledor de la demanda es que Anthropic aparentemente mintió sobre cuándo dejó de «raspar» (scraping) contenido de Reddit. En julio de 2024, tras las quejas del CEO de Reddit, Steve Huffman, Anthropic aseguró públicamente que «Reddit ha estado en nuestra lista de bloqueo para rastreo web desde mediados de mayo».
Sin embargo, Reddit afirma haber atrapado a Anthropic «con las manos en la masa», detectando más de cien mil intentos de acceso automatizado a su plataforma en los meses posteriores a esa declaración, continuando al menos hasta octubre de 2024 y potencialmente hasta la actualidad.
¿Qué busca Reddit con esta demanda?
Reddit no solo busca compensación económica por los daños causados, sino también una orden judicial que prohíba a Anthropic seguir extrayendo datos sin permiso. Además, solicita:
- Daños compensatorios por las pérdidas sufridas
- Daños punitivos debido a la conducta «voluntaria, maliciosa y realizada con desprecio consciente» hacia las obligaciones contractuales
- Protección para sus usuarios, quienes actualmente «no tienen forma de saber» si sus datos han sido capturados
La respuesta de Anthropic
La empresa de IA ha sido escueta en su respuesta inicial: «No estamos de acuerdo con las afirmaciones de Reddit y nos defenderemos enérgicamente». Amazon, por su parte, ha declinado hacer comentarios.
Un detector de IA para identificar contenido sintético
Este caso pone de relieve la importancia de herramientas como los detectores de IA. Mientras empresas como Anthropic crean sistemas cada vez más potentes con datos que no les pertenecen, los usuarios necesitamos formas de identificar qué contenido ha sido generado artificialmente y qué contenido es auténtico.
Los detectores de IA más avanzados pueden ayudarnos a distinguir entre texto escrito por humanos y el generado por modelos como Claude, permitiéndonos navegar con más criterio en un internet cada vez más sintético. Estas herramientas se vuelven especialmente relevantes cuando las fronteras entre lo humano y lo artificial se difuminan.
Implicaciones para el futuro de los generadores de imágenes IA
Esta batalla legal también tiene implicaciones importantes para los generadores de imágenes de IA. Si bien el caso de Reddit se centra en texto, el precedente que establezca podría afectar a cómo se regulará el uso de imágenes para entrenar modelos de IA en el futuro.
Los generadores de imágenes IA como DALL-E, Midjourney o Stable Diffusion también se entrenan con millones de imágenes procedentes de internet, muchas veces sin el consentimiento explícito de sus creadores. ¿Veremos demandas similares en el ámbito visual? Es probable que este caso abra la puerta a un escrutinio más riguroso sobre cómo se adquieren los datos de entrenamiento.
¿Quién gana cuando la IA aprende de nosotros?
La pregunta que subyace en todo esto es quién debe beneficiarse cuando nuestros datos, nuestras palabras y nuestras creaciones son utilizadas para entrenar sistemas de IA que luego generan miles de millones en ingresos.
Si algo queda claro con este caso es que la era del «tomar primero, pedir permiso después» en la industria de la IA podría estar llegando a su fin. Y sinceramente, ya iba siendo hora.


