Por qué el caso llegó a los tribunales
ANI presentó una demanda tras notar que las respuestas de ChatGPT a consultas sobre noticias recientes de la India se asemejaban a sus propios artículos publicados en agosto y septiembre de 2024. La agencia argumentó que el modelo de lenguaje de gran tamaño estaba reproduciendo su texto protegido por derechos de autor, una afirmación que, de sostenerse, obligaría a OpenAI a detener o restringir severamente sus modelos en la India.
OpenAI respondió que los dos modelos citados —GPT-4 y el más reciente GPT-4o— fueron entrenados con datos con fechas de corte de abril de 2022 y abril de 2024. Los artículos de ANI aparecieron después de esas fechas, por lo que no podrían haber estado en el conjunto de entrenamiento original. El juez Amit Bansal señaló que el solapamiento probablemente se debió a la Generación Aumentada por Recuperación (RAG), que extrae contenido web actual en la respuesta en tiempo real, y no a que el modelo estuviera "recordando" los artículos.
El giro legal: el entrenamiento como "investigación"
El caso es relevante porque el tribunal interpretó de manera amplia la excepción de derechos de autor de la India para el "uso privado o personal, incluida la investigación". Ambas partes coincidieron en que OpenAI utilizó material de ANI durante la fase inicial de entrenamiento, pero el juez trató ese uso como "transformativo". En otras palabras, el modelo solo extrajo gramática, sintaxis y patrones estadísticos, dejando intacto el contenido expresivo.
El tribunal estableció dos condiciones estrictas:
- Las copias utilizadas para el entrenamiento deben provenir de fuentes legales, no de archivos pirateados o muros de pago a los que el usuario no pueda acceder.
- El material debe permanecer dentro del propio entorno del desarrollador; no puede ser publicado ni distribuido.
Al aplicar una prueba de equidad de tres partes, el juez determinó que el uso de OpenAI se limitó al entrenamiento, no encontró evidencia de que el modelo memorizara pasajes textuales y señaló que ANI no sufrió ninguna pérdida económica directa, ya que ambas empresas operan en segmentos de mercado diferentes.
Cómo encaja esto en un mosaico de fallos globales
La postura de la India ahora refleja varios casos en EE. UU. que favorecen una visión transformativa de los resultados de la IA. En Kadrey v. Meta, un tribunal dictaminó que el texto generado que no copia la redacción exacta no constituye una infracción, mientras que la histórica decisión de Google Books reconoció una excepción limitada de "búsqueda y visualización" para proyectos de digitalización. Otras demandas en EE. UU., como el caso de Raw Story, fueron desestimadas por falta de un daño demostrable, pero la controversia de Anthropic recordó a los jueces que el uso de datos pirateados aún puede generar responsabilidad legal.
En Europa, las opiniones divergen drásticamente. Los tribunales de Múnich han dictaminado que reproducir letras de canciones integradas en los pesos del modelo constituye una infracción, mientras que un tribunal de Londres desestimó recientemente una demanda contra Stability AI por motivos similares. El fallo del Tribunal Superior de Delhi añade otro dato: si el entrenamiento se limita a fuentes legales y el resultado no es una copia textual, la actividad puede entrar dentro de una excepción de investigación.
Qué deben vigilar los desarrolladores
- RAG frente a entrenamiento – La distinción del tribunal entre la "memorización" (entrenamiento) y la recuperación en tiempo real (RAG) sugiere que las futuras disputas se centrarán en si una respuesta proviene de una base de conocimientos estática o se obtiene en vivo de la web. Es posible que los desarrolladores deban dejar más clara esa distinción en la documentación del producto.
- Procedencia de las fuentes – El requisito de "fuentes legales" podría empujar a las empresas a reforzar sus procesos de curación de datos, utilizando contratos o licencias que demuestren que cada fragmento de texto es legítimo.
- Uso exclusivamente interno – Las empresas que planeen comercializar los resultados de los modelos deben mantener los datos de entrenamiento estrictamente de forma interna. Compartir corpus de datos brutos con socios o con el público podría debilitar la defensa basada en la investigación.
- Prueba de daño económico – Debido a que el tribunal hizo hincapié en la ausencia de un perjuicio financiero directo, los demandantes deberán demostrar una pérdida concreta, no solo una percepción de dilución de marca.
- Respuesta legislativa – Los legisladores indios están siguiendo de cerca los debates sobre derechos de autor relacionados con la IA. Cualquier enmienda que reduzca la excepción de investigación podría afectar retroactivamente a los modelos ya desplegados, lo que provocaría una ola de auditorías de cumplimiento.
El contraargumento que aún acecha a la IA
La demanda de ANI puso de relieve una preocupación real: a medida que los LLM se vuelven más hábiles para imitar frases específicas, la línea entre el uso "transformativo" y la "copia" puede desdibujarse. Los críticos argumentan que el RAG, aunque técnicamente es una función de búsqueda, sigue mostrando contenido protegido por derechos de autor sin permiso, lo que podría violar el derecho de "comunicación al público".
Un precedente con repercusiones mundiales
Al clasificar el entrenamiento de modelos como una actividad de investigación permitida, el Tribunal Superior de Delhi señaló que la India no bloqueará automáticamente el desarrollo de modelos de lenguaje de gran tamaño por motivos de derechos de autor, siempre que los desarrolladores respeten la legalidad de las fuentes y mantengan el entrenamiento de forma interna. Esa interpretación puede incentivar a las empresas a expandir sus operaciones en la India, sabiendo que un obstáculo legal clave se ha suavizado.
Para los reguladores en otros lugares, el fallo ofrece un modelo: definir una excepción de investigación estrecha y bien documentada, imponer estándares claros de obtención de fuentes y exigir que el manejo de los datos de entrenamiento sea exclusivamente interno. Las naciones que adopten un lenguaje similar podrían brindar a sus ecosistemas nacionales de IA la certeza necesaria para atraer inversiones.
En conclusión: La decisión del Tribunal Superior de Delhi no otorga carta blanca para extraer cualquier texto para el entrenamiento de IA, pero establece que, bajo la ley india, el entrenamiento disciplinado y conforme a la ley califica como investigación. Esa interpretación podría convertirse en un punto de referencia para los tribunales de todo el mundo mientras lidian con la cuestión de si enseñar a las máquinas a comprender el lenguaje es una actividad académica protegida o una infracción inminente.
