OpenAI recibió un impulso poco común del Departamento de Justicia de los EE. UU. cuando la agencia presentó un escrito de amicus curiae de 20 páginas respaldando la defensa de uso legítimo (fair use) de la empresa en la demanda por derechos de autor del New York Times. La presentación, radicada en el Distrito Sur de Nueva York, señala que el gobierno federal ve las prácticas de entrenamiento de IA como un asunto de interés nacional, no solo como una disputa legal privada.

Por qué se está involucrando el gobierno

El escrito enmarca el caso en términos geopolíticos. Argumenta que Estados Unidos tiene un "fuerte interés" en mantener competitiva su industria de IA, vinculando el liderazgo en IA tanto a la prosperidad económica como a la seguridad nacional. Al apoyar a OpenAI, la administración sugiere que una interpretación restrictiva de la ley de derechos de autor podría ralentizar el ciclo de investigación y desarrollo que mantiene a las empresas estadounidenses por delante de sus rivales en el extranjero. La posición se hace eco de órdenes ejecutivas anteriores que exigen un enfoque de "primero EE. UU." para los estándares y la gobernanza de la IA.

Lo que está en juego es si alimentar un modelo de lenguaje extenso (LLM) con corpus masivos protegidos por derechos de autor cuenta como "uso legítimo" (fair use). El uso legítimo protege los usos que son "transformativos"; es decir, usos que añaden algo nuevo, con un propósito diferente, en lugar de simplemente reproducir la obra original. La defensa de OpenAI, respaldada por el escrito del gobierno, sostiene que los LLM aprenden patrones y generan texto novedoso, un proceso más parecido a un lector humano absorbiendo información que a una operación de copiar y pegar.

El escrito advierte que "restringir el desarrollo de los LLM bajo un malentendido de la doctrina del uso legítimo" dañaría la movilidad económica estadounidense. Ese lenguaje refleja un comentario de un caso separado en el que un juez comparó el entrenamiento de los LLM con un lector que aprende de los libros para crear nuevas ideas, en lugar de una herramienta diseñada para reemplazar al creador original.

Cómo los casos anteriores moldean el debate

El escrito no tiene la fuerza de un fallo judicial, pero señala litigios recientes que ayudan a definir la línea entre el entrenamiento permisible y la adquisición ilegal de datos. En un caso que involucra a Anthropic, la empresa se enfrentó a un acuerdo de 1.500 millones de dólares, no porque su modelo aprendiera de obras protegidas por derechos de autor, sino porque obtuvo ese material de "bibliotecas en la sombra ilegales", esencialmente bases de datos pirateadas. El acuerdo subraya que el método de obtención de datos puede desencadenar una responsabilidad masiva, incluso si el proceso de entrenamiento en sí mismo podría considerarse transformativo.

Las observaciones anteriores del juez William Alsup proporcionan un contexto adicional. Él enfatizó que entrenar un LLM es más parecido a un proceso de aprendizaje humano que a una copia directa, lo que sugiere que los tribunales podrían estar abiertos a una interpretación más amplia del uso legítimo. Sin embargo, el resultado de Anthropic muestra que los tribunales trazan una línea dura en la obtención ilegal, independientemente del uso posterior.

Quién gana y quién corre riesgos

Los desarrolladores de IA se beneficiarían de un entorno legal que trate la ingesta de datos a gran escala como uso legítimo. Un fallo favorable podría reducir el costo de construir modelos de próxima generación como Claude, Gemini o un futuro GPT-5, porque las empresas ya no necesitarían negociar licencias por cada fragmento de texto que ingieran. Eso podría acelerar la innovación y mantener a las empresas estadounidenses a la vanguardia de la carrera mundial de la IA.

Los creadores de contenido y los editores siguen siendo los opositores más vocales. Argumentan que el raspado (scraping) sin restricciones erosiona el valor de su trabajo y los priva de ingresos. La demanda del New York Times refleja esa preocupación: el periódico afirma que el uso que hace OpenAI de sus artículos sin permiso viola sus derechos de autor. Si los tribunales se ponen del lado del periódico, los laboratorios de IA podrían enfrentarse a mandatos judiciales, indemnizaciones por daños y perjuicios o la necesidad de licenciar retroactivamente miles de millones de palabras, una carga financiera y logística que podría asfixiar a los actores más pequeños.

El gobierno tiene un interés en equilibrar estas fuerzas. Si bien el escrito defiende el crecimiento de la IA, también reconoce implícitamente la necesidad de un marco legal claro. Los fallos excesivamente permisivos podrían provocar una reacción negativa del sector creativo, lo que potencialmente daría lugar a una nueva legislación que podría ser más restrictiva que la disputa actual.

El contraargumento: proteger los derechos creativos

Los críticos de la postura del gobierno señalan que la doctrina del uso legítimo nunca tuvo la intención de amparar las prácticas de datos de toda una industria. Advierten que tratar toda la ingesta de texto a gran escala como transformativa podría sentar un precedente que socave la estructura de incentivos del sistema de derechos de autor. Además, el acuerdo con Anthropic demuestra que, incluso si el proceso de entrenamiento es permisible, los medios para adquirir los datos pueden seguir siendo ilegales. Esta dualidad significa que los desarrolladores de IA no pueden simplemente confiar en una defensa de uso legítimo; también deben asegurarse de que sus canales de datos sean limpios.

Qué observar a continuación

  • Fallos judiciales: El Distrito Sur de Nueva York emitirá eventualmente una decisión sobre la demanda del New York Times. Es probable que ese fallo se convierta en un punto de referencia para futuros casos de derechos de autor relacionados con la IA.
  • Movimientos legislativos: Los legisladores podrían responder a la dirección de los tribunales redactando leyes que aclaren las prácticas permitidas de uso de datos para la IA, lo que podría restringir o flexibilizar la actual zona gris.
  • Respuesta de la industria: Las empresas de IA podrían ajustar sus estrategias de recopilación de datos, ya sea buscando acuerdos de licencia más amplios o construyendo conjuntos de datos internos que eviten por completo el material protegido por derechos de autor.

En resumen

El escrito de amicus curiae del Departamento de Justicia convierte la lucha por los derechos de autor de OpenAI en una batalla indirecta por el futuro de la IA en Estados Unidos. Al enmarcar el entrenamiento de LLM como una actividad de uso legítimo esencial para la competitividad nacional, el gobierno señala que las interpretaciones restrictivas de los derechos de autor podrían ser una desventaja estratégica. Sin embargo, la tensión constante entre los derechos de los creadores y las necesidades de los desarrolladores significa que los tribunales, y posiblemente el Congreso, tendrán que trazar una línea que equilibre la innovación con la protección del trabajo creativo.