Blog

Entrenar IA con obra protegida es uso justo, dice EE. UU.

El DOJ apoyó a OpenAI el 1 de septiembre. Pero el escrito no es vinculante y cubre solo el entrenamiento, no cómo se obtuvieron los datos ni las salidas.

03 de septiembre de 2026 · Agência Primeira Página

Entrenar IA con obra protegida es uso justo, dice EE. UU.

El 1 de septiembre de 2026, el Departamento de Justicia de Estados Unidos presentó un escrito sosteniendo que entrenar modelos de lenguaje con obras protegidas por derechos de autor es, en general, uso justo. Fue en el tribunal federal de Manhattan, en el litigio multidistrital contra OpenAI — el caso que reúne la demanda del New York Times y las de autores y editoriales. Según Reuters, es la primera vez que el gobierno estadounidense se posiciona en esta ola de demandas.

El titular que circuló fue “el gobierno de EE. UU. dijo que se puede entrenar IA con contenido protegido”. Es cierto, y es insuficiente — porque el propio documento traza tres límites que cambian bastante lo que una empresa debería concluir.

Los tres límites que el titular no cuenta

1. No es una decisión, es una opinión. Un escrito de interés no es vinculante: el gobierno no es parte en el proceso y el juez no está obligado a seguirlo. Es el instrumento con el que un organismo federal deja constancia de su posición en un caso ajeno. El litigio sigue donde estaba.

2. Cubre solo el entrenamiento. Este es el punto que casi todos los resúmenes perdieron. El documento trata del uso de las obras durante el entrenamiento y deja expresamente abiertas otras dos preguntas: cómo se obtuvieron y almacenaron los datos y las salidas que reproducen fragmentos protegidos. La segunda es buena parte de lo que alega el New York Times. Es decir: aunque prospere la tesis del entrenamiento, el caso no termina.

3. No rige fuera de Estados Unidos. La mayoría de los países hispanohablantes no tiene una cláusula general de uso justo: sus leyes de derecho de autor funcionan con una lista cerrada de excepciones. Lo que se decida en Manhattan no se traslada sin más.

El argumento es económico, no moral

Vale la pena leer el razonamiento, porque es honesto sobre lo que defiende. El gobierno sostiene que exigir licencias para entrenar crearía una barrera de entrada que solo las mayores tecnológicas podrían pagar, concentrando el mercado de modelos de lenguaje. Y que esas tarifas beneficiarían de forma desproporcionada a los medios tradicionales, precisamente por el tamaño de los archivos que acumularon. El escrito se apoya en una orden ejecutiva de enero de 2025 sobre eliminar barreras al liderazgo estadounidense en IA, y añade un argumento de competitividad y seguridad nacional.

Del otro lado, el New York Times respondió que el gobierno se puso “del lado de un puñado de empresas de IA billonarias, a costa de los incontables creadores estadounidenses cuyo trabajo les robaron”.

La semana en que los dos mayores mercados fueron en direcciones opuestas

Aquí está el dato que nos parece más útil, y solo aparece juntando dos noticias de días seguidos.

El 31 de agosto, la Comisión Europea clasificó a ChatGPT como motor de búsqueda bajo el DSA — lo que significa más obligaciones: evaluación de riesgos, auditoría externa, acceso a datos, multas de hasta el 6% de la facturación global. Lo contamos en ChatGPT ya es buscador oficialmente.

El 1 de septiembre, el gobierno estadounidense se manifestó en la dirección contraria: menos fricción, en nombre de la competitividad.

No es contradicción, son proyectos distintos. Europa está regulando la IA como infraestructura de información; Estados Unidos la trata como carrera industrial. Para quien publica contenido y vende servicios en ambos mercados, eso significa que la misma empresa va a operar bajo dos lógicas a la vez, y que una decisión de contenido tomada mirando solo un lado va a fallar en el otro.

Qué cambia para quien publica contenido

No va a haber cheque. Es la conclusión práctica más dura y la más probable. Si la tesis del uso justo prevalece en Estados Unidos, tu texto seguirá siendo material de entrenamiento y no te pagarán por ello. Planificar contenido esperando ingresos por licencias es planificar sobre algo que hoy no existe.

Entonces el retorno tiene que venir de donde siempre vino. Ser encontrado, ser citado y convertir. Es exactamente el trabajo de AEO: preparar el material para ser la respuesta que la IA recomienda, con tu nombre al lado. La diferencia es que ahora se puede decir sin ilusión: el contenido no vale por lo que la IA paga, vale por el cliente que llega después.

Bloquear es posible, y tiene precio. Se pueden frenar los rastreadores de IA en el robots.txt y señalizar con llms.txt. Pero el mismo bloqueo que impide el entrenamiento tiende a sacarte de la respuesta — y para la mayoría de los negocios pequeños, desaparecer de la respuesta cuesta más caro que servir de entrenamiento. Quien tiene un archivo grande y negocia licencias hace otra cuenta.

Lo que la IA no tiene es lo específico. Se entrenó con lo genérico de tu sector. No se entrenó con tu caso, tu número medido, tu cliente con nombre. Por eso el contenido con dato propio sigue rindiendo mientras el texto genérico desaparece: ese ya fue absorbido.

Lo que todavía no está decidido

Tres cosas, para no salir de aquí con falsa certeza. El escrito no es una sentencia y el juez puede discrepar. Las dos preguntas abiertas — cómo se obtuvieron los datos y qué devuelven los modelos — pueden decidirse en contra de las empresas de IA aunque el entrenamiento se considere uso justo. Y la discusión en otros países es distinta, con otras leyes y sin cláusula general de uso justo.

Lo que ya se puede hacer no depende de nada de eso: saber si la IA cita a tu empresa hoy y arreglar lo que lo impide. Es lo que hacemos en nuestra agencia de SEO: dejar la web en condiciones de ser citada, medir si lo está siendo, y tratar el contenido como activo comercial, no como materia prima donada.

Preguntas frecuentes

¿El gobierno de EE. UU. decidió que entrenar IA con contenido protegido es legal?

No decidió: opinó. El 1 de septiembre de 2026 el Departamento de Justicia presentó un escrito de interés ante el tribunal federal de Manhattan sosteniendo que entrenar modelos de lenguaje con obras protegidas es, en general, uso justo. Un escrito de interés no es vinculante: el gobierno no es parte en el proceso y el juez no está obligado a seguirlo. Decide el tribunal, y el caso sigue abierto.

¿Significa que la IA puede usar cualquier contenido de mi web?

No es lo que dice el documento. Trata únicamente del uso de las obras durante el entrenamiento y deja expresamente abiertas dos cuestiones distintas: cómo se obtuvieron y almacenaron los datos, y las salidas que reproducen fragmentos protegidos. Son justamente esos dos puntos los que sostienen buena parte de la demanda del New York Times.

¿Esta posición vale fuera de Estados Unidos?

No. El uso justo es una figura del derecho estadounidense. La mayoría de las legislaciones hispanohablantes funciona con una lista cerrada de limitaciones y excepciones, sin cláusula general equivalente. Un escrito del Departamento de Justicia de Estados Unidos no produce efecto fuera de allí.

¿Voy a cobrar algo si la IA entrena con mi contenido?

Según la tesis que defendió el gobierno estadounidense, no. El argumento explícito es que exigir licencias crearía una barrera que solo pagarían las mayores empresas, concentrando el mercado. Planificar contenido esperando ingresos por licencias es apostar por algo que hoy no existe para quien no tiene un archivo del tamaño de un gran periódico.

¿Debo bloquear los rastreadores de IA en mi sitio?

Depende de qué hace tu contenido por ti. Se puede bloquear en robots.txt y señalizar con llms.txt, pero el mismo bloqueo que impide el entrenamiento tiende a sacar a la empresa de las respuestas de la IA. Para la mayoría de los negocios pequeños, desaparecer de la respuesta cuesta más que servir de entrenamiento.

Si la IA ya lo sabe todo, ¿vale la pena publicar contenido?

Vale, cambiando el tipo de contenido. Lo que la IA absorbió fue lo genérico de tu sector, y es justo ese texto el que dejó de rendir. Lo que no tiene es lo específico: tu caso, tu número medido, el resultado de tu cliente. El contenido con dato propio sigue trayendo gente porque no existe en ningún otro sitio.