Revelaciones impactantes en la demanda contra OpenAI y Microsoft

Un conjunto de documentos sin censura, recientemente desvelados en la causa que The New York Times presentó contra OpenAI y Microsoft, muestra que los ejecutivos de ambas compañías describieron su proceso de entrenamiento de inteligencia artificial como un "robo" a gran escala. La filtración indica que la práctica de extraer masivamente textos protegidos por derechos de autor, incluso detrás de muros de pago, constituye lo que un alto directivo de Microsoft calificó como "el mayor hurto de trabajo en la historia humana".

Cómo se llevó a cabo el scraping masivo

Según los archivos, los equipos de IA de Microsoft y OpenAI construyeron sus bases de datos mediante la captura automática de millones de artículos, eliminando deliberadamente los avisos de copyright y sorteando los sistemas de suscripción. Este método permitió alimentar modelos como ChatGPT y Copilot con información que, de otro modo, habría requerido licencias explícitas.

Contradicciones con la defensa de "uso justo"

Los tribunales estadounidenses han tendido a favorecer la argumentación de que el entrenamiento de modelos constituye un "uso justo", siempre que no compita directamente con el mercado original. Sin embargo, los testimonios internos revelados contradicen esa postura: Brent Hecht, director de Applied Science de Microsoft, describió una "espiral de perdición" en la que el motor de respuestas de Copilot redujo la tasa de clics en el sitio del Times hasta en un 93 % frente a la búsqueda tradicional de Bing.

Además, el propio Satya Nadella, CEO de Microsoft, declaró bajo juramento que cualquier contenido detrás de un muro de pago debería ser licenciado antes de ser utilizado para entrenar o fundamentar modelos de IA. Nadella admitió que, de haber sabido que OpenAI había extraído datos sin permiso, habría exigido una re‑entrenamiento de los sistemas.

El temor de los editores y periodistas

Internamente, Nick Turley, responsable de ChatGPT, describió a los medios como una "amenaza existencial", señalando que los chatbots se vuelven cada vez más sustitutos de la información original. Greg Brockman, presidente de OpenAI, llegó a calificar a sus modelos como "excelentes para noticias", mientras que Nadella coincidió al afirmar que la conversación con un chatbot puede reemplazar la visita al sitio web del medio.

Estas declaraciones ponen de relieve una tensión creciente: los algoritmos no solo consumen contenido, sino que también compiten directamente con los canales tradicionales, erosionando los ingresos publicitarios y la relevancia de los sitios de noticias.

Implicaciones legales y futuras batallas

El caso sigue abierto y los documentos sellados continúan bajo custodia judicial. Mientras tanto, la administración de Trump presentó un informe en defensa de OpenAI, argumentando que el uso de datos sin licencia es legal bajo la doctrina de "uso justo". No obstante, la evidencia interna sugiere que la práctica de scraping masivo podría violar los derechos de los creadores y socavar la sostenibilidad del periodismo.

El debate sobre la regulación de la IA, la protección de la propiedad intelectual y la responsabilidad de las grandes tecnológicas está lejos de resolverse. Lo que está claro es que la forma en que los modelos de lenguaje se alimentan de información está redefiniendo la relación entre la tecnología y la producción de contenido.

Source: https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/

Related Articles