Revelaciones impactantes en la demanda de The New York Times
Un conjunto de documentos sin censura presentados en la acción legal que The New York Times interpuso contra OpenAI y Microsoft ha sacado a la luz declaraciones internas que describen el proceso de entrenamiento de los modelos de IA como un “robo histórico”. Según los archivos, un alto ejecutivo de Microsoft calificó el scraping masivo de contenido como “el mayor hurto de trabajo en la historia humana”.
Cómo se obtuvo el material protegido
Los registros indican que ambas compañías eludieron barreras de pago, recopilaron datos a gran escala y eliminaron deliberadamente los avisos de derechos de autor antes de alimentar los algoritmos. Este método, descrito como “bypass de paywalls” y “mass scraping”, contraviene la premisa del uso justo, que exige que la utilización no sustituya ni dañe el mercado del trabajo original.
Impacto económico en los medios
Microsoft incluso documentó que su motor de respuestas, Copilot, redujo la tasa de clics hacia el sitio del Times en hasta un 93 % frente a la búsqueda tradicional de Bing. En una presentación interna, el director de Applied Science, Brent Hecht, describió este fenómeno como un “bucle de condena” que perjudica tanto a los modelos como a la web en su conjunto.
Posturas de los líderes
Satya Nadella, CEO de Microsoft, declaró bajo juramento que cualquier contenido detrás de un muro de pago debería ser licenciado para su uso en entrenamiento o “grounding”. Añadió que, de haber sabido que OpenAI había extraído información sin autorización, habría exigido la re‑entrenamiento de los modelos.
Por su parte, Nick Turley, responsable de ChatGPT, admitió en comunicaciones internas que los editores enfrentan una “amenaza existencial” porque los chatbots pueden sustituir la lectura directa de los artículos. Greg Brockman, presidente de OpenAI, describió los modelos como “excelentes para noticias”, mientras que Nadella reconoció que la conversación con un chatbot puede reemplazar la visita al sitio original.
El debate legal del uso justo
La cuestión de si el entrenamiento de IA con material protegido constituye un uso justo sigue sin resolverse. Los tribunales, hasta ahora, han tendido a favorecer a las empresas de IA, argumentando que el entrenamiento es una forma de análisis transformador. Sin embargo, las confesiones internas reveladas ahora ponen en tela de juicio esa defensa, al demostrar que los sistemas no solo consumen contenido sino que también compiten directamente con él.
Perspectivas futuras
El caso podría sentar un precedente crucial para la industria tecnológica y editorial. Si se determina que el scraping sin licencia viola la ley de derechos de autor, las compañías de IA podrían verse obligadas a renegociar acuerdos de licencia masivos, lo que alteraría la dinámica de generación de datos y el modelo de negocio de los medios.
Mientras tanto, la comunidad de desarrolladores y reguladores observa con atención cómo evoluciona este conflicto, que podría redefinir la relación entre la inteligencia artificial y la propiedad intelectual.