A OpenAI no le tenía miedo la ley: le tenía miedo Hacker News

A OpenAI no le tenía miedo la ley: le tenía miedo Hacker News

A OpenAI no le tenía miedo la ley: le tenía miedo Hacker News

El detalle que nadie quiere ver en los documentos desclasificados

Cuando leí los documentos desclasificados del caso Authors Guild v. OpenAI, no me quedé pegado con la piratería masiva de libros, que es lo obvio. Me quedé pegado con una frase interna de un investigador: tenían miedo de que apareciera en Hacker News el titular “openai usa datos con copyright de un sitio ruso sospechoso”. Eso sería “unfortunate”, decía. O sea: no les preocupaba haber entrenado con LibGen, una biblioteca pirata gigante. Les preocupaba la vergüenza de ser pillados por un foro de programadores.

Para quien trabaja en sistemas, eso es un patrón que conocemos de memoria: no es el delito, es el log lo que te cae. En los documentos (presentados el 17 de septiembre en el tribunal federal de Manhattan) aparece de todo. Que Microsoft sabía desde abril de 2019 del uso de LibGen, cuando Sam Altman y Dario Amodei le presentaron una versión temprana de GPT-3 a Bill Gates. Que Jack Clark, director de políticas de OpenAI, escribió en 2020 que su trabajo haría gente quedaría sin empleo y que cuando los artistas se quejaran, “probablemente ignoraríamos sus preocupaciones y lanzaríamos igual”. Y que en 2022 la empresa ejecutó algo llamado Project Clear: borrar los archivos de LibGen de sus sistemas y almacenamiento. El propio vicepresidente de investigación escribió por Slack que era “el momento correcto para extirpar LibGen”, justo cuando la compañía andaba en todas las noticias.

Autocompletar a Martin, con la conciencia tranquila

Otra perla: en 2022 OpenAI contrató a un investigador con la misión de que GPT terminara de escribir los últimos libros de Canción de Hielo y Fuego, la saga de George R.R. Martin. El tipo decía que podría descansar tranquilo sabiendo que, aunque GRRM muera temprano, GPT-5 autocompletaría su saga. Cuando los autores se quejaban de que los datasets eran robados, él lo veía como “disrupción económica aceptable” y pronosticaba “la muerte del lector”: máquinas generando slop para otras máquinas.

Mi opinión es dura y la asumo. Esto no es un dilema ético de manual; es la crónica de cómo se fabricó un producto de miles de millones de dólares encima de material pirata, sabiendo que era ilegal, y tratando de limpiar las huellas cuando el viento venía mal. Como administrador de sistemas me da rabia doble: la primera regla que aprendes es que borrar registros cuando ya sabes que vas a ser auditado es la peor decisión posible. En un server de verdad, eso convierte un problema en un delito. Aquí hicieron exactamente eso, pero a escala de datacenter.

El otro punto que me molesta es el estándar doble. Si tú o yo montamos un servidor con contenido pirata y lo borramos al enterarnos de una demanda, estamos muertos legalmente. Cuando lo hace la empresa más caliente del momento, es “disrupción aceptable”. Los autores demandantes —John Grisham, George R.R. Martin, Jodi Picoult, entre otros— están pidiendo juicio sumario parcial, y la audiencia viene para principios de 2027. Va a ser un caso que marque el precio real del entrenamiento de modelos.

Lo que más me queda resonando es la ironía del titular. La cultura tech que se alimenta de Hacker News, los mismos que discutimos el fine-tuning y el RAG en el foro, fuimos la amenaza real para OpenAI, no los jueces. Se cuidaron del feed antes que de la ley. Y hoy, con todo documentado, no queda otra que leer los papeles: la mejor evidencia de cómo se construyó esta industria no salió de un informe técnico, salió de expedientes judiciales.

Fuente de inspiración: Unsealed Briefs in Authors’ Case v. Microsoft/OpenAI: Top Execs Knew Their Mass Book Piracy Was Illegal

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *