虎嗅

**Titulo español:** Las grandes empresas de IA comienzan a tomar medidas drásticas debido a la falta de datos de entrenamiento

原文:训练数据不够用,AI大厂开始下“毒手”

Resumen del contenido principal

Hasta la fecha, el desarrollo de la IA ha consumido casi todos los datos públicos disponibles en internet. Para volverse más inteligente (pasando de ser robots de conversación a "empleados digitales" capaces de realizar tareas concretas), las empresas de IA han comenzado a interesarse por los datos internos de startups que han cerrado o sido adquiridas: código, registros de conversaciones, correos electrónicos, grabaciones de reuniones y otros rastros de actividad. Este tipo de comercio de datos ha experimentado un crecimiento explosivo este año, pero detrás de él se esconden problemas graves como la violación de la privacidad, lagunas legales y conflictos éticos. Lo más irónico es que gigantes como Google y Meta ya han estado utilizando legalmente los datos de los usuarios para entrenar a la IA modificando sus políticas de privacidad, mientras que Mercor simplemente ha llevado este tipo de prácticas a un terreno aún más incierto. La evolución de la IA está consumiendo, en esencia, la privacidad digital de las personas, y este conflicto no se resolverá fácilmente a corto plazo.

I. ¿Por qué la IA quiere los "diarios de trabajo" de las empresas que han cerrado? Los datos públicos ya no son suficientes

La inteligencia de la IA no surge de la nada; necesita ser "alimentada" con datos. Anteriormente, los principales laboratorios recopilaban páginas web, artículos académicos, código y publicaciones en foros de internet, lo que se conocía como un "banquete de datos públicos". Pero ese banquete ha terminado. Ahora, para que la IA pase de ser capaz de conversar a poder realizar tareas, lo que necesita no son las respuestas, sino los procesos: cómo los ingenieros identifican problemas, discuten soluciones, modifican el código y resuelven errores. Todo esto se encuentra en los registros internos de las empresas que han cerrado (como conversaciones en Slack, grabaciones de Zoom y historiales de cambios de código), que son los datos empresariales reales más necesarios para el entrenamiento de la IA.

Por ejemplo, GitHub ha logrado avances significativos en el desarrollo de la IA gracias a sus registros de cambios de código (commit logs), que conservan el proceso completo de "problema → discusión → modificación → verificación". Otros sectores no cuentan con fuentes de datos tan accesibles, por lo que los datos internos de las empresas que han cerrado llenan esta brecha, explicando por qué Mercor está dispuesto a pagar 300.000 dólares por ellos y por qué este negocio ha cobrado popularidad.

II. Los riesgos de adquirir estos datos: la violación de la privacidad es solo la punta del iceberg

Estos datos internos contienen información muy sensible, y su uso inapropiado puede causar grandes problemas:

1. Privacidad insuficiente para proteger: Mercor afirma poder ocultar la información delicada, pero todos en el sector saben que lo más valioso es saber "quién dijo qué y qué acciones se derivaron de ello". Por ejemplo, cambiar los nombres de los empleados a "ingeniero A" no elimina completamente información como sus cargos, proyectos o relaciones con clientes, lo que facilita la identificación y la violación de la privacidad.

2. Falta de consentimiento de los empleados: Los empleados generalmente no saben que sus registros de conversaciones y discusiones en reuniones se están vendiendo. Incluso si han firmado acuerdos de propiedad intelectual, eso no implica que estén de acuerdo con que sus "conversaciones de trabajo" sean utilizadas para entrenar a la IA.

3. Confidencialidad comercial y prejuicios: Los datos pueden contener información sobre clientes y secretos empresariales; lo peor es que los prejuicios presentes en el trabajo humano (como la discriminación contra ciertos clientes o errores en las decisiones) pueden ser replicados y amplificados por la IA, convirtiéndose en "prejuicios algorítmicos".

4. Lagunas legales: No existe una normativa global clara que determine si las empresas pueden vender datos internos a compañías de IA, lo que crea un vacío legal. Esto puede impulsar el rápido desarrollo de la IA, pero también abrir la caja de Pandora de la violación de la privacidad.

III. Los gigantes ya están haciendo esto: con un simple cambio en su política de privacidad, tus datos se convierten en combustible para la IA

No pienses que solo Mercor está participando en estas prácticas dudosas; gigantes como Google y Meta ya utilizan legalmente los datos de los usuarios para entrenar a la IA:

  • En 2023, Google actualizó silenciosamente su política de privacidad para incluir la utilización de información pública (correos electrónicos de Gmail, documentos de Google Docs y registros de búsqueda) en el entrenamiento de la IA. En 2026, incorporó automáticamente a todos los usuarios a este proceso, por lo que estos últimos deben optar por salir voluntariamente.
  • Meta también modificó su política en 2023 para utilizar publicaciones y fotos de Facebook e Instagram en el entrenamiento de la IA. En 2024 suspendió este uso para usuarios de la UE, pero lo reanudó en 2026, ofreciendo a los usuarios solo la opción de oponerse, no la de dar su consentimiento.

En resumen, Mercor simplemente ha hecho visible lo que los gigantes ya estaban haciendo de forma discreta; la diferencia radica en que estos últimos utilizan métodos legales (como modificar las condiciones del servicio), mientras que Mercor sigue un camino más incierto.

IV. ¿Cómo resolver este problema? Es necesario el esfuerzo conjunto de la ley, la tecnología y la autodisciplina... pero hay un largo camino por recorrer

Este conflicto no es insoluble, pero requiere el trabajo conjunto de todas las partes:

1. Leyes para llenar las lagunas: Es necesario aclarar quién posee estos datos (empresas, empleados o clientes) y quién debe dar su consentimiento antes de venderlos.

2. Tecnologías para proteger la privacidad: Métodos como el "aprendizaje federal" (entrenamiento de la IA en el lugar donde se encuentran los datos, sin necesidad de extraerlos) y la "privacidad diferencial" (añadir ruido a los datos para que no sea posible identificar a las personas específicas, sin afectar al aprendizaje de la IA) pueden reducir el riesgo de violación de la privacidad.

3. Autodisciplina del sector y de las empresas: Las compañías que manejan datos deben establecer mecanismos para rastrear su origen y notificar a los empleados antes de venderlos, obteniendo su consentimiento.

Sin embargo, todos estos cambios tomarán tiempo. Mientras las empresas de IA sigan desarrollándose, los usuarios necesiten proteger su privacidad y los gigantes busquen beneficios, este conflicto continuará. A corto plazo, la evolución de la IA seguirá dependiendo de la privacidad digital de las personas, y esta carrera aún no ha llegado a su fin.

Conclusión

Cada mejora en la inteligencia de la IA conlleva la consumición de nuestros rastros digitales: desde páginas web públicas hasta registros de trabajo, pasando por la recolección "legal" por parte de los gigantes y las adquisiciones más inciertas. Mientras admiramos el potencial de la IA, también debemos aceptar que su base de inteligencia se construye sobre un "patrimonio digital" que muchas personas nunca han tenido un lugar seguro. En el futuro, la regulación establecerá límites claros, pero por ahora, este juego en el que se intercambia privacidad por inteligencia continúa.