虎嗅

**Manque de données d'entraînement : les grandes entreprises de l'intelligence artificielle commencent à prendre des mesures drastiques.**

原文:训练数据不够用,AI大厂开始下“毒手”

Résumé des points clés

À l'heure actuelle, l'intelligence artificielle (IA) a déjà largement exploité les données disponibles sur Internet. Pour devenir encore plus performante (passant de robots de conversation à des "employés numériques" capables d'exécuter des tâches réelles), les entreprises spécialisées en IA se tournent vers les données internes des startups qui ont fait faillite ou ont été rachetées : codes, archives de conversations, e-mails, enregistrements de réunions, etc. Ce marché a connu une croissance explosive cette année, mais il cache de graves problèmes tels que la violation de la vie privée, des lacunes juridiques et des conflits éthiques. Ironie du sort, des géants comme Google et Meta utilisent déjà légalement les données des utilisateurs pour entraîner leurs systèmes d'IA en modifiant leurs politiques de confidentialité, tandis que Mercor a simplement poussé ces pratiques vers une zone encore plus floue (grise). L'évolution de l'IA se fait au détriment de la vie privée numérique des humains, et ce conflit ne sera pas résolu à court terme.

I. Pourquoi l'IA s'intéresse-t-elle aux données des entreprises en faillite ?

L'intelligence de l'IA ne vient pas de nulle part ; elle nécessite des données pour se développer. Auparavant, les laboratoires collectaient abondamment des pages Web, des articles scientifiques, du code et des messages de forums sur Internet, ce que l'on appelait la "fête des données publiques". Mais cette époque est révolue : pour passer d'une IA capable de converser à une IA capable de travailler efficacement, il ne suffit plus de disposer d'informations brutes (réponses aux questions), il faut aussi comprendre le processus par lequel les ingénieurs identifient les problèmes, discutent des solutions, modifient le code et résolvent les erreurs. Ces informations se trouvent dans les archives internes des entreprises en faillite (conversations via Slack, enregistrements de réunions, historique des modifications de code), qui constituent des données essentielles pour l'entraînement de l'IA. Par exemple, GitHub a permis à l'IA d'améliorer considérablement ses capacités grâce à ses archives de modifications de code (journal des commits), qui révèlent le parcours complet des problèmes jusqu'à leurs résolutions. D'autres secteurs ne disposent pas de telles sources de données, ce qui rend les données internes des entreprises en faillite particulièrement précieuses ; c'est pourquoi Mercor a été prêt à payer 300 000 dollars pour les acquérir, faisant ainsi de cette activité un marché très lucratif.

II. Les risques liés à l'acquisition de ces données : la violation de la vie privée n'est que la pointe de l'iceberg

Ces données internes contiennent des informations sensibles qui peuvent entraîner de graves problèmes :

1. Difficulté à protéger la vie privée : Mercor prétend pouvoir masquer les informations sensibles, mais il est bien connu dans le secteur que ce qui est vraiment précieux, c'est l'identité des personnes et le contenu de leurs conversations, ainsi que les actions qui en résultent. Par exemple, remplacer les noms des employés par "ingénieur A" ne suffit pas à protéger leur vie privée si des informations liées à leurs postes, aux projets ou aux relations avec les clients sont présentes dans les données.

2. Absence de consentement des employés : Lorsque les entreprises vendent leurs données, les employés ignorent souvent que leurs conversations et leurs interventions en réunion sont utilisées pour entraîner l'IA. Même s'ils ont signé des accords sur la propriété intellectuelle, cela ne signifie pas qu'ils accordent leur consentement pour que ces données soient utilisées à cette fin.

3. Confidentialité commerciale et biais : Les données peuvent contenir des informations sur les clients et des secrets d'entreprise. De plus, les biais présents dans le travail humain (comme la discrimination envers certains clients ou des erreurs de décision) peuvent être reproduits et amplifiés par l'IA, créant des "biais algorithmiques".

4 Lacunes juridiques : Il n'existe pas de règlementations mondiales claires sur le droit des entreprises de vendre leurs données internes aux entreprises d'IA, ce qui crée un vide juridique. Cela peut soit favoriser le développement rapide de l'IA, soit ouvrir la porte à de graves violations de la vie privée.

III. Les géants le font déjà depuis longtemps : modifiez votre politique de confidentialité et vos données deviennent du carburant pour l'IA

Ne pensez pas que Mercor est le seul à mener des transactions douteuses : Google et Meta utilisent déjà légalement les données des utilisateurs pour entraîner leurs systèmes d'IA :

  • En 2023, Google a modifié discrètement sa politique de confidentialité pour autoriser l'utilisation de données publiques (e-mails Gmail, documents Google Docs, historique des recherches) dans le but d'entraîner l'IA. En 2026, tous les utilisateurs ont été automatiquement inclus dans ce programme d'entraînement, sauf s'ils ont choisi de se retirer.
  • Meta a également modifié sa politique en 2023 pour utiliser des publications et des photos publiées sur Facebook et Instagram. En 2024, l'utilisation de données européennes a été temporairement interrompue, puis rétablie en 2026, offrant aux utilisateurs le droit de s'opposer uniquement (et non le droit d'accord).

En somme, Mercor met simplement en lumière des pratiques déjà en place par les géants, qui utilisent des moyens légaux (modifications des conditions d'utilisation des services), tandis que Mercor emprunte une voie plus discrète.

IV. Comment résoudre ce problème ?

Il faut que la législation, la technologie et l'autodiscipline des entreprises évoluent ensemble, mais le chemin est encore long :

1. Réglementation pour combler les lacunes juridiques : Il est nécessaire de clarifier à qui appartiennent ces données (l'entreprise, les employés ou les clients) et qui doit donner son consentement avant la vente des données.

2. Technologies pour protéger la vie privée : Des technologies telles que l'apprentissage distribué (l'IA s'entraîne sur place, sans besoin de transférer les données originales) ou la confidentialité différencielle (ajout de "bruit" aux données pour masquer l'identité des personnes tout en permettant à l'IA d'apprendre) peuvent réduire les risques de violation de la vie privée.

3. Autodiscipline du secteur et des entreprises : Les entreprises qui gèrent ces données doivent mettre en place des mécanismes de traçabilité et informer clairement leurs employés avant de vendre leurs données, en obtenant leur consentement.

Cependant, tous ces changements prendront du temps. Les entreprises d'IA ont besoin de se développer, les utilisateurs veulent protéger leur vie privée, et les géants cherchent à maximiser leurs profits ; le jeu des intérêts est inévitable. À court terme, l'évolution de l'IA continuera de dépendre de la consommation de la vie privée numérique humaine.

Conclusion

Chaque amélioration de l'intelligence artificielle entraîne la destruction de traces digitales laissées par les humains : des pages Web publiques aux archives de travail, en passant par la collecte légale par les géants et les transactions douteuses. Alors que nous sommes impressionnés par les capacités de l'IA, nous devons admettre que sa base intellectuelle repose sur un "héritage numérique" qui n'a jamais été correctement géré par les êtres humains. La réglementation future établira des limites, mais pour l'instant, le jeu consistant à "échanger la vie privée contre de l'intelligence" se poursuit.