虎嗅

**Übersetzung:** „Nicht genügend Trainingsdaten – Große AI-Unternehmen greifen zu drastischen Maßnahmen“

原文:训练数据不够用,AI大厂开始下“毒手”

Zusammenfassung der Kerninhalte

Inzwischen hat die Entwicklung der KI nahezu alle öffentlichen Internetdaten verbraucht. Um noch intelligenter zu werden – von Chatbots zu „digitalen Mitarbeitern“, die tatsächliche Aufgaben erledigen können – konzentrieren sich KI-Unternehmen auf die internen Daten ausgegangener oder übernommener Start-ups: Code, Chatprotokolle, E-Mails, Protokolle von Meetings und andere Arbeitsspuren. Der Handel mit diesen Daten ist in diesem Jahr exponentiell gewachsen, doch dahinter verbergen sich große Probleme wie Datenschutzverletzungen, rechtliche Lücken und ethische Konflikte. Ironischerweise nutzen Giganten wie Google und Meta bereits seit längerem die Datenschutzrichtlinien, um Nutzerdaten „legal“ für das KI-Training zu verwenden. Mercor hat diese Praktiken nur in einen noch graueren Bereich getrieben. Die Evolution der KI bedeutet im Grunde genommen den Verbrauch des digitalen Privatschutzes der Menschen – und dieses Dilemma lässt sich kurzfristig kaum lösen.

Warum greifen KIs auf die „Arbeitsunterlagen“ ausgegangener Unternehmen zurück? Offentliche Daten reichen nicht mehr aus

Die Intelligenz der KI entsteht nicht aus dem Nichts, sondern durch das Verarbeiten von Daten. Früher sammelten große Labore Webseiten, Artikel, Code und Forumbeiträge vom Internet – das wurde als „Feast of Public Data“ bezeichnet. Doch dieses Fest ist vorbei: Um von einem Chatbot zu einem „funktionsfähigen“ System zu werden, benötigt die KI nicht nur Antworten, sondern auch den Prozess dahinter – wie Ingenieure Probleme erkennen, Lösungen besprechen, Code ändern und Fehler beheben. All diese Informationen befinden sich in den internen Aufzeichnungen ausgegangener Unternehmen (Slack-Chatverläufe, Zoom-Protokolle, Codeänderungsverläufe) und stellen das dringendste „reale Geschäftsdatenmaterial“ für das KI-Training dar.

Ein Beispiel: GitHub hat die Fähigkeiten der KI durch seine Commit-Verzeichnisse (Logbücher von Codeänderungen) erheblich verbessert, da diese den vollständigen Ablauf von Problemen, Diskussionen, Änderungen und Überprüfungen dokumentieren. Andere Branchen verfügen nicht über solche offenen Datenquellen; daher ergänzen die internen Daten ausgegangener Unternehmen diese Lücke – weshalb Mercor bereit ist, 300.000 US-Dollar für deren Erwerb zu zahlen und dieser Geschäftszweig so erfolgreich wird.

Die Risiken des Kaufs dieser Daten: Datenschutzverletzungen sind nur die Spitze des Eisbergs

Diese internen Daten enthalten viele sensible Informationen, deren Verwendung große Probleme verursachen kann:

1. Unmöglichkeit, den Datenschutz zu gewährleisten: Mercor behauptet, sensitive Informationen verschleiern zu können, doch tatsächlich sind die wertvollsten Daten jene, die zeigen, wer wann was gesagt hat und welche Handlungen daraus resultierten. Selbst wenn Namen von Mitarbeitern geändert werden, lassen sich Bezugsinformationen wie Positionen, Projekte und Kundenbeziehungen oft nicht vollständig entfernen, wodurch der Datenschutz weiterhin gefährdet ist.

2. Mangelnde Zustimmung der Mitarbeiter: Die Mitarbeiter wissen oft nicht, dass ihre Chatverläufe und Meetingbeiträge verkauft werden. Selbst wenn sie eine Vereinbarung über das Urheberrecht unterzeichnet haben, bedeutet das nicht automatisch ihre Zustimmung zur Nutzung ihrer „Arbeitsgespräche“ für KI-Trainingszwecke.

3. Geschäftsgeheimnisse und Vorurteile: Die Daten können Kundendaten und Unternehmensgeheimnisse enthalten; schlimmer noch: Menschliche Vorurteile (z. B. Diskriminierung bestimmter Kunden oder Fehler in Entscheidungen) können von der KI übernommen und verstärkt werden, was zu „Algorithmenvorurteilen“ führt.

4 Rechtliche Unklarheiten: Es gibt weltweit keine klaren Vorschriften darüber, ob Unternehmen interne Arbeitsdaten an KI-Unternehmen verkaufen dürfen – dies ist ein rechtliches Vakuum, das sowohl die schnelle Entwicklung der KI als auch den Ausbruch von Datenschutzproblemen ermöglichen kann.

Giganten haben bereits damit begonnen: Mit einer Änderung der Datenschutzrichtlinien werden Ihre Daten zu KI-Treibstoff

Man sollte nicht glauben, dass nur Mercor solche „grauen“ Transaktionen durchführt. Google und Meta nutzen bereits seit längerem die Daten ihrer Nutzer „legal“ für das KI-Training:

  • Google aktualisierte im Jahr 2023 heimlich seine Datenschutzrichtlinien und erklärte, dass es öffentliche Informationen zur KI-Entwicklung verwendet – einschließlich Ihrer Gmail-E-Mails, Google Docs-Dokumente und Suchverläufe. Im Jahr 2026 wurden alle Nutzer automatisch in das KI-Training einbezogen; Sie mussten sich aktiv ausschließen.
  • Meta änderte ebenfalls seine Richtlinien im Jahr 2023 und nutzte öffentliche Beiträge und Fotos von Facebook und Instagram für das KI-Training. Im Jahr 2024 wurde der Datentransfer für EU-Nutzer vorübergehend eingestellt, wurde aber 2026 wieder aufgenommen; Nutzer haben nur noch die Möglichkeit, sich dagegen auszusprechen (nicht zu stimmen).

Im Grunde genommen hat Mercor nur das, was die Giganten heimlich taten, an die Öffentlichkeit gebracht – der Unterschied besteht darin, dass die Giganten dies durch legale Änderungen ihrer Dienstleistungsbedingungen tun, während Mercor einen „grauen“ Weg wählt.

Wie kann man dieses Dilemma lösen? Recht, Technologie und Selbstdisziplin sind erforderlich – doch der Weg ist noch lang

Dieses Problem ist lösbar, aber es erfordert die gemeinsamen Anstrengungen aller Beteiligten:

1. Rechtliche Klärungen: Es muss geklärt werden, wem diese Daten gehören (Unternehmen? Mitarbeiter? Kunden?) und wer vor dem Verkauf der Daten seine Zustimmung geben muss.

2. Technologische Lösungen zum Schutz des Datenschutzes: Techniken wie „Federated Learning“ (KI-Training am Ort der Daten, ohne die Originaldaten zu übertragen) oder „Differential Privacy“ (Hinzufügen von „Rauschen“ zu den Daten, um die Identität der Personen zu verschleiern, ohne das Lernen der KI zu beeinträchtigen) können das Risiko von Datenschutzverletzungen verringern.

3. Selbstdisziplin in der Branche und bei Unternehmen: Datenunternehmen sollten Verfahren zur Nachverfolgung der Datenquellen einführen, und Unternehmen müssen ihre Mitarbeiter vor dem Verkauf der Daten informieren und deren Zustimmung einholen.

Allerdings benötigen diese Lösungen Zeit – schließlich wollen KI-Unternehmen wachsen, Nutzer ihren Datenschutz und die Giganten ihre Gewinne. Der Wettlauf zwischen diesen Interessen wird nicht aufhören. Kurzfristig wird sich die Entwicklung der KI weiterhin auf den Verbrauch des digitalen Privatschutzes der Menschen stützen – und dieser „Wettlauf“ ist noch lange nicht zu Ende.

Fazit

Jede Verbesserung der KI-Intelligenz bedeutet den Verbrauch unserer digitalen Spuren: von offenen Webseiten über Arbeitsunterlagen bis hin zur „legalen“ Sammlung durch Giganten und „grauen“ Übernahmen. Einerseits bewundern wir die Leistungsfähigkeit der KI, andererseits müssen wir akzeptieren, dass ihre Basis aus dem „digitalen Erbe“ besteht, das viele Menschen nie richtig geschützt haben. Zukünftige Regulierungen werden Grenzen setzen – doch vorerst geht dieses Spiel „Datenschutz gegen Intelligenz“ weiter.