虎嗅

Kimi, der Praktikant, gründet ein Unternehmen – dessen Wert bereits auf fast 20 Milliarden geschätzt wird

原文:Kimi实习生开公司,估值快200亿了

Die „neue Goldmine“ für junge Menschen: Die glanzvolle Wende des AI-Daten-Geschäfts und der Kapitalrausch

Zusammenfassung des Kerninhalts

Dieser Bericht enthüllt eine tiefgreifende Veränderung in der Branche: Das einst als „billige Auslagerung“ angesehene Geschäft mit AI-Trainingsdaten wird von einer Gruppe junger Unternehmer mit Hintergrund in großen Unternehmen (geboren nach 1995 und 2000) neu definiert und entwickelt sich schnell zu einem begehrten Ziel für Risikokapitalgeber (VC).

Früher bestand das Datenmarkieren darin, billige Arbeitskräfte zu finden, die Bilder markierten – mit niedrigen Hürden und geringen Gewinnen, was Investoren nicht interessierte. Heute jedoch, da große Modelle höchste Anforderungen an die Datenqualität stellen und neue Bedürfnisse wie „Verstärktes Lernen“ entstehen, verkaufen Datenunternehmen nicht mehr nur „Material“, sondern „Infrastruktur für intelligente Trainingsprozesse“.

Der Artikel nimmt beispielsweise ein Start-up mit einem Wert von 2,5 Milliarden US-Dollar unter die Lupe, das kurz vor Investitionen von Sequoia, Alibaba und Tencent steht. Solche Unternehmen haben durch den Anbiet hochwertiger Expertendaten und den Aufbau verifizierbarer Trainingsumgebungen sogar in vertikalen Bereichen wie Finanzprognosen einen Sprung von einem „Geschäft mit Cashflows“ zu einem „High-Value-Tech-Unternehmen“ geschafft. Obwohl der reine Verkauf von Daten an seine Grenzen stößt, versuchen diese jungen Unternehmer, diese Grenzen zu durchbrechen, indem sie SaaS-Dienste anbieten, tief in die Kundenprozesse eingreifen und sogar Technologien wie „Rekursives Selbstverbessern (RSI)“ erforschen, um aus Datenunternehmen „Lieferanten von Ressourcen für die AI-Ära“ oder sogar „neue Modellhersteller“ zu machen.

---

Detaillierte Analyse: Die neue Logik des AI-Daten-Geschäfts aus fünf Dimensionen

1. Umkehr der Rollen: Vom „billigen Arbeitskräften“ zu „Absolventen renommierter Universitäten“

Einfache Erklärung:

Früher stellten sich Datenmarkierer als Menschen in Städten dritter und vierter Klasse vor, die für niedrige Löhne Bilder auswählten. Es handelte sich dabei um ein typisches „Arbeitskräftegeschäft“, bei dem der billigste Anbieter gewählt wurde.

Heute hat sich das jedoch geändert. Die „Lehrer“, die AI mit Daten versorgen, sind oft Absolventen der chinesischen Fakultät für Sprachwissenschaften an Peking-Universitäten, Doktoranden der Medizin oder Praktikanten großer Unternehmen wie Alibaba Tongyi oder Moon’s Dark Side. Sie bezeichnen sich selbst als „Datenunternehmer“, aber ihre Arbeit ist völlig anders.

Warum hat sich das geändert?

Weil AI klüger geworden ist und nicht mehr nur „Mülldaten“ benötigt, sondern „hochwertige Daten“.

  • Früher: Man sagte AI einfach, „Das ist eine Katze“, und es lernte.
  • Heute: AI muss Code schreiben, wie ein Anwalt oder Arzt handeln. Man muss einen echten Arzt beauftragen, zu beurteilen, ob eine medizinische Empfehlung richtig ist, oder einen echten Programmierer, um zu überprüfen, ob der Code funktioniert.

Die Stundenzahl für diese Art von „Expertenmarkierung“ beträgt bis zu 500–1000 Yuan oder mehr. Die Zuwanderung dieser hochqualifizierten Absolventen verbessert nicht nur die Datenqualität, sondern ist vor allem entscheidend, weil sie verstehen, was die Modelle benötigen: Wie man Fragen formuliert, Daten reinigt und AI durch wiederholtes Ausprobieren stärkt. Dadurch wird die ursprünglich monotone Arbeit zu einer technischen Tätigkeit mit Forschungscharakter. Kapitalgeber schätzen genau diesen „technischen Mehrwert“.

2. Aufwertung der Anforderungen: Vom „Füttern“ zum „Bauen eines Spielplatzes“

Einfache Erklärung:

Früher war das Trainieren von AI wie das Füttern eines Kindes – man zeigte ihm 10.000 Bilder von Katzen, und es lernte, was eine Katze ist. Das nennt man „überwachtes Lernen“, bei dem Daten als „Fragen und Antworten“ dienten.

Heute muss AI mehr wie ein Mensch handeln können. Dafür braucht man nicht nur Antworten, sondern auch eine „Umgebung, in der es selbst arbeiten kann“.

Was ist eine „Verstärkte Lernumgebung“?

Stellen Sie sich vor, Sie wollen AI beibringen, Frontend-Code zu schreiben:

  • Altes Modell: Sie sagen AI, „Dieser Code ist gut“ oder „schlecht“.
  • Neues Modell: Sie geben AI eine echte Browserumgebung, in der es selbst Code schreibt, ausführt und die Webseiten betrachtet. Wenn die Seite abstürzt, erhält AI eine Fehlermeldung; wenn sie gut aussieht, erhält es eine Bestätigung. Durch Hunderte oder Tausende von Interaktionen lernt AI, wie man guten Code schreibt.

Daten sind nicht mehr nur statische Dateien, sondern ein dynamischer Prozess. Datenunternehmen bieten nicht mehr nur „Fragebögen“, sondern „Prüfumgebungen“ und „Schiedsrichter“.

Diese Art von Dienstleistungen ist extrem teuer und knapp. Unternehmen wie OpenAI und Anthropic investieren viel Geld darin (OpenAI schätzt die Datenkosten für 2030 auf 8 Milliarden US-Dollar). Wer diese hochwertigen Umgebungen bereitstellen kann, hält den Schlüssel zur Weiterentwicklung von AI in der Hand. Deshalb können kleine Teams, die solche Umgebungen entwickeln (oft weniger als 20 Mitarbeiter), einen Wert von mehreren Milliarden US-Dollar erreichen.

3. Porträt der Unternehmer: „Deserteure“ großer Unternehmen und neue Reiche

Einfache Erklärung:

Diese Unternehmer haben einen besonderen Hintergrund – sie sind weder herkömmliche Programmierer noch Verkäufer, sondern technisch versierte Geschäftsexperten.

Wer sind sie?

  • Herkunft: Meist Praktikanten oder frühere Mitarbeiter großer Modelleunternehmen wie DeepSeek, Kimi oder Alibaba.
  • Erfahrung: Sie haben selbst am Modelltraining mitgewirkt, wissen, wo Auslagerungsteams Fehler machen, und kennen die Anforderungen der Forscher sowie die Schwachstellen im gesamten Datenproduktionsprozess.
  • Motivation: In großen Unternehmen wird diese Arbeit oft ausgelagert oder als zweitrangig angesehen. Aber sie erkennen, dass diejenigen, die am nächsten an der Entwicklung stehen, am besten wissen, wie man arbeitet. Wenn man das in einem großen Unternehmen zu einem erfolgreichen Geschäft machen kann, warum sollte man es dann nicht selbst versuchen?

Warum lieben Kapitalgeber sie?

1. Geringes Vertrauensrisiko: Sie verstehen das Fach – Investoren müssen ihnen nicht erklären, was RLHF (Human Feedback Reinforcement Learning) oder Datenreinigung ist.

2 Hohe Teamqualität: Ein Kernteam besteht aus wenigen Personen, aber jeder ist ein „Allrounder“ mit Forschungsfähigkeiten, Ingenieurskenntnissen und Geschäftssinn.

3 Offensichtlicher Reichtumspotenzial: Ähnliche Unternehmen im Ausland (z. B. Scale AI, Mercor, AfterQuery) werden von Milliardären gegründet. Inländische Investoren sehen dieselbe Chance und sind bereit, viel zu investieren.

4. Geschäftliche Herausforderungen: Die Grenzen des Daten-Geschäfts und Lösungsansätze

Einfache Erklärung:

Obwohl die Geschichte vielversprechend klingt, wissen Investoren auch, dass der reine Verkauf von Daten kaum einen Wert von mehreren Milliarden US-Dollar erreichen kann.

Welche Probleme gibt es?

  • Niedrige Bruttogewinne: Unternehmen wie Mercor müssen 60–70 % ihrer Einnahmen an Experten zahlen. Je größer das Unternehmen, desto höher die Verwaltungskosten.
  • Unstabile Bestellungen: Die Datenlieferung ist einmalig – heute erhalten Sie 1 Million Datensätze, morgen nicht mehr, wenn die Qualität nicht stimmt. Im Gegensatz zu SaaS-Software, die kontinuierlich abonniert werden kann.
  • Schwierigkeiten beim Ausstieg: In China ist es begrenzt, aus einem Unternehmen, das nur Daten liefert, ein börsennotiertes oder übernommenes Unternehmen zu werden.

Wie können diese Grenzen überwunden werden? (Neue Ansätze):

Um die Grenzen zu durchbrechen, entwickeln junge Unternehmer neue Strategien:

1. SaaS-/Plattformlösungen: Statt Daten einzeln zu verkaufen, bieten sie Systeme an. Zum Beispiel helfen sie traditionellen Unternehmen (Banken, Krankenhäusern) bei der Einrichtung von AI-Prozessen. Dadurch werden sie zu langfristigen Partnern statt zu einmaligen Käufern.

2 Vertikale Spezialisierung: Zum Beispiel im Bereich Finanzprognosen – sie bieten verifizierbare Prognosesysteme an und erheben Gebühren für API-Aufrufe. Dies ist bindender als der Verkauf von Rohdaten.

3 Zur „Schattenmodellhersteller“ werden: Die von Datenunternehmen gesammelten Daten und Erfahrungen können verwendet werden, um eigene Modelle zu entwickeln oder als Grundlage für neue Modelle zu dienen. Investoren kaufen nicht nur die aktuellen Einnahmen, sondern auch die Fähigkeit des Teams, zukünftige Modelle zu entwickeln.

5. Das Konzept des RSI (Rekursives Selbstverbessern) und die unbegrenzten Möglichkeiten der Zukunft

Einfache Erklärung:

Das ist das derzeit „hardcoreste“ und zugleich „virtuellste“ Konzept – aber auch das mit dem höchsten Wertpotenzial.

Was ist RSI?

Einfach ausgedrückt: AI verbessert sich selbst.

  • Früher: Menschen schreiben Code → AI lernt → Menschen bewerten → Menschen passen den Code an.
  • RSI: AI schreibt Code → AI bewertet → AI passt den Code an → AI generiert neue Aufgaben → Der Prozess wird wiederholt.

Wenn RSI realisiert wird, könnte die Entwicklungsgeschwindigkeit von AI exponentiell steigen. Derzeit können nur Großunternehmen wie OpenAI und Anthropic solche vollständigen RSI-Systeme entwickeln.

Wie können Datenunternehmen davon profitieren?

Viele Unternehmen entwickeln „halbautomatisierte“ RSI-Systeme – sie können zwar noch nicht alles automatisieren, aber bereits 80 % der Prozesse (z. B. Datenerzeugung, Qualitätsbewertung) automatisieren. Sie positionieren sich als „Anbieter von RSI-Infrastruktur“. Das bedeutet: Wenn Großunternehmen RSI durchführen, benötigen sie viel „Treibstoff“ und „Testumgebungen“ – und diese Unternehmen liefern genau das.

Aus Sicht der Investoren: Die Investitionslogik ändert sich von „Cashflow-Betrachtung“ zu „technischer Positionierung“. Wenn ein Unternehmen beweisen kann, dass sein System die Selbstiteration von AI beschleunigt, ist es nicht nur ein Datenunternehmen, sondern ein „Accelerator für die AI-Entwicklung“. Diese Vision ermöglicht sehr hohe Werte, denn solche Unternehmen haben unbegrenzte Potenziale – solange AI weiterentwickelt wird, sind sie immer nutzbar.

Fazit:

Für junge Menschen ist das Datengeschäft kurzfristig eine Möglichkeit, schnell Geld zu verdienen (guter Cashflow, relativ niedrige Einstiegshürden), langfristig jedoch eine Möglichkeit, ein Fundament für Spitzenkräfte und technische Fähigkeiten aufzubauen. Wie Investoren sagen: „Wenn ein Team gleichzeitig Geld verdient und Forschungs- sowie Ingenieursfähigkeiten aufbaut und weiter in die Welt der künstlichen Intelligenz vordringt, ist das sehr interessant.“

Dies ist nicht nur der erste „Goldklumpen“ für junge Menschen, sondern auch der Eintritt in die Kernzirkel der KI-Industrie.