虎嗅

El estudiante practicante Kimi ha fundado una empresa cuya valoración ya supera los 20 mil millones.

原文:Kimi实习生开公司,估值快200亿了

El “nuevo yacimiento de oro” para los jóvenes: El espléndido giro del negocio de datos de IA y la locura del capital

Resumen del contenido principal

Este artículo revela un cambio monumental en la industria: el negocio de datos de entrenamiento de IA, que antes era considerado un tipo de “subcontratación de baja calidad”, está siendo redefinido por un grupo de jóvenes emprendedores (nacidos después de 1995 y 2000) con experiencia en grandes empresas, y se ha convertido rápidamente en un objetivo muy codiciado para los inversores de capital riesgo (VC).

En el pasado, el etiquetado de datos se basaba en la utilización de mano de obra barata; el umbral de entrada era bajo y las ganancias escasas, por lo que los inversores no le prestaban mucha atención. Sin embargo, ahora, con los altos requisitos de calidad de datos impuestos por los grandes modelos y el surgimiento de nuevas necesidades como los “entornos de aprendizaje reforzado”, las empresas de datos ya no solo venden “material de texto”, sino que ofrecen “infraestructura para el entrenamiento inteligente”.

El artículo toma como ejemplo una startup valorada en 2500 millones de dólares que pronto recibirá inversiones de empresas como Sequoia, Alibaba y Tencent. Esta empresa ha logrado un salto de un negocio basado en flujos de efectivo a una empresa tecnológica con una alta valoración al proporcionar datos expertos de alta calidad, crear entornos de entrenamiento verificables e incluso incursionar en campos verticales como la predicción financiera. Aunque la venta de datos en sí tiene sus límites, estos jóvenes están intentando superarlos mediante servicios SaaS, una integración profunda en los flujos de trabajo de los clientes e incluso explorando tecnologías como el “auto-mejoramiento recursivo (RSI)”, convirtiendo a sus empresas en proveedores de servicios esenciales para la era de la IA.

---

Desglose detallado: Comprender la nueva lógica del negocio de datos de IA desde cinco dimensiones

1. Inversión de roles: De “trabajadores baratos” a “exalumnos de universidades de prestigio”

Interpretación sencilla:

Antes, el etiquetado de datos se asociaba a personas que trabajaban en ciudades de tercer y cuarto nivel, recibiendo salarios bajos y seleccionando imágenes en pantalla. Era un negocio basado en el costo laboral.

Pero ahora las cosas han cambiado. Los “maestros” que alimentan a los sistemas AI son a menudo graduados de la Facultad de Chino de la Universidad de Pekín, doctores de medicina o incluso estudiantes de prácticas en grandes empresas como Alibaba Tongyi o Moon’s Dark Side. Se autodenominan “capatazos de datos”, pero su trabajo es completamente diferente.

¿Por qué ha cambiado?

Porque la IA se ha vuelto más inteligente y ya no necesita una gran cantidad de datos de baja calidad. Ahora requiere datos de alta calidad.

  • Antes: Bastaba con decirle a la IA “esta es una gata” para que aprendiera.
  • Ahora: La IA necesita escribir código, actuar como un abogado o un médico; es necesario que un verdadero médico juzgue si una recomendación médica es correcta o que un verdadero programador verifique si el código funciona.

El salario por hora de este tipo de etiquetado experto puede llegar a los 500-1000 yuanes o incluso más. La participación de estos graduados de prestigio no solo mejora la calidad de los datos, sino que, lo más importante, entienden lo que necesitan los modelos: saben cómo formular preguntas, cómo limpiar los datos y cómo ayudar a la IA a mejorar a través de pruebas y errores. Esto convierte lo que antes era un trabajo monótono en una actividad técnica con un fuerte componente de I+D. Lo que los inversores valoran es precisamente este “precio adicional tecnológico”.

2. Mejora de las necesidades: De “alimentar” a “crear entornos de aprendizaje”

Interpretación sencilla:

Antes, entrenar a la IA era como alimentar a un niño: le mostrabas miles de fotos de gatos para que aprendiera a reconocerlas. Eso se llamaba “aprendizaje supervisado”, donde los datos servían de “preguntas y respuestas”.

Ahora, la IA necesita ser más autónoma, como un ser humano. Ya no basta con darle respuestas; es necesario proporcionarle un entorno en el que pueda aprender por sí misma.

¿Qué es un “entorno de aprendizaje reforzado”?

Imagina que quieres entrenar a la IA para que escriba código. En el modelo antiguo, le decías si el código era bueno o malo. En el nuevo modelo, le proporcionas un entorno real de navegador donde puede escribir, ejecutar y ver cómo se ven las páginas web. Si la página falla, el entorno le da un mensaje de error; si es atractiva, recibe una señal de éxito. La IA aprende a través de cientos o miles de intentos, como si jugara a un juego.

Estos entornos de entrenamiento verificables son extremadamente caros y escasos. Empresas como OpenAI y Anthropic están invirtiendo mucho en ellos (OpenAI estima que sus costos de datos llegarán a 8000 millones de dólares en 2030). Aquellos que puedan ofrecer estos entornos de alta calidad controlarán el futuro de la IA. Por eso, aunque estos equipos pequeños (con menos de 20 personas) tienen una valoración de miles de millones de dólares.

3. Perfil de los emprendedores: “Desertores” de grandes empresas que se convierten en nuevos ricos

Interpretación sencilla:

Estos emprendedores provienen de entornos de grandes empresas y no son programadores ni vendedores tradicionales, sino expertos en tecnología.

¿Quiénes son?

  • Origen: La mayoría son ex estudiantes de prácticas o empleados iniciales en empresas que desarrollan grandes modelos (como DeepSeek, Kimi, Alibaba, etc.).
  • Experiencia: Han participado personalmente en el entrenamiento de modelos y conocen los puntos débiles de los equipos de subcontratación, así como lo que realmente necesitan los investigadores y los problemas en todo el proceso de producción de datos.
  • Motivación: Se dieron cuenta de que este trabajo se subcontrata o se considera secundario en las grandes empresas, pero ellos saben cómo hacerlo bien. Entonces, ¿por qué no crear su propio negocio?

¿Por qué los inversores los favorecen?

1. Bajo riesgo de fracaso: Conocen el tema, por lo que los inversores no necesitan explicarles conceptos como el RLHF (aprendizaje reforzado con retroalimentación humana) o la limpieza de datos.

2 Equipo altamente especializado: Un equipo central puede estar formado por pocas personas, pero cada uno es un experto en investigación, ingeniería y negocios.

3 Potencial de enriquecimiento claro: Empresarios extranjeros como Scale AI, Mercor y AfterQuery son multimillonarios de menos de 20 años. Los inversores chinos ven las mismas oportunidades y están dispuestos a apostar fuerte.

4. Dificultades comerciales: Los límites del negocio de datos y cómo superarlos

Interpretación sencilla: Aunque el negocio parece prometedor, los inversores saben que vender datos por sí solo no es suficiente para alcanzar una valoración de miles de millones.

¿Cuáles son los problemas?

  • Margen de beneficio bajo: Empresas como Mercor pagan entre el 60% y el 70% de sus ingresos a los proveedores de datos. El margen es pequeño y los costos de gestión aumentan con el tamaño.
  • Pedidos inestables: La entrega de datos es única; se paga una vez que se aprueba la calidad. ¿Y mañana? Si la calidad no cumple con los estándares, el cliente puede cancelar el pedido. A diferencia de los software SaaS, no hay ingresos recurrentes.
  • Dificultades para salir del mercado: En China, si la empresa solo se convierte en una empresa de subcontratación, las opciones de salida (como la cotización en bolsa o fusiones) son limitadas.

¿Cómo superar estos obstáculos? (Nuevas estrategias):

Para superar estos límites, los emprendedores están cambiando su enfoque, pasando de vender datos a ofrecer servicios e infraestructura:

1. Servicios SaaS/plataformas: En lugar de vender datos por unidad, ofrecen sistemas completos. Por ejemplo, ayudan a empresas (banca, hospitales) a establecer flujos de trabajo basados en IA. De esta manera, se convierten en socios a largo plazo en lugar de proveedores de datos ocasionales.

2 Incursión en campos verticales: Como la predicción financiera. Ofrecen sistemas de predicción verificables y cobran por las llamadas a las API. Esto crea una mayor fidelidad con los clientes.

3 **Convertirse en “fábricas de modelos”: Los datos y la experiencia de entrenamiento acumulados por las empresas de datos pueden usarse para desarrollar sus propios modelos o servir como base para nuevos modelos. Los inversores compran no solo los ingresos actuales, sino también la capacidad del equipo para crear futuros modelos.

5. El concepto de RSI (auto-mejoramiento recursivo) y sus posibilidades futuras

Interpretación sencilla:

Este es el concepto más avanzado y también el más ambicioso, pero también el que conlleva las mayores valoraciones.

¿Qué es el RSI?

En esencia, es cuando la IA se mejora a sí misma.

  • Antes: Los humanos escriben el código, la IA aprende, los humanos evalúan y luego ajustan el código.
  • RSI: La IA escribe el código, se evalúa, ajusta y luego genera nuevos problemas, en un ciclo continuo.

Si se logra el RSI, la velocidad de evolución de la IA aumentará exponencialmente. Actualmente, solo empresas como OpenAI y Anthropic tienen la capacidad de implementar RSI a nivel completo.

¿Cómo pueden las empresas de datos aprovechar esta tendencia?

Muchas empresas de datos están desarrollando sistemas “semirrecursivos”. Aunque aún no pueden automatizar todo, ya han logrado una automatización del 80% en ciertos procesos (como la generación y evaluación de datos). Se presentan como proveedores de “infraestructura para RSI”, proporcionando lo necesario para que las grandes empresas puedan avanzar en su desarrollo.

Perspectiva de los inversores:

El enfoque de inversión cambia de los flujos de efectivo a la posición tecnológica de la empresa. Si una empresa de datos puede demostrar que su sistema acelera la evolución de los modelos, entonces no es solo una empresa de datos, sino un acelerador de la evolución de la IA. Este enfoque justifica valoraciones muy altas, ya que su potencial es ilimitado mientras la IA siga evolucionando.

En resumen:

Para los jóvenes, el negocio de datos ofrece la oportunidad de ganar dinero rápidamente y acumular recursos tecnológicos a largo plazo. Como dicen los inversores, “si un equipo puede generar ingresos y al mismo tiempo desarrollar habilidades de investigación e ingeniería, y seguir avanzando en el campo de la inteligencia artificial, eso es muy interesante”.

No se trata solo de obtener un primer éxito económico, sino también de obtener un pase hacia el círculo central de la industria de la IA.