Resumen del contenido principal
El 6 de agosto, dos eventos importantes en el mundo del AI se cruzaron: el fundador de Google DeepMind renunció a su puesto de CEO debido al retraso de su modelo (Gemini); Zhang Yiming de ByteDance decidió que sus modelos grandes no serían "destilados" (es decir, no utilizarán métodos de entrenamiento basados en la utilización de resultados de otros modelos). Esta decisión provocó divisiones en la industria: algunos la criticaron por ser una forma de buscar reconocimiento sin sustancia, mientras que otros la elogiaron por ser una vuelta a los principios fundamentales del AI. El artículo analiza la naturaleza del proceso de "destilación", las razones ocultas detrás de la decisión de ByteDance, las controversias en la industria y las diversas estrategias adoptadas por las empresas chinas de AI, señalando que ByteDance ha elegido un camino "caro y difícil", pero precisamente esta diversidad es lo que necesita el ecosistema del AI en China.
Desglose detallado
1. ¿Qué es la "destilación" y por qué todos la utilizan?
La "destilación" no es un experimento químico, sino un método de entrenamiento de modelos de AI que se divide en dos tipos:
- Destilar con tus propios modelos: usar un modelo grande para entrenar uno más pequeño (por ejemplo, GPT-4 para entrenar a GPT-3.5), algo que es una práctica común y no controvertida en la industria.
- Destilar utilizando resultados de otros modelos: utilizar las respuestas de modelos externos (como las de ChatGPT) para entrenar tus propios modelos, lo cual es objeto de controversia.
Para ilustrar: Destilar con resultados de otros modelos es como que un estudiante copie los trabajos de un compañero más avanzado; puede mejorar rápidamente sus resultados en pruebas (por ejemplo, su posición en las listas de clasificación de modelos), pero puede no aprender realmente el método para resolver problemas (es decir, la capacidad de razonamiento subyacente). ¿Por qué se utiliza tanto? Porque es eficiente y ahorra recursos computacionales. Por ejemplo, DeepSeek utilizó datos de 800,000 respuestas del modelo R1 para mejorar los resultados matemáticos de su modelo en el examen AIME24 hasta superar los de OpenAI's o1-preview, con un costo de cálculo muy bajo.
Pero ahora surgen problemas: Estados Unidos está utilizando la "destilación" como una razón para imponer sanciones; la Casa Blanca ha acusado a algunas empresas chinas de robar tecnología, y Anthropic ha señalado que estas compañías utilizan cuentas falsas para recopilar datos, y es posible detectar este comportamiento a través de la información de IP y los patrones de acceso.
2. ¿La decisión de Zhang Yiming de no destilar modelos es por miedo a las sanciones o por principios personales?
Muchos piensan que ByteDance teme que TikTok se vea afectado por las regulaciones estadounidenses, pero el artículo ofrece pruebas en contra: incluso modelos open source chinos (como Kimi K3) no permiten ser utilizados para este propósito, ya que su licencia es flexible y no conlleva riesgos para TikTok. ¿Cuál es la verdadera razón?
- Cuestiones de pureza técnica: ByteDance abrió código hace un año un modelo que no contiene datos sintéticos; temen que esto pueda contaminar sus investigaciones futuras, similar a cómo se necesitan tubos de ensayo limpios para obtener resultados precisos en los laboratorios.
- Impacto en TikTok: Aunque no es la razón principal, ByteDance tiene el negocio internacional más grande del mundo y no quiere dar pie a ninguna acusación (recuerdan que Project Seed fue suspendido por OpenAI por posibles violaciones relacionadas con la destilación de modelos).
- Juzgamiento técnico personal: Después de su renuncia, Zhang Yiming se ha dedicado profundamente al AI: asiste a las revisiones del equipo de Seed, lee artículos científicos hasta altas horas de la noche y contrata a profesores de Singapur para mejorar sus conocimientos. Esta decisión demuestra que prefiere quedarse atrás a corto plazo en pos de desarrollar habilidades verdaderamente sólidas.
3. ¿La destilación es un atajo o un camino sin salida?
Hay argumentos tanto a favor como en contra:
- Partidarios de la destilación: Es efectiva y ahorra recursos. Investigaciones de la Universidad de Tsinghua demuestran que los modelos destilados tienen un rendimiento significativamente mejor que los básicos; incluso Anthropic reconoce que es un método de entrenamiento legítimo.
- Oponentes de la destilación: Puede limitar el potencial de los modelos. Un estudio de la Universidad de Oxford indica que si un modelo repite constantemente las respuestas de otros, puede perder información (similar a cuando un mensaje se transmite muchas veces y pierde su sentido original, un fenómeno conocido como "colapso del modelo").
- Punto de vista neutral: El investigador en AI Lambert afirma que la destilación es más similar al copiar respuestas de otros, mientras que el aprendizaje automático es un proceso de exploración; las verdaderas habilidades provienen de este último. Sin embargo, también reconoce que el uso adecuado de datos sintéticos (mezclando datos reales y generados) puede evitar dicho colapso.
4. Las empresas chinas de AI: no dependen únicamente de la destilación
El artículo proporciona tres ejemplos para demostrar que la destilación es solo una herramienta, no el único elemento clave en el desarrollo del AI en China:
- Zhipu GLM-5.3: No utiliza métodos de destilación ni parámetros adicionales; mejora su rendimiento a través de técnicas de aprendizaje automático y arquitecturas de contexto amplio. Los desarrolladores afirman que aún hay mucho por explorar en términos de inteligencia.
- DeepSeek: Entrena sus modelos mediante juegos de ajedrez entre ellos, sin depender de respuestas externas; incluso el director de investigación de OpenAI reconoce que han descubierto conceptos clave relacionados con la destilación de manera independiente.
- AliQianwen: Aunque se le ha acusado de utilizar métodos de destilación, también es una fuente importante de información para muchos modelos en todo el mundo, lo que demuestra su solidez como base técnica.
Conclusión: Las controversias sobre la destilación son en realidad un intento de difamar al AI chino; este método afecta más al ritmo del desarrollo que a sus posibilidades reales.
5. ¿El riesgo asumido por ByteDance: cambiará la historia?
ByteDance está considerando entrenar modelos con más de 5 billones o incluso 10 billones de parámetros. ¿Qué tan difícil es este camino?
- Costos a corto plazo: Liang Rubo ha admitido que la brecha con los modelos líderes internacionales se está ampliando.
- Valor a largo plazo: Si tienen éxito, podrían convertirse en un jugador importante en el ámbito del AI mundial e incluso cambiar la historia del desarrollo del AI en China. En caso contrario, sería una lección costosa para la industria.
El artículo subraya que esta diversidad de enfoques es positiva: el ecosistema del AI chino necesita que empresas con diferentes recursos y capacidades sigan caminos distintos. La decisión de Zhang Yiming merece respeto, pero no debe convertirse en una norma obligatoria para toda la industria.
La última palabra
La destilación no es un símbolo de posicionamiento político; se trata de una herramienta técnica. ByteDance ha elegido el camino más difícil, pero ese tipo de valentía para no seguir ciegamente las tendencias es precisamente lo que necesita la innovación en el AI. Independientemente del resultado, su enfoque abre nuevas posibilidades para el ecosistema del AI en China.