Resumen del contenido clave
El gran modelo GLM-5.3 lanzado por Zhipu AI no ha seguido la tendencia de acumular una gran cantidad de parámetros (se mantiene en 753 mil millones de parámetros), sino que ha explorado el potencial de su base existente a través del “escalado posterior al entrenamiento” (tiempo de entrenamiento más largo, más escenarios de tareas y aprendizaje automático a mayor escala), lo que ha mejorado significativamente sus capacidades. Ha demostrado un rendimiento destacado en pruebas relacionadas con tareas terminales, ingeniería de software, conocimientos profesionales, programación y seguridad (en particular, su capacidad de seguridad supera a algunos de los modelos más avanzados a nivel internacional). Justo ahora, la industria de los grandes modelos enfrenta una situación polarizada en términos de precios: los gigantes extranjeros reducen sus precios para competir con los modelos nacionales, mientras que estos últimos pasan de enfocarse en la relación calidad-precio a aumentar los precios para generar ingresos. El futuro de GLM-5.3 dependerá de si el beneficio derivado del escalado posterior al entrenamiento puede continuar, de si se pueden implementar medidas de control de seguridad después de su código ser abierto al público y de si podrá establecer una ventaja competitiva a través de sus capacidades de programación y seguridad.
I. Lógica de la actualización: en lugar de competir por el número de parámetros, se “ajusta con precisión el motor existente”
Anteriormente, en la industria de los grandes modelos, era común competir por el tamaño de los parámetros; por ejemplo, Kimi K3 logró alcanzar 2.8 billones de parámetros, lo que generó un gran revuelo en el sector. Sin embargo, GLM-5.3 toma un enfoque diferente: los parámetros de su base son los mismos que en la generación anterior, y el aumento de sus capacidades se debe exclusivamente al escalado posterior al entrenamiento. Esto es similar a ajustar con meticulosidad el motor de un coche para que funcione más rápido y de manera más estable mediante pruebas prolongadas y en condiciones de tráfico más complejas (escenarios de tareas), utilizando métodos de aprendizaje automático más avanzados. Zhipu llama a este proceso “escalado posterior al entrenamiento” y afirma que el potencial de la base existente aún no se ha explorado por completo, por lo que no es necesario apresurarse a crear una nueva base.
II. Puntos destacados en las capacidades: seguridad y programación como ventajas clave
GLM-5.3 ha obtenido resultados sobresalientes en varias pruebas clave:
- Capacidad para completar tareas reales: La puntuación en Terminal-Bench ha aumentado de 4.6 a 28.3 (cuanto más alto, mejor), lo que indica una mejora significativa en la capacidad para manejar tareas diarias como la redacción de informes y la creación de tablas.
- Capacidad de programación: En pruebas de programación de alta dificultad, superó a Claude Opus 4.8 de Anthropic y el código generado fue más conciso (un promedio de 50,000 tokens por tarea, menos de la mitad que el de Opus).
- Cobertura de conocimientos profesionales: La puntuación en GDPval-AA es de 1769, superando los 1682 de Kimi K3, lo que significa que puede manejar diversas tareas relacionadas con diferentes profesiones (por ejemplo, médicos redactando historiales clínicos o ingenieros revisando documentos técnicos).
- Capacidad de seguridad (el punto más destacado): En pruebas internacionales de detección de vulnerabilidades, superó a modelos como GPT y Anthropic; su puntuación en pruebas de explotación de vulnerabilidades profundas se duplicó, acercándose al nivel más avanzado a nivel mundial. Además, Zhipu, en colaboración con más de una docena de equipos de seguridad, ha identificado 2436 vulnerabilidades en repositorios de código reales (1097 de ellas son de alto riesgo), que afectan sistemas como Android y Windows, y las ha enviado a bases nacionales de información sobre vulnerabilidades para su reparación. Esto demuestra que el modelo es menos susceptible de ser explotado por hackers y, por lo tanto, más confiable.
III. Diferencias en los precios: los gigantes extranjeros reducen precios para competir en el mercado, mientras que los modelos nacionales aumentan los suyos
Recientemente, se ha observado una polarización en los precios de los grandes modelos:
- Los gigantes extranjeros reducen sus precios: OpenAI ha disminuido un 80% el precio de la API de GPT-5.6 Luna (de 1 dólar a 0.2 dólares por millón de tokens), y Google y Anthropic han seguido su ejemplo, temiendo que los modelos nacionales (como Kimi K3 y DeepSeek V4) les roben usuarios.
- Los modelos nacionales aumentan sus precios: El precio de DeepSeek V4-Pro se ha multiplicado por 4.5 en horas pico (de 6 yuanes a 27 yuanes por millón de tokens), y el precio de Kimi K3 también ha aumentado en un 200-300% (a 100 yuanes). Zhipu también ha subido los precios de sus modelos. La razón es que los modelos nacionales ya no dependen de precios bajos para ganar mercado, sino que buscan generar ingresos.
GLM-5.3 aún no ha anunciado ningún aumento de precio; si mantiene los mismos precios que antes (8 yuanes por entrada y 28 yuanes por millón de tokens), estaría en la misma situación que DeepSeek V4-Pro, en un momento en el que los modelos extranjeros reducen sus precios mientras que los nacionales los aumentan.
IV. Desafíos futuros: tres factores clave determinarán si este enfoque tendrá éxito
El éxito del enfoque de GLM-5.3 de no acumular parámetros y en lugar de ello enfocarse en el escalado posterior al entrenamiento dependerá de tres cuestiones:
1. ¿Cuánto tiempo durará el beneficio derivado del escalado posterior al entrenamiento?: Actualmente, el aumento de las capacidades gracias a este método es rápido, pero llegará un momento en que se agote. ¿Cómo se podrán mejorar las capacidades en el futuro?
2. ¿Se podrá gestionar adecuadamente la seguridad después de que el código sea abierto al público?: Zhipu podría hacer que su modelo sea de código abierto, lo que aumentaría su uso, pero también elevaría el riesgo de vulnerabilidades. ¿Serán capaces de controlarlas eficazmente?
3. ¿Podrán establecer una ventaja competitiva para los desarrolladores?: Con los precios reducidos en el extranjero y los aumentados en el país, GLM-5.3 tendrá que atraer a desarrolladores gracias a sus capacidades de programación y seguridad. Solo si estos consideran que el modelo es insustituible (por ejemplo, para aplicaciones relacionadas con la seguridad) podrá consolidar su posición en el mercado.
En resumen, GLM-5.3 ofrece una nueva ruta para la industria de los grandes modelos que no se basa en la cantidad de parámetros, sino en la calidad y las capacidades internas del modelo. Sin embargo, para que este enfoque tenga éxito, será necesario asegurar el avance tecnológico, la seguridad y el éxito comercial. Para los usuarios finales, es probable que en el futuro se utilicen modelos nacionales más confiables e inteligentes, aunque los precios podrían ser más elevados que antes.