虎嗅

Prueba real de DeepSeek V4.1: con 300 millones de tokens y 14 grupos de tareas, resulta ser más costoso que la versión anterior.

原文:DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

Resumen del contenido principal

Este es un informe de prueba realizado por un blogger de tecnología sobre el recién lanzado modelo V4.1 Flash de DeepSeek en su versión de prueba interna: este nuevo modelo se caracteriza por una arquitectura completamente nueva y capacidades multimodales nativas. Incluso los desarrolladores han intentado directamente en los cuestionarios de la prueba interna averiguar si puede reemplazar al modelo V4 Pro, que anteriormente tenía una posición más alta en la jerarquía de productos. El blogger comparó el nuevo modelo con la versión anterior (V4 Flash) y ejecutó 14 grupos de tareas, lo que equivalió a un consumo acumulado de llamadas al modelo equivalente a 300 millones de caracteres chinos. Los resultados mostraron que las capacidades del nuevo modelo para interpretar imágenes y crear visualizaciones han mejorado significativamente; sin embargo, también presenta desventajas como una rápida velocidad de tecleado pero una lenta entrega de resultados, dificultades para recordar contenido extenso y un mayor costo en tareas complejas. Por lo tanto, no se trata de una actualización que supere completamente a la versión anterior.

---

Interpretación sencilla por dimensiones

1. La mejora más destacada: finalmente tiene “ojos propios” y no necesita herramientas externas para interpretar imágenes

La versión anterior de Flash era puramente textual; al proporcionarle una imagen, no podía entenderla por sí misma y necesitaba utilizar herramientas externas para reconocer texto e identificar información visual, lo que llevaba décimas de segundos o incluso minutos, y a menudo cometía errores (por ejemplo, no reconocía a los vendedores ambulantes en los pósteres o confundía palabras en inglés impresas en las imágenes con otras palabras completamente irrelevantes). La versión V4.1 Flash, siendo multimodal nativa, puede analizar una imagen en 5-7 segundos y proporcionar una descripción clara del contenido, ahorrando así el tiempo necesario para usar herramientas externas. Incluso puede juzgar por sí misma si una imagen es “fea”. Anteriormente, cuando se le pedía al AI que dibujara una película montando en bicicleta, a menudo resultaba en un cisne con un tazón; ahora, el AI puede detectar los errores y modificar el pico del pájaro o ajustar su postura automáticamente.

2. Tres veces más rápido en la fase de escritura, ¿por qué el tiempo total no es mucho más rápido? Demasiado “autoanalítico”

La velocidad de tecleado del V4.1 Flash es de más de 200 caracteres chinos por segundo, lo que es tres veces más rápido que la versión anterior. Al principio, parecía muy eficiente, pero el blogger descubrió que el tiempo total necesario para completar las tareas no era mucho más rápido. Incluso al crear juegos pequeños, la cantidad de caracteres útiles generados era menor y el tiempo total era 4 minutos más largo que con la versión anterior. Al examinar los registros de ejecución, se vio que el AI dedicaba el tiempo ahorrado en la escritura de código a realizar verificaciones internas: en lugar de simplemente entregar el resultado final, revisaba el código en busca de errores. Por ejemplo, después de escribir el código, comprobaba si funcionaba correctamente y, si había errores, los corregía. Esto significaba que el tiempo dedicado a estas verificaciones era tres veces más que con la versión anterior.

3. Desigualdades significativas en las capacidades: excelente para crear cosas, pero pésima para recordar contenido extenso

Los puntos fuertes del nuevo modelo son su capacidad para convertir ideas en aplicaciones funcionales. Por ejemplo, al crear una visualización de galaxias con millones de números primos gemelos, la versión anterior calculaba los números correctamente pero no podía mostrarlos de manera interactiva; la nueva versión genera una galaxia espiral completa y permite navegar directamente a los puntos correspondientes. Sin embargo, su memoria para recordar contenido extenso es muy deficiente: al pedirle que escribiera un artículo de 100,000 palabras, a menudo se confundía sobre detalles como el número de veces que el protagonista barría el suelo. Al crear un informe de análisis de acciones, podía indicar un rendimiento anual del 15.1% en la página principal, pero los gráficos incluidos mostraban un 17.8%, lo que resultaba en incoherencias. Es como si este AI fuera un trabajador técnico muy hábil, pero con una memoria muy débil; es útil para tareas visuales simples o herramientas pequeñas, pero probablemente generaría documentos largos y contradictorios que requerirían una revisión manual por parte del usuario.

4. ¿El nuevo modelo es más costoso? Activa un “equipo completo de externalización” para tareas difíciles

Lo más sorprendente es que, para los mismos 14 grupos de tareas, el nuevo modelo costó 62 unidades monetarias, mientras que el anterior costó 45, un aumento del 36%. Después de analizar los registros, el blogger descubrió que el aumento de costo se debía a que el modelo activaba múltiples AI para manejar tareas complejas: por ejemplo, para escribir un artículo de 100,000 palabras, asignaba un escritor dedicado para cada capítulo y luego revisaba el contenido. Al crear un juego de supervivencia, activaba 13 AI para escribir diferentes partes del juego y luego las combinaba. La versión anterior, en cambio, lo hacía todo con un solo AI, lo que resultaba en un costo más bajo. Afortunadamente, los desarrolladores anunciaron una reducción de precios el 10 de septiembre, con un descuento del 60% en los costos de llamadas a cachés para contenidos utilizados con frecuencia, lo que debería hacer que el costo futuro sea más económico.