Resumen del contenido central
Recientemente, el mundo del AI ha asistido a una farsa que ha pasado de la euforia al desenmascaramiento de fraudes: El equipo J-Space anunció el lanzamiento de un complemento llamado Skill que, sin necesidad de modificar los pesos del modelo, mejoraría significativamente el rendimiento de DeepSeek V4 Pro, superando incluso al modelo líder Fable 5. Sin embargo, los desarrolladores de la comunidad realizaron pruebas adicionales y descubrieron que no solo no había mejora en el rendimiento, sino que también se consumían más recursos. El autor rechazó revelar los detalles de las evaluaciones y eliminó los posts que planteaban dudas, lo que llevó a la exposición del engaño detrás de esta “mejora mágica”. Lo engañoso de todo esto es que J-Space aprovechó de manera precisa un problema real de DeepSeek V4 Pro: su sensibilidad al entorno externo, lo que hizo que muchas personas creyeran en sus afirmaciones.
1. El “habilidad mágica” de J-Space: Una promesa exagerada de superar a Fable5
El Cognition Suite V3.6 lanzado por J-Space es, en esencia, un conjunto de herramientas para el control del funcionamiento del modelo; no modifica el modelo en sí, sino que añade una capa de lógica de gestión durante la ejecución de tareas por parte del AI. Ellos señalan que los asistentes AI cometen cuatro errores habituales:
- Sobrecarga de información: demasiados objetivos y herramientas en las tareas, lo que hace que el contenido importante quede oculto;
- Desviación en la memoria: después de varias rondas de razonamiento, el mismo nombre o valor puede cambiar significativamente;
- Reintentos sin sentido: se repiten las operaciones sin analizar las razones de los fallos;
- Resolución prematura: se considera que una respuesta es correcta sin verificar si realmente lo es.
Su solución consiste en convertir el proceso de ejecución en un ciclo de “juicio rápido → ejecución → reflexión profunda → verificación → intento nuevamente con información de diagnóstico”, y también almacenan la información clave en una “libreta externa” para evitar olvidos. Luego presentaron resultados exagerados: Terminal Bench pasó de 87.9 a 90.1, NL2Repo de 61.5 a 73.4, e incluso afirmaron que habían superado a Fable5 y Opus4.8, lo que generó mucha atención.
2. El desenmascaramiento por parte de la comunidad: los resultados reales no justifican las promesas
Rápidamente, alguien salió a desacreditar estas afirmaciones:
- Pruebas del desarrollador A: con dos rondas de pruebas A/B utilizando V4 Flash, no hubo diferencia en el rendimiento, pero el equipo J-Space consumió más recursos; en una evaluación ciega realizada por terceros, el grupo de control obtuvo 8.3 puntos y el grupo de J-Space solo 7.87.
- Prueba contundente del desarrollador B: con 8 tarjetas NVIDIA H20 para resolver 89 preguntas, solo se acertaron 69 (un 77.5%), pero en el informe se indicó que el rendimiento real fue del 87.1%, lo que representa una diferencia de casi el 10%; los intentos fallidos no mejoraron después de tres repeticiones.
- Eliminación de posts: algunos usuarios publicaron dudas, pero fueron eliminados por el autor, obligándolos a publicar de nuevo sus pruebas; el autor nunca reveló el entorno de evaluación, el proceso ni los resultados de los ejemplos, lo que solo empeoró la situación.
3. ¿En qué radica el engaño? En el aprovechamiento de una debilidad de DeepSeek V4 Pro?
J-Space logró engañar a la gente porque identificó un problema real: DeepSeek V4 Pro es muy sensible al entorno de ejecución. Por ejemplo, con sugerencias similares para probar juegos 3D, los resultados iniciales pueden ser rudimentarios, pero después de algunas horas se genera un proyecto completo; el mismo modelo puede obtener puntajes muy diferentes en modos de ejecución diferentes (Standard/PTC/Minimal).
Todos ya sospechaban que ajustar el entorno de ejecución podía mejorar el rendimiento, por lo que las afirmaciones de J-Space parecían plausibles.
4. Una lección para el mundo del AI: los aumentos de rendimiento no verificados son fraudulentos
Esta farsa sirve como una lección para la comunidad del AI: cualquier mejora en el rendimiento debe poder ser reproducida por otros para que sea considerada válida. Al igual que los resultados financieros de las empresas necesitan ser auditados, los logros del AI también deben hacerse públicos (entorno de evaluación, proceso, ejemplos) para que todos puedan verificarlos. Por más impresionantes que sean los resultados de J-Space, sin pruebas que los respalden, no son más que castillos en el aire. La próxima vez que vean afirmaciones exageradas sobre el rendimiento del AI, pregúntense: “¿Pueden ser reproducidos? ¿Hay evidencia pública?”.
5. El enfoque técnico en sí: los problemas son reales, pero la solución puede no ser efectiva
Cabe destacar que los cuatro problemas señalados por J-Space (sobrecarga de información, desviación en la memoria, etc.) son reales y muchos equipos están trabajando para resolverlos. Por ejemplo, el Routing Suite selecciona el modo de razonamiento adecuado según la tarea, mientras que Anchored Standard utiliza sugerencias breves para estabilizar el comportamiento del modelo. Sin embargo, la solución propuesta por J-Space no solo fue ineficaz, sino que también resultó ser un ejemplo de fraude.
En resumen, la innovación en el mundo del AI necesita avances técnicos reales, no fraudes o el aprovechamiento de debilidades para generar tráfico. Este incidente también nos ha hecho más conscientes de la necesidad de mantenernos alerta ante resultados exagerados y de utilizar la reproducibilidad como criterio para evaluar los verdaderos avances en el campo del AI.