BookinglyTech News
Inteligencia artificial

DeepSeek jubila su modelo Pro y manda todas las peticiones al Flash

Desde el 14 de septiembre, cada llamada a deepseek-v4-pro se atiende con V4.1-Flash hasta que llegue V4.1-Pro. La compañía admite que el modelo barato gana en capacidad, coste y latencia.

3 min de lecturaDev.to0 vistas

DeepSeek ha dejado de servir su modelo insignia. Desde el 14 de septiembre, toda petición dirigida a deepseek-v4-pro se redirige a V4.1-Flash y seguirá así hasta que aparezca un V4.1-Pro que aún no tiene fecha. La compañía lo dice sin rodeos en el anuncio: está «retirando paulatinamente el V4-Pro». El motivo, según su versión, es que las pruebas de terceros sitúan al Flash por delante en capacidad, coste, velocidad y tiempo total de respuesta.

Los números no son un empate técnico. En las pruebas que cita la documentación del modelo:

  • Terminal-Bench 2.1: 90,6 frente a 87,9
  • Terminal-Bench 4.0: 31,2 frente a 12,4
  • DeepSWE v1.1: 74,2 frente a 62,7
  • AutomationBench: 54,8 frente a 43,2
  • CyberGym: 88,1 frente a 83,3

El 90,6 de Terminal-Bench 2.1 no gana solo en casa: queda por encima del 89,1 de Claude Opus 5 y del 88,8 de GPT-5.6 Sol. Y Opus 5 no es una generación antigua, así que la comparación no es contra un modelo descatalogado.

Donde el Flash retrocede

La misma tabla tiene otra lectura. V4.1-Flash baja en todo lo que sea conocimiento factual: GPQA Diamond 90,9 frente a 92,4, HLE sin herramientas 39,1 frente a 42,7 y SimpleQA-Verified 42,3 frente a 55,2. Mejora ejecutando tareas y empeora respondiendo qué es una cosa. Los titulares se los llevó la parte agéntica, que es la que sube.

Los tres laboratorios chinos no están jugando la misma partida. Z.ai mantiene el par completo: GLM-5.3 con 753.000 millones de parámetros y GLM-5.3-Flash con 320.000, presentados el mismo día, con la versión pequeña usando tres veces menos cómputo de atención y una caché KV 4,4 veces menor. DeepSeek va a una sola carta. Y Moonshot no tiene carta pequeña: Kimi K3 son 2,8 billones de parámetros y su alternativa económica es K2.7 Code, otro modelo distinto.

Los precios por millón de tokens de entrada y salida dejan ver el reparto: GLM-5.3-Flash 0,15 y 0,50 dólares; DeepSeek V4.1 Flash 0,30 y 1,20; GLM-5.3 1,40 y 4,40; Kimi K3 3,00 y 15,00. Según el índice de Artificial Analysis, el coste por tarea va de 0,25 a 2,00 dólares, ocho veces más entre extremos, y eso que las puntuaciones globales difieren en cinco puntos. Ojo con la versión del índice: GLM-5.3-Flash marcaba 57 en la 4.1.1 y 42 en la 4.3 sin que el modelo cambiara.

Hay además dos costes escondidos. El modo de razonamiento de GLM-5.3 y Kimi K3 va siempre activo y no se puede apagar; Kimi K3 lo trae por defecto en el nivel más alto, así que cada petición genera tokens de pensamiento que se facturan. Y Kimi K3 exige devolver el mensaje del asistente completo, razonamiento y llamadas a herramientas incluidas, en conversaciones de varios turnos; si el cliente solo guarda el texto, el modelo responde peor sin avisar.

Lo que importa para quien opera esto: redirigir peticiones a otro modelo rompe el comportamiento de cualquier sistema que siga apuntando al nombre antiguo. Hay que fijar la versión en la configuración y repetir las pruebas antes de producción. La caché de DeepSeek, a 0,006 dólares por millón de tokens, es cincuenta veces más barata que el precio de lista y cambia la cuenta en cargas con contexto repetido. Queda por ver si Moonshot saca una versión reducida de K3.