DeepSeek lanza V4.1-Flash: 763B parámetros, visión nativa y licencia MIT
El nuevo modelo open-weight de DeepSeek retira el V4 Pro y estrena una arquitectura encoder-decoder causal con prefill de 8B y decode de 16B, contexto de un millón de tokens y entrada de imagen.

DeepSeek ha publicado V4.1-Flash, un modelo open-weight que jubila al V4 Pro y abre una familia de arquitectura nueva: encoder-decoder causal, con visión nativa desde el primer día. El nombre engaña, porque no es un incremento de 0,1 sobre nada anterior, sino un rediseño con prefill y decode separados. Los números que acompañan al lanzamiento son 763.000 millones de parámetros totales, de los cuales 8B se activan en la fase de entrada y 16B en la de salida, de ahí la notación 763B-P8B-D16B que usa la propia DeepSeek.
Un cambio de arquitectura, no una revisión
Separar prefill y decode deja una dispersión efectiva del 1 al 2%, y con trucos nuevos como Sliding-Window Attention Bounded Replay la huella de caché KV queda hasta en un octavo de la del V4 Flash. Eso es lo que mueve la aguja para agentes de ejecución larga: menos memoria, más velocidad y coste por token más bajo. El contexto llega al millón de tokens y la entrada admite texto e imagen sin esperar a un modelo aparte, algo que otros laboratorios han ido desacoplando. Todo bajo licencia MIT, con disponibilidad en API a través de DeepSeek y soporte de Baseten desde el día cero. El informe técnico está publicado y quien siguiera el trabajo previo sobre Engram, de abril de 2026, reconocerá buena parte del hilo.
Precio agresivo y buenas notas en índices de terceros
Artificial Analysis sitúa al modelo con 40 puntos en su índice de inteligencia, por debajo de GLM-5.3-Flash y por encima del último V4 Pro, siendo bastante más barato. El precio anunciado es 0,30 dólares por millón de tokens de entrada y 1,20 por millón de salida, con la entrada cacheada a 0,006 dólares y un 50% adicional de descuento fuera de las horas punta. Vals lo coloca como el primer modelo open-weight de su índice, por delante de Kimi K3, a 0,30 dólares por prueba, el más económico del top 10 abierto. Esa evaluación se hizo con el contexto completo de un millón de tokens, 384 tokens de salida como máximo, temperatura 1, top-p y top-k por defecto y esfuerzo de razonamiento alto.
Hay un detalle interesante en la parte de post-entrenamiento. DeepSeek, que suele ir por delante proponiendo algoritmos nuevos, sostiene ahora que el retorno de invertir en calidad de datos supera al de seguir inventando recetas de post-entrenamiento. Viniendo de quien viene, es un cambio de énfasis que dice bastante de dónde se está moviendo el coste real de mejorar un modelo.
Lo relevante para quien despliega esto no es el puesto en un ranking, sino la combinación de licencia MIT, contexto de un millón de tokens y una caché KV que encoge. Si el ahorro de memoria se confirma en producción, cambia el cálculo de cuántas instancias hacen falta para sostener un agente que arrastra contexto durante horas. Queda por ver si el soporte de terceros se extiende más allá de Baseten y si los proveedores cloud occidentales lo sirven con las mismas garantías que los modelos propietarios de siempre.

