Cognition lanza SWE-2, a un punto de Fable 5.1 y un 64% más barato
Cognition presenta SWE-2, post-entrenado sobre Kimi K3, que roza a Fable 5.1 en FrontierCode con un 64% menos de coste y se despliega ya en Devin.

Cognition ha presentado SWE-2, su modelo de codificación más capaz hasta la fecha. La compañía afirma que alcanza el 50,0% en FrontierCode 1.1 Main, a un solo punto de Fable 5.1 y con un 64% menos de coste, y que para lograrlo ha escalado el aprendizaje por refuerzo a un régimen de varios billones de parámetros por primera vez.
El modelo parte de Kimi K3, una base de 2,8 billones de parámetros que ya había pasado por un RL intenso orientado a codificación agéntica. Sobre ella, Cognition aplica la receta de post-entrenamiento heredada de SWE-1.7 y añade un algoritmo que entrena todos los niveles de esfuerzo de razonamiento en una sola pasada. El resultado, siempre según la empresa, mueve la frontera de coste-rendimiento de K3 entre 5 y 6 puntos en varias pruebas.
Los números
En FrontierCode 1.1 Main, SWE-2 marca 50,0%, por delante de Grok 4.6 (48,0%), GPT-5.6 Sol (47,5%) y su predecesor SWE-1.7 (42,0%), y a menos de un punto de Fable 5.1. En DeepSWE 1.1 sube a 73,0% y supera a Sol (72,7%) y a Fable 5.1 (67,4%). En Terminal-Bench 2.1 firma 92,8%, el mejor de la tabla.
Hay una prueba donde el modelo se cae: Terminal-Bench 4, con 27,3%, frente al 55,8% de Fable 5.1 y el 57,9% de GPT-6 Astra. Cognition no explica ese hueco, y conviene recordar que todas las cifras salen de su propio blog, no de una evaluación independiente.
Eficiencia y entrenamiento
En FrontierCode 1.1 Main, SWE-2 en nivel medium puntúa por encima de SWE-1.7 usando un 58% menos de turnos y costando un 81% menos de media. La primera edición real del código llega en 18 pasos de mediana, frente a 48 en el modelo anterior. La ganancia viene de una exploración más enfocada: el modelo juzga mejor qué partes del repositorio importan y deja de dar vueltas. Los niveles high y max sí exploran más y rinden mejor en tareas complejas.
En el plano técnico, Cognition aplica penalizaciones de coste lineales por nivel de esfuerzo, ajustadas a la pendiente local de la frontera de Pareto de la base. También mantiene el baseline de recompensa ponderado por longitud, triplica el número de entornos de RL y usa kernels NVFP4/FP8 con entrenamiento consciente de cuantización para reducir memoria y desajuste entre entrenamiento e inferencia, pese a trabajar con un modelo base casi tres veces mayor.
SWE-2 está disponible desde hoy en Devin Desktop y CLI, y se está desplegando en Devin Web y Fusion.
El interés de la pieza está en dónde se coloca el listón. Un modelo post-entrenado sobre una base que no es suya se acerca a los propietarios punteros con una fracción del coste, que es justo lo que buscan los equipos que meten agentes de código en su pipeline. Lo que falta por ver es si ese 27,3% en Terminal-Bench 4 se queda ahí: en tareas de horizonte largo la distancia con Fable 5.1 y GPT-6 Astra sigue siendo de más del doble.

