BookinglyTech News
Inteligencia artificial

Gemini 3.8 Flash apunta a agentes que no abandonan la tarea

El nuevo modelo de Google mantiene el contexto de un millón de tokens y sube en DeepSWE al 73,7%, enfocándose en tareas de agente complejas.

2 min de lecturaDev.to0 vistas

Gemini 3.8 Flash, la nueva versión de la familia ligera de Google, no cambia mucho la ficha técnica respecto a su predecesor, pero introduce un cambio de comportamiento que puede hacerla valiosa en flujos de trabajo con agentes. Mantiene la ventana de contexto de 1.048.576 tokens de entrada y 65.536 de salida que ya tenía Gemini 3.7 Flash, y en lugar de ampliarla, Google ha concentrado los esfuerzos en que el modelo persista en tareas complicadas.

En el benchmark DeepSWE v1.1, que evalúa la capacidad de resolver tareas de programación reales, Google reporta un 73,7% de éxito para 3.8 Flash, frente al 65,3% de 3.7 Flash. Ese salto de más de ocho puntos es especialmente relevante para quienes usan agentes de código, donde el modelo debe inspeccionar varios archivos, hacer un cambio, ejecutar las pruebas, leer el error y reintentar con otra estrategia.

Un multiusos con más herramientas

Gemini 3.8 Flash no solo procesa texto; acepta imágenes, vídeo, audio y PDFs, y viene con herramientas como function calling, code execution, búsqueda y salida estructurada. Esto lo convierte en una opción para tareas que mezclan distintas fuentes, como un agente de soporte que recibe una captura de pantalla, una llamada grabada y un PDF, y tiene que combinar todo para resolver una incidencia.

Pero esa persistencia extra se paga en tokens y en latencia. Para tareas simples, como extraer unos pocos campos de un documento, no tiene sentido cambiar a 3.8 si 3.7 ya las resuelve sin errores. El consejo de quienes lo están evaluando es no sustituir 3.7 en todos lados, sino usarlo como una capa intermedia: peticiones rutinarias a los modelos más baratos y rápidos, peticiones complejas o fallidas a 3.8, y reservar el modelo premium solo para lo que aun así no se resuelve.

Un esquema de precios que invita a probar

Aunque Google no ha publicado precios oficiales en esta fase, el modelo se sitúa en un punto que permite plantear el enrutamiento por coste por tarea completada, no por millón de tokens. Si 3.8 consume más tokens pero evita un reintento, el gasto extra puede quedar justificado. Para eso, conviene probarlo con cargas reales y observar cómo se comporta cuando el contexto crece; un contexto de un millón de tokens no debería sustituir a una buena arquitectura de recuperación.

En definitiva, Gemini 3.8 Flash redefine lo que significa "Flash" en el catálogo de Google: ya no es solo el modelo barato y rápido para consultas sencillas, sino un candidato para tareas de agente que antes necesitaban del nivel premium.

Gemini 3.8 Flash: agentes que no se rinden · Bookingly