GPT-6 Sol, Astra y Opus 5.5 se miden creando pantallas sin prototipo ni diseño previo
Un desarrollador pide a tres modelos la misma aplicación web desde cero y compara qué decide cada uno que debe ver el usuario. La diferencia no está en el código, sino en el orden de la pantalla.

Tres modelos, tres aplicaciones web cada uno, cero prototipos. GPT-6 Sol, GPT-6 Astra y Claude Opus 5.5 recibieron los mismos encargos en inglés partiendo de un React con TypeScript y Vite sin sistema de diseño, sin búsqueda web, sin referencias externas y sin imágenes generadas. El autor del experimento buscaba algo que ninguna comprobación de compilación responde: qué decide cada modelo que el usuario tiene que ver primero.
Los ajustes no se igualaron. Astra corrió en esfuerzo medio, Sol en xhigh y Opus 5.5 en alto, que es lo que el autor usaría si delegara el trabajo de verdad. Los tres encargos eran un mostrador de excepciones de reparto, una guía de conciertos llamada NIGHT LOOP y una app de inspección de almacén para un terminal Android pequeño. En el caso de almacén, todos recibieron los mismos tres pedidos y la misma API, con sus respuestas lentas, sus fallos de conexión y las ediciones simultáneas de otro operario.
Quién pone la decisión por delante
En el mostrador de reparto, Astra y Sol colocan un encabezado, texto introductorio y tarjetas de resumen antes de la lista de casos. Opus agrupa los casos por día de vencimiento y su primera pantalla de móvil ya enseña el principio de la cola, con la urgencia metida en la propia lista. Los dos primeros diseños informan al operario sobre el mostrador; el tercero le ayuda a decidir qué caso abrir.
La ventaja de Opus es más clara en el móvil que en el escritorio, donde deja buena parte del área de detalle vacía hasta que se selecciona un caso. En móvil convierte el caso elegido en pantalla propia con la acción de volver arriba; Sol mantiene el mobiliario de la página sobre el detalle y su botón de volver queda mucho más abajo. Sol separa las notas de los cambios de estado y marca el motivo como obligatorio. Opus usa botones grandes de estado, señala el actual y adapta la acción de guardar a lo que se ha elegido: hace la opción fácil de leer, mientras que Sol hace el requisito difícil de ignorar. El pero es que sitúa la acción antes de casi todo el historial del caso, lo que puede costar contexto a quien revisa respuestas anteriores.
El escaparate que estorba
NIGHT LOOP es el único encargo donde el autor prefiere la dirección visual de Astra, con ilustraciones de línea sobre fondos apagados, frente al póster amarillo ácido de Sol y al degradado de neón de Opus. Pero el visitante venía a encontrar un concierto. Astra y Sol gastan casi toda la primera pantalla del móvil en el tratamiento del evento; Opus mete horas, escenarios y varios artistas en el encuadre.
En la pantalla de plan guardado la distancia se agranda. Astra y Sol repiten el bloque grande y empujan hacia abajo los sets guardados y los solapamientos. Opus abre directamente en el plan, describe el cruce de horarios y ofrece opciones concretas: quedarse con uno de los dos sets o repartir el tiempo. Astra y Sol llegaron incluso a un titular casi idéntico para la guía, lo que al autor le bastó para no equiparar un póster contundente con un concepto original.
En el almacén, Opus pone el primer pedido cerca de arriba y prescinde de buscador y filtros de estado que sí incluyen las dos variantes de GPT-6: con tres pedidos de prueba la lista corta queda elegante, pero con cientos de trabajos diarios encontrar uno concreto pasa a ser parte del trabajo. El problema serio sale con las ediciones de otro operario. En un pedido, alguien registra una linterna mientras el terminal escanea otra. Astra enseña el recuento del servidor junto al cambio local, pero pausa el escaneo durante la revisión y obliga a repetirlo. Sol pide revisar el conflicto y retiene los escaneos nuevos hasta que el operario decide. Opus da las dos lecturas por una sola unidad registrada y vuelve al estado guardado sin preguntar.
El experimento son tres encargos y un solo observador, así que no vale como ranking. Lo útil para quien delega es otra cosa: la jerarquía de la información y la gestión de conflictos separan a estos modelos mucho más que el acabado visual, y eso no se ve hasta que no hay prototipo que copiar.

