ChatGPT comete errores sistemáticos al analizar tres conjuntos de datos pequeños
Un experimento con GPT‑5.6 muestra que el modelo confunde métricas y genera cifras inexistentes, lo que pone en riesgo decisiones ejecutivas.

Se ejecutó una prueba sencilla: tres datasets de menos de 100 filas, un modelo de IA (GPT‑5.6 Terra para la pasada rápida y GPT‑5.6 Luna para ejecuciones más pausadas) y tres preguntas típicas de un equipo de negocio – tiempo medio de entrega, región con mejor desempeño y número de atletas en un archivo. Después se añadió una fase de revisión donde el modelo recibió sus propias respuestas y se le indicó que los números terminarían en una presentación ejecutiva.
Errores de métrica
En el dataset shipment_tracking se pidió el tiempo medio “order‑to‑door”. El modelo calculó el intervalo shipped_date – delivered_date y devolvió 2,6 días, cuando el cálculo correcto usando ordered_date – delivered_date da 6,09 días. La diferencia es de 2,4 veces y proviene de una confusión de columnas, no de un bug de código. Como la operación de pandas es válida, ninguna prueba automática lo detecta; solo la revisión manual del enunciado y de los nombres de columnas permite identificar la equivocación.
Cifras inventadas
En la misma tabla, la respuesta incluye la frase “Only 22 of 50 orders have delivery dates yet (28 still in transit)”. El dataset tiene 40 filas, con 22 entregas y 18 pendientes, por lo que los valores 50 y 28 aparecen de la nada. La inconsistencia pasa desapercibida porque 50‑22 = 28, lo que le da una apariencia interna coherente.
En regional_sales el modelo indica que la región APAC vende 3,68 M $ (32 % del total) y la suma real de ventas para APAC es 3 675,49 en la unidad del archivo, con una participación del 30,4 %. De nuevo, la cifra inflada no proviene de ningún cálculo mostrado.
Duplicados y datos inconsistentes
El tercer dataset, olympics_athletes_events, contiene filas duplicadas y combinaciones de región‑año con valores conflictivos (por ejemplo, APAC 2015 aparece con 173,46 y 126,78). El modelo no advierte de estas ambigüedades, lo que puede llevar a conclusiones erróneas sobre tendencias regionales.
Qué implica para los equipos
Los fallos no son errores de sintaxis sino de interpretación de la pregunta y de generación de texto. En entornos donde los resultados alimentan decks ejecutivos, una revisión humana sigue siendo indispensable. Además, los prompts deben incluir verificaciones explícitas de los campos usados y de la consistencia de los totales reportados.
En resumen, aunque los modelos de gran escala pueden acelerar el análisis preliminar, su tendencia a mezclar métricas y a inventar números exige una capa de control de calidad antes de confiar en sus conclusiones para decisiones críticas.


