Un benchmark mide 9 modelos con límite de palabras: la regla no basta
Un autor publica en Kaggle una prueba con nueve LLM generando ganchos de 6 y 10 palabras. Cumplir el recuento es lo fácil; sonar natural, casi nadie.

Un desarrollador ha publicado en Kaggle un benchmark sobre una pregunta muy concreta: ¿aguanta un LLM un límite duro de palabras sin que el texto acabe sonando a alguien contando palabras mientras escribe? Probó nueve modelos generando ganchos de vídeo corto con topes de 6 y 10 palabras en cuatro nichos (cuidado del pelo, cuidado de la piel, fitness y finanzas personales). El resultado incómodo: respetar la regla es lo fácil; lo difícil es no sonar a que la estás respetando.
La medición era doble. Por un lado, una comprobación mecánica: el gancho tiene 6 palabras o menos, o no las tiene. Por otro, una rúbrica juzgada por otro modelo que valoraba si el texto suena natural, si abre curiosidad y si evita comentar las propias instrucciones. Los modelos: Claude Haiku 4.5, Claude Opus 5, Gemini 3.5 Flash Lite, Gemini 3.1 Pro Preview, GPT-5.4 Nano, Grok 4.20 en sus variantes con y sin razonamiento, y Qwen3Next Instruct y Thinking. Ocho de los nueve terminaron la evaluación. El código y las puntuaciones están en el cuaderno del benchmark, publicado en Kaggle.
Los dos ejes no se mueven juntos
Qwen3Next Instruct clavó el límite en todos los ganchos: 1,0 de adherencia. Y sacó 0,0 en naturalidad. Producía frases que cumplen el recuento y se leen como una instrucción obedecida. Claude Haiku 4.5 repite el patrón a menor escala: 0,875 de adherencia con 0,125 de naturalidad, la segunda peor. Gemini 3.1 Pro Preview fue el único que sacó 1,0 en las dos cosas, así que el compromiso no es inherente a la tarea; es difícil de acertar.
Claude Opus 5 fue al revés: la adherencia más baja entre los grandes (0,75) con una naturalidad de 0,75. Parece priorizar que la línea suene bien antes que contar palabras. GPT-5.4 Nano fue el peor en ambos ejes (0,375 y 0,25), el único donde lo pequeño y barato costó calidad y no solo estilo.
El par de Grok es el dato aislado más interesante. Los dos clavaron el límite (1,0), pero la variante con razonamiento subió la naturalidad a 0,625 frente a 0,25 de la que no razona. Para esta tarea, los tokens de razonamiento mejoraron cómo se cumplía la restricción sin coste en cumplimiento. Qwen3Next Thinking, en cambio, falló a mitad de la evaluación y no dejó salida utilizable: no todo Thinking es un reemplazo directo de su Instruct.
Cuatro de los ocho modelos que terminaron llegaron a 1,0 de adherencia. La naturalidad perfecta, casi nadie.
Por qué mirarlo aunque el caso sea pequeño
El escenario es marketing de vídeo corto, pero el problema es el de siempre cuando se pide a un modelo una salida con formato estricto: un JSON válido, un campo de longitud fija, una línea acotada. La adherencia se mide con una regla; la calidad de lo que queda dentro, no. Y el banco de pruebas es de una sola persona, con puntuaciones generadas por un modelo juez y sin los prompts ni los borradores descartados publicados. Las cifras son suyas, no de un tercero. El autor propone bajar el tope a 3 o 4 palabras para ver dónde se rompe la adherencia, y hacer que el juez puntúe también los borradores que el modelo rechazó.
