BookinglyTech News
Inteligencia artificial

Nuevo prompt JSON de 13 campos para describir imágenes con Ling‑3.0‑flash‑VL

El prompt permite extraer una descripción visual estructurada, separando texto, luz y texturas en campos editables.

1 min de lecturar/PromptEngineering0 vistas

OpenRouter ejecuta Ling‑3.0‑flash‑VL sobre una foto de un gato junto al frigorífico y genera un objeto JSON con trece claves. Cada clave recoge un aspecto concreto de la imagen: tipo de medio, sujeto, acción, ubicación, composición, iluminación, paleta de colores, materiales y texturas, cámara y foco, texto y tipografía, estilo, ambiente y exclusiones. El modelo devuelve descripciones en frases naturales y usa null cuando la información no está presente.

En el caso del gato, la relación de luz cálida y fría se asigna a lighting, mientras que la forma en que el pelaje refleja esa luz queda en materials_and_textures. La palabra «MILK» que aparece en la puerta del frigorífico se coloca en text_and_typography como transcripción literal. Esta separación permite editar cada componente por separado: cambiar la composición sin tocar la paleta, o sustituir el texto sin rehacer la descripción completa.

El prompt está pensado para ser reutilizable: basta con sustituir la imagen y el modelo rellenará los trece campos con la información visible. Es útil para equipos que crean briefs visuales, generan variantes de diseños o alimentan pipelines de generación de contenido donde se necesita un control fino sobre cada elemento de la referencia.