BookinglyTech News
Inteligencia artificial

Cloudflare tiene un juez de texto calibrado en Workers AI: dónde encaja y dónde no

El juez estructurado typesafe/jev, en Workers AI, devuelve probabilidades calibradas sobre texto y JSON, no sobre píxeles: usarlo en un pipeline de visión sale caro y no aporta.

3 min de lecturar/PromptEngineering0 vistas

Cloudflare tiene en Workers AI un modelo llamado typesafe/jev que no genera texto ni imágenes: es un juez estructurado. Le pasas un único estado (una cadena o un objeto JSON, con 32k tokens de contexto) y un conjunto de preguntas tipadas, y devuelve respuestas con probabilidad calibrada. Hay tres tipos: noul, para un sí o no con su probabilidad; choice, para elegir una opción entre varias con la probabilidad de cada una; y score, para situar algo en una escala ordinal.

Se factura por token y no acepta imagen ni vídeo en su esquema. Es un modelo de decisión y clasificación, no de percepción ni de geometría. Esa distinción decide dónde tiene sentido meterlo.

En visión, no

Un pipeline de reconstrucción se pasa el tiempo en el matching tipo SIFT, que es cuadrático en fotogramas × características, y en el entrenamiento sobre GPU. Jev no toca ninguna de las dos cosas: nunca ve píxeles, y un ida y vuelta de red hasta Cloudflare es órdenes de magnitud más lento que cualquier heurística local. La selección de fotogramas ya se resuelve con varianza laplaciana, y ahí un modelo de texto no tiene señal que aportar.

Queda el caso de elegir opciones del pipeline —modelo de cámara, modo de matching, umbral de inliers— a partir de estadísticas en JSON: imágenes registradas, error de reproyección, histograma de inliers, saltos de pose. Son reglas deterministas que se escriben directamente en el código. Detectar el cierre de bucle falso, esa discontinuidad de pose en una trayectoria que por lo demás es suave, y relanzar en modo secuencial es más rápido, gratis, offline y testeable que preguntárselo a un servicio externo.

Donde sí aporta

El uso con más recorrido es un filtro de moderación antes de gastar dinero. Una sola llamada con noul (¿infringe la política?), choice (categoría: sexual, menores, violencia, imagen de persona real) y score (gravedad) da probabilidades sobre las que poner umbrales: bloquear por encima de 0,9, marcar para revisión en una banda intermedia, dejar pasar por debajo. Evita pagar trabajos que el proveedor va a rechazar de todas formas y deja rastro para auditar. Encaja en la creación del trabajo o en el worker.

También sirve para enrutar prompts: clasificar si la petición es de imagen, vídeo, música o voz, comprobar si ya sigue una estructura de storyboard temporizado o de ficha de referencia, detectar el idioma y sugerir la guía o el modelo adecuado. Y como juez barato de calidad sobre la salida de un enhance, para ver si respetó la intención o si añadió contenido que nadie pidió.

La clasificación de errores del proveedor en reintentables, terminales, rechazos de contenido o cuota es posible, pero el valor es marginal: unas expresiones regulares hacen lo mismo sin red.

Los costes hay que mirarlos: cuenta de Cloudflare, facturación por token, una llamada HTTPS por trabajo (por debajo del segundo) y un modo de fallo nuevo, con la decisión de si falla en abierto o en cerrado. Los prompts salen del servidor a un tercero. Y calibrado no significa correcto: conviene registrar las probabilidades en el panel de administración y mantener los umbrales ajustables.

De todo lo anterior, el filtro de moderación es lo que más devuelve con menos esfuerzo. Lo demás es decidir si compensa cargar con una dependencia externa más.