BookinglyTech News
Infraestructura

Dropbox convierte Riviera en plataforma de procesado de contenido para IA

El servicio que generaba previsualizaciones cubre ahora más de 300 formatos y 100 transformaciones, y parte de sus APIs ya están abiertas a desarrolladores.

3 min de lecturaInfoQ0 vistas

Dropbox ha convertido Riviera, el servicio interno que generaba previsualizaciones de archivos, en una plataforma de procesado de contenido que cubre más de 300 formatos y más de 100 transformaciones distintas, y que ejecuta cientos de miles de transformaciones por segundo. La compañía ya la usa para alimentar sus cargas de IA y ha empezado a exponer parte de esas capacidades mediante APIs públicas.

Riviera nació como un servicio interno para previsualizar los formatos que Dropbox soportaba. En lugar de montar un servicio de procesado para cada combinación de formato y salida, los ingenieros descompusieron el trabajo en transformaciones reutilizables. Una previsualización de PowerPoint, por ejemplo, se genera convirtiendo la presentación a PDF y luego cada página del PDF a imagen. Esas piezas se encadenan después en otros pipelines.

Orquestación por un lado, ejecución por otro

La arquitectura separa ambas cosas. Un componente central valida las peticiones, compone el pipeline de transformaciones, reparte el trabajo a los workers y gestiona la caché. Cada worker implementa una capacidad concreta, y un modelo de plugins permite añadir capacidades nuevas sin tocar la capa de orquestación.

Riviera ya se usaba para IA antes de esta expansión. Dropbox describió en su momento cadenas de transformaciones para convertir contenido en texto y embeddings destinados a resúmenes y respuesta de preguntas. Entonces hablaba de unos 300 tipos de archivo, alrededor de 2.500 millones de peticiones diarias y cerca de un exabyte de datos, con resultados intermedios en caché que varias operaciones de IA reaprovechaban. Las cifras son de Dropbox, no de un tercero que las haya medido por su cuenta.

La plataforma sostiene Search, Replay, Sign y Dash. Dash añadió requisitos propios, porque su búsqueda y sus funciones de IA procesan contenido tanto de Dropbox como de servicios conectados. Riviera extrae y normaliza ese material antes de indexarlo, así que Dash reutiliza el pipeline que ya existía.

APIs públicas y ecosistema

La compañía ha expuesto capacidades de Riviera en su documentación para desarrolladores: endpoints asíncronos para convertir documentos a Markdown, transcribir audio y vídeo y extraer metadatos estructurados. La API de Markdown apunta a indexado, renderizado y envío de documentos como entrada a modelos de lenguaje. La aplicación lanza un job y consulta el estado con un identificador, con estados de éxito y fallo separados.

Fuera de Dropbox también empieza a moverse. Un desarrollador publicó conductor-dropbox, una integración open source para Conductor OSS y Orkes que añade extracción asíncrona de Markdown de Riviera para flujos de documentos y RAG.

La comparación inevitable es con Apache Tika, que ofrece APIs para detectar, parsear y extraer texto y metadatos de muchos formatos. Riviera añade a eso la composición de pipelines, la ejecución asíncrona, la caché y una orquestación centralizada.

Lo interesante para quien opera sistemas es el patrón: una plataforma construida para un caso concreto acaba siendo la base sobre la que se montan las funciones de IA sin reescribir nada. Queda por ver hasta dónde llega la apertura de las APIs y si el modelo de plugins atrae transformaciones de terceros desde fuera de la casa.