Cómo usar ClickHouse hot/cold storage en Plausible CE para 10 M+ visitas mensuales
Usuarios de Plausible CE están probando políticas de almacenamiento en ClickHouse que separan datos recientes en NVMe y datos históricos en discos más lentos sin perder capacidad de consulta.
Una comunidad de admins de self‑hosted está experimentando con Plausible CE para soportar más de 10 millones de pageviews al mes. El objetivo es mantener los datos de análisis indefinidamente, pero evitar que años de registros poco consultados ocupen NVMe caro. La propuesta consiste en dos capas:
- NVMe local: datos de los últimos 0‑12 meses, accesibles con latencia mínima.
- Almacenamiento más barato: datos más antiguos, migrados automáticamente mediante una política de ClickHouse que mueve bloques a un volumen de disco más lento.
Los usuarios que ya han implementado esta arquitectura se centran en los tables events_v2 y sessions_v2. Preguntan por tres aspectos críticos:
- Tipo de almacenamiento frío: la mayoría ha optado por discos SATA de alta capacidad o incluso por volúmenes en S3 compatibles con ClickHouse (por ejemplo,
S3oAzure Blob). Estos back‑ends ofrecen buen coste‑beneficio y siguen siendo consultables, aunque con mayor latencia. - Políticas de TTL y migración: se usan
ALTER TABLE … MODIFY SETTING storage_policy = 'cold'junto conTTLque traslada bloques después de 12 meses. En pruebas internas no se han detectado problemas al actualizar Plausible, siempre que la política sea aplicada antes de la migración de versiones. - Compatibilidad con Plausible: la aplicación asume que las tablas usan la política por defecto, pero no depende de ella para su lógica de negocio. Cambiar la política solo afecta al motor de ClickHouse, por lo que Plausible sigue operando sin modificaciones.
Los administradores que gestionan instancias grandes de Plausible suelen combinar replicación de ClickHouse con la estrategia hot/cold. Replican los datos recientes en un clúster de alta disponibilidad y, una vez que los bloques se trasladan al tier frío, pueden desactivar la replicación para ese segmento, reduciendo la carga de red y almacenamiento.
Fuera de Plausible, la práctica de hot/cold storage en ClickHouse ya está consolidada en entornos de big data. Los patrones habituales incluyen:
- Discos NVMe para hot shards y HDD SATA o S3 para cold shards.
- Políticas de movimiento basadas en
MOVE PARTITIONoTTL MOVE TO VOLUME. - Monitoreo de latencia para ajustar el umbral de movimiento (12 meses es un punto de partida, pero algunos usuarios lo reducen a 6 meses según la carga de consultas.
En resumen, la separación de capas permite escalar Plausible CE sin incurrir en costes de NVMe desproporcionados, siempre que se mantenga una política de movimiento coherente y se pruebe la compatibilidad tras cada actualización de la plataforma.
Para profundizar en la discusión original y ver ejemplos de configuraciones, consulte el hilo en GitHub.
Qué queda por ver: la comunidad todavía necesita pruebas de rendimiento a largo plazo y guías oficiales de Plausible sobre políticas de almacenamiento personalizadas. La integración de herramientas de observabilidad (por ejemplo, Grafana) para alertar sobre bloqueos de migración también sería un buen complemento.
