Salesforce tarda horas en recuperar sus instancias tras una caída global
La caída afectó a cientos de instancias en varios países, arrancó a las 08:30 UTC y no se dio por resuelta hasta las 19:20 UTC, con reinicios manuales por el camino.
Salesforce sufrió este miércoles una caída que se prolongó durante horas y afectó a cientos de instancias repartidas entre Estados Unidos, Japón, India, Reino Unido, Francia y Alemania. El primer aviso se publicó a las 09:30 BST (08:30 UTC) y la empresa no dio el incidente por cerrado hasta las 20:20 BST (19:20 UTC). Los clientes se encontraron con retrasos severos, errores intermitentes y servicios inaccesibles, incluida la creación de casos de soporte.
Un login interno sin recursos
La primera explicación técnica llegó a las 10:10 BST. Según la compañía, las peticiones se quedaban bloqueadas esperando la respuesta de un servicio interno de autenticación que estaba consumiendo los recursos de servidor disponibles. Una hora después hablaba de una carga elevada sobre un componente central del sistema que limitaba su capacidad para procesar peticiones.
El arreglo se validó en una instancia de prueba al mediodía y se desplegó en teoría sobre toda la flota a las 12:27 BST. La cosa no salió como estaba previsto. A las 14:29 BST la empresa admitía que el despliegue no había terminado bien en algunas instancias y que los clientes seguían expuestos al problema original, así que tocaba reaplicar el parche. Avisó además de que algunos usuarios tendrían que limpiar datos en caché o reiniciar sesión para recuperar el servicio.
A partir de ahí el relato fue estrechándose. Salesforce dijo que el alcance real era menor de lo que pensaba al principio y redujo el problema a un subconjunto de instancias de Hyperforce, con sus entornos propios fuera del impacto. Donde el arreglo automático no llegó, hubo reinicios manuales y recuperación a mano. A las 15:00 BST seguía recibiendo avisos de tareas programadas que no se ejecutaban como debían en clientes que ya tenían acceso.
Dreamforce, de fondo
El incidente pilló a la compañía en plena celebración de Dreamforce en San Francisco, que arrancó el día anterior con más de 40.000 asistentes presenciales previstos y más de 200.000 inscritos para seguir el evento en línea. En su lista de clientes hay nombres como Amazon, Walmart, Coca-Cola, Toyota e IBM.
Salesforce fue publicando el detalle en su página de estado, que se convirtió en el único canal con información para los afectados.
Falta la causa raíz, que la empresa no ha detallado, y saber cuántas instancias quedaron cojas y qué ha pasado con las tareas programadas que no llegaron a ejecutarse. Para quien opera sobre Salesforce, el aviso práctico es que un fallo en un servicio interno de autenticación tumba bastante más que el login, y que las integraciones batch pueden quedar descolgadas sin que el usuario note nada raro al entrar.

