wagner
ENTodos los recursos

Respuesta a incidentes Guía práctica

Una primera respuesta más clara cuando producción está en riesgo

Define responsables, reúne evidencia y coordina la recuperación sin perder el contexto del incidente.

Cuando producción pierde estabilidad, varias personas pueden empezar a investigar al mismo tiempo sin que el equipo llegue a tener una visión compartida del problema. Una respuesta útil construye esa visión desde el principio mientras avanza la recuperación.

Prepara estos hábitos antes del próximo incidente. Es más fácil aplicarlos cuando el equipo los ha acordado con anticipación.

Define el impacto y los responsables

Describe qué no pueden hacer los usuarios, qué servicios están afectados y cuándo se observó el problema por primera vez. Distingue las observaciones confirmadas de las posibles explicaciones.

Designa a la persona que coordina la respuesta. Deja claro quién investiga, quién puede aprobar cambios y quién mantiene informadas a las partes interesadas. En un equipo pequeño, una persona puede asumir varios roles, pero las responsabilidades deben ser explícitas.

Mantén un registro compartido

Usa un lugar común para la cronología del incidente. Registra las observaciones, decisiones, cambios y resultados a medida que avanza la respuesta.

Una persona que se incorpora a la respuesta debe poder entender el estado actual sin interrumpir a quienes ya están trabajando. Enlaza la evidencia para que el registro sea verificable.

Evalúa cada cambio de recuperación

Para cada acción propuesta, indica qué se espera cambiar, quién la ejecutará y cómo se comprobará el resultado. Considera su efecto sobre los datos y los servicios dependientes.

Registra las acciones que no funcionan y las que sí. Esa información ayuda al equipo a evitar trabajo repetido y mantiene la investigación basada en evidencia.

Comunica lo que se sabe

Las actualizaciones deben describir el impacto, las acciones en curso y cuándo llegará la siguiente actualización. Evita prometer una hora de recuperación antes de tener evidencia que la respalde.

Mantén los detalles de la investigación técnica en el registro del incidente y dale a cada audiencia la información que necesita para actuar.

Cierra con seguimiento

Después de recuperar el servicio, verifica los flujos de usuario afectados y acuerda cómo seguir observando el sistema. Revisa la cronología para identificar cambios que podrían prevenir una repetición o facilitar la próxima respuesta.

Asigna responsables al trabajo de seguimiento. Una revisión se vuelve útil cuando sus acciones llegan a la lista de trabajo y se completan.

Para seguir leyendo

La guía de Google SRE para gestionar incidentes explica los roles de una respuesta coordinada, la comunicación y el mantenimiento de un registro durante un incidente. El recurso enlazado está en inglés.