Gravedad de incidentes: una matriz de escalado

·3 min de lectura

La gravedad describe impacto actual o creíble, no lo alarmante del texto de un log.

Dos torres de servidores unidas por una ruta interrumpida y otra de recuperación continua.

La gravedad describe impacto actual o creíble, no lo alarmante del texto de un log. Una matriz compartida moviliza a las personas adecuadas y mantiene defectos normales fuera del canal de emergencia. Use ejemplos propios y permita revisar la clasificación con nueva evidencia.

Valorar varias dimensiones

Considere clientes, recorridos críticos, dinero, datos, duración y alternativas. Pocos afectados pueden justificar urgencia si sus registros financieros se corrompen. Un panel interno ruidoso no siempre requiere despertar a todos. Documente incertidumbre y responda con prudencia cuando exista una consecuencia grave plausible.

Relacionar niveles con acciones

El nivel máximo puede cubrir fallo de una función vital o integridad gravemente amenazada. Un nivel medio puede representar degradación importante con alternativa limitada. Son ejemplos, no una norma universal. Añada notificación, autoridad y obligaciones contractuales. Distinga impacto de prioridad y del plazo de respuesta prometido.

Ajustar después del incidente

Asigne coordinación, técnica y comunicación para eventos mayores. Defina quién reclasifica y cómo contactar suplentes. Compare evaluación inicial e impacto final. Desacuerdos recurrentes señalan ejemplos o señales ausentes. Más niveles solo ayudan si producen respuestas distintas y la matriz sigue accesible durante una caída.

Un ejemplo y su aceptación

Una búsqueda caída y un saldo modificado incorrectamente pueden afectar al mismo número de clientes y requerir respuestas distintas. Pida a soporte, producto y técnica clasificarlos con justificación. Compruebe que la matriz activa responsables y acciones diferentes cuando corresponde. Si hechos iguales producen conclusiones incompatibles, faltan criterios o ejemplos. Ensaye además cómo comunicar una reclasificación sin perder decisiones previas. El resultado debe ser una guía utilizable durante presión, no una tabla que obliga a discutir el significado de cada nivel mientras aumenta el impacto.

Preguntas frecuentes

¿SEV1 siempre es el máximo?

Las convenciones varían; publique expresamente su orden.

¿Puede cambiar la gravedad?

Sí, con motivo y aviso a responsables afectados.

¿Toda alerta de seguridad es máxima?

Valore credibilidad e impacto posible según el proceso de seguridad.

¿Basta el número de clientes?

No. Integridad, dinero y funciones críticas pueden importar más.

¿Dónde guardar la matriz?

En un lugar accesible durante incidentes y enlazado desde alertas y procedimientos.

Convirtamos la idea en un alcance realizable

Comparta el recorrido del usuario, las integraciones y las condiciones del lanzamiento. Podemos preparar una estimación con supuestos y exclusiones.

Ver el alcance del servicio →

Para seguir leyendo

Rollback o hotfix durante un incidente de producción

Durante un incidente, elija la acción con mayor probabilidad de recuperar servicio con riesgo controlado.

Recuperación ante desastres: probar RTO y RPO

Un plan de recuperación es creíble cuando puede restaurarse un servicio utilizable.

Un runbook de producción para equipos pequeños

Un runbook ayuda a pasar de un síntoma específico a una decisión segura.