Gravidade de incidentes: uma matriz de escalamento

·3 min de leitura

A gravidade descreve impacto atual ou credível, não o dramatismo de uma mensagem de registo.

Duas torres de servidores ligadas por um percurso interrompido e uma via contínua de recuperação.

A gravidade descreve impacto atual ou credível, não o dramatismo de uma mensagem de registo. Uma matriz partilhada mobiliza as pessoas certas e mantém defeitos normais fora do canal de emergência. Use exemplos próprios e permita rever a classificação com novas provas.

Avaliar várias dimensões

Considere clientes, percursos críticos, dinheiro, dados, duração e alternativas. Poucos afetados podem justificar urgência se os registos financeiros forem corrompidos. Um painel interno ruidoso nem sempre exige acordar toda a equipa. Documente incerteza e responda prudentemente quando existe consequência grave plausível.

Associar níveis a ações

O nível máximo pode cobrir falha de função vital ou integridade seriamente ameaçada. Um intermédio pode representar degradação importante com alternativa limitada. São exemplos, não norma universal. Acrescente notificação, autoridade e obrigações contratuais. Distinga impacto de prioridade e do prazo de resposta prometido.

Ajustar depois do incidente

Atribua coordenação, técnica e comunicação para eventos maiores. Defina quem reclassifica e como contactar suplentes. Compare avaliação inicial e impacto final. Desacordos repetidos mostram exemplos ou sinais ausentes. Mais níveis só ajudam se gerarem respostas distintas e se a matriz continuar acessível durante uma falha.

Um exemplo para validar

Uma pesquisa indisponível e um saldo alterado incorretamente podem afetar o mesmo número de clientes e exigir respostas diferentes. Peça ao apoio, produto e engenharia classificação com justificação. Confirme que a matriz aciona responsáveis e ações adequados. Se factos iguais produzem conclusões incompatíveis, faltam critérios ou exemplos. Ensaie também comunicar nova classificação sem perder decisões anteriores. O resultado deve ser utilizável sob pressão, não uma tabela que exige discutir cada nível enquanto o impacto cresce e pessoas importantes continuam sem saber que devem intervir.

Perguntas frequentes

SEV1 é sempre o máximo?

As convenções variam; publique a ordem explicitamente.

A gravidade pode mudar?

Sim, com motivo e aviso aos responsáveis afetados.

Todo o alerta de segurança é máximo?

Avalie credibilidade e impacto possível segundo o processo de segurança.

Basta contar clientes?

Não. Integridade, dinheiro e funções críticas podem pesar mais.

Onde guardar a matriz?

Num local acessível durante incidentes, ligado a alertas e procedimentos.

Da ideia a um âmbito que se consegue executar

Partilhe o percurso do utilizador, integrações e condições de lançamento. Podemos preparar uma estimativa com pressupostos e exclusões.

Leitura complementar

Rollback ou hotfix durante um incidente de produção

Durante um incidente, escolha a ação mais provável de recuperar serviço com risco controlado.

Recuperação de desastre: testar RTO e RPO

Um plano de recuperação é credível quando um serviço utilizável pode ser restaurado.

Um runbook de produção para equipas pequenas

Um runbook ajuda a passar de um sintoma específico para uma decisão segura.