Durante um incidente, escolha a ação mais provável de recuperar serviço com risco controlado.

Durante um incidente, escolha a ação mais provável de recuperar serviço com risco controlado. Voltar à versão anterior não restaura necessariamente os dados antigos. Um hotfix altera a versão atual e exige causa suficientemente demonstrada e correção verificável.
Rever fronteiras da mudança
Compare início do problema com publicações, configuração, migrações e prestadores. A versão anterior lê e escreve os dados atuais? Uma migração destrutiva ou operação externa irreversível pode impedir uma reversão simples. Preserve provas enquanto limita dano em curso.
Comparar vias de recuperação
Inclua desativar função, alterar tráfego ou reduzir carga além de modificar código. Compare tempo de execução e verificação, alcance, reversibilidade e consequências do erro. Um hotfix deve tratar uma causa estreita. Correções de dados e migrações são passos controlados independentes, não efeitos escondidos da publicação.
Atuar com coordenação
Nomeie executor e anuncie resultado esperado e critério de sucesso. Evite mudanças simultâneas impossíveis de interpretar. Use a via de entrega estabelecida e conserve registo. Verifique percursos reais, filas e integridade depois. Um processo saudável não prova recuperação de trabalho perdido; encerre após estabilidade acordada e atribuição de tarefas restantes.
Um exemplo para validar
Uma versão nova pode escrever dados obrigatórios desconhecidos da anterior. Ter a imagem antiga disponível não torna o rollback seguro. Verifique compatibilidade com dados atuais e se um interruptor de funcionalidade limita o percurso afetado. Uma correção pequena pode ser preferível. Antes de agir, registe ação, sinal esperado e condição de paragem. Depois verifique também trabalho pendente. Essa preparação mantém decisão coordenada sob pressão e evita confundir aplicação que arranca com uma operação comercial que voltou a funcionar corretamente em todos os passos necessários.
- Serviço relacionado
- Recuperação de desastre: testar RTO e RPO
- Um runbook de produção para equipas pequenas
Perguntas frequentes
Rollback é sempre mais rápido?
Não. Compatibilidade e dados podem torná-lo lento ou inseguro.
Pode reverter-se uma migração?
Só com uma via inversa válida e testada para os dados atuais.
Quando escolher hotfix?
Quando a causa é limitada, demonstrada e o risco inferior às alternativas.
Podem agir várias equipas?
Sim, com coordenação que evite alterações contraditórias.
Quando encerrar o incidente?
Depois de verificar serviço e dados e atribuir o trabalho restante.
Da ideia a um âmbito que se consegue executar
Partilhe o percurso do utilizador, integrações e condições de lançamento. Podemos preparar uma estimativa com pressupostos e exclusões.
Leitura complementar
Recuperação de desastre: testar RTO e RPO
Um plano de recuperação é credível quando um serviço utilizável pode ser restaurado.
Um runbook de produção para equipas pequenas
Um runbook ajuda a passar de um sintoma específico para uma decisão segura.
Gravidade de incidentes: uma matriz de escalamento
A gravidade descreve impacto atual ou credível, não o dramatismo de uma mensagem de registo.