Recuperação de desastre: testar RTO e RPO

·3 min de leitura

Um plano de recuperação é credível quando um serviço utilizável pode ser restaurado.

Duas torres de servidores ligadas por um percurso interrompido e uma via contínua de recuperação.

Um plano de recuperação é credível quando um serviço utilizável pode ser restaurado. RTO exprime tempo alvo de recuperação; RPO, janela tolerada de perda de dados. Defina-os pelas consequências comerciais e teste a aplicação completa, não apenas a existência de uma cópia.

Definir o que recuperar

Liste percursos, bases, identidade, DNS, certificados e dependências. Determine funcionamento degradado aceitável e acesso de emergência se os sistemas normais estiverem indisponíveis. Um objetivo para a base não basta se a aplicação não conseguir voltar a ligar-se.

Preparar exercício isolado

Use dados autorizados e protegidos ou sintéticos e bloqueie efeitos reais involuntários: mensagens, pagamentos e chamadas externas. Registe ponto da cópia, início e marcos. Escolha cenário explícito, como perda da base, e os pressupostos. Meça até validação comercial, não apenas até terminar a importação.

Demonstrar perda e tempo observados

Compare dados recuperados com pontos conhecidos e identifique a operação mais recente recuperável. Verifique direitos, tarefas e montantes ou contagens importantes. Registe passos manuais e dependências que impedem a meta. Corrija e repita a via afetada. Um exercício aprovado corresponde ao cenário e estado testados, não a todos os desastres possíveis.

Um exemplo para validar

Restaure uma cópia de teste com saídas externas bloqueadas. Entrada bem-sucedida não chega: examine uma encomenda conhecida, permissões e tarefa associada ao ponto guardado. Meça preparação, acesso a chaves e validação comercial além da restauração. Configuração histórica ausente continua a ser lacuna mesmo que importar a base tenha funcionado. Separe essa dependência da perda de dados e atribua reparação. Repita o cenário para demonstrar que documentação e mudanças permitem realmente chegar ao serviço utilizável e não apenas a processos técnicos que parecem saudáveis.

Perguntas frequentes

Qual a diferença entre RTO e RPO?

Tempo de recuperação versus perda de dados aceitável.

Uma cópia correta prova recuperação?

Não. Restauração, dependências e validação também devem funcionar.

Podemos usar dados reais?

Só autorizados e protegidos; sintéticos podem ser mais adequados.

Com que frequência testar?

Segundo risco e mudanças, especialmente após alterações importantes de arquitetura.

E se a meta não for cumprida?

Documente resultado e causa e ajuste sistema ou requisito explicitamente.

Da ideia a um âmbito que se consegue executar

Partilhe o percurso do utilizador, integrações e condições de lançamento. Podemos preparar uma estimativa com pressupostos e exclusões.

Leitura complementar

Um runbook de produção para equipas pequenas

Um runbook ajuda a passar de um sintoma específico para uma decisão segura.

Prevenção para startups sem equipa SRE dedicada

Uma equipa pequena pode organizar prevenção útil quando as promessas correspondem aos recursos.

Gravidade de incidentes: uma matriz de escalamento

A gravidade descreve impacto atual ou credível, não o dramatismo de uma mensagem de registo.