Plano de recuperação de desastre¶
Escopo and objetivos¶
Este plano aborda recuperação de eventos catastróficos que impactam a disponibilidade de serviço Weblate, integração de dados, ou continuidade operacional.
Nota
O plano está especificamente desenhado para implementação do Weblate pelo Weblate s.r.o., mas pode ser aplicado a outras implementações de forma semelhante.
Definições¶
Desastre: Qualquer evento não planeado que causa uma perda completa ou significante de serviço, dados, ou funcionalidade de sistema. Exemplos incluem falhas de hardware, corrupção de dados, falhas na infraestrutura, ou ataques maliciosos.
Objetivo de Recuperação de Ponto (RPO): Intervalo aceitável máximo para perda de dados: 24 horas.
Tempo de Recuperação Objetivo (RTO): Tempo máximo aceitável para restaurar serviço máximo: 8 horas.
Componentes críticos¶
Camada de Aplicação: Aplicação Weblate Python/Django, trabalhadores de plano de fundo (Celery), e tarefas agendadas.
Camada de Dados: Base de dados PostgreSQL, repositórios de tradução (Git), e registos.
Infraestrutura: Servidor web (NGINX/Apache), proxy reverso, volumes de armazenamento, configuração SSL/TLS, e sistema de registo opcional SIEM.
Política de cópia de segurança¶
Backup automatizado pelo BorgBackup processos garantem que todos os componente essenciais (base de dados, dados, e configuração) tem cópia de segurança feita diariamente. As cópias de segurança são armazenadas em duas localizações geograficamente diferentes. A política de retenção de cópias de segurança assegura-se que cópias de segurança estão disponíveis diariamente e mantém seis meses de cópia de segurança.
Procedimentos de Recuperação¶
Cenário de falha: hóspede cheio/perda de sistema¶
Provisionar novo host.
Bootstrap Weblate a usar software de aprovisionamento.
Restaura a cópia de segurança Weblate seguido de Restaurar do BorgBackup.
Reinicar o contentor do Weblate.
Verifica funcionalidade e executa verificações de consistência.
Falha de cenário: corrupção de base de dados ou perda de volume de dados¶
Impeça o Weblate de prevenir operações de escrita futuras.
Restaura a cópia de segurança Weblate seguido de Restaurar do BorgBackup.
Reinicia serviços e verifica a consistência de tradução e dados de utilizador.
Cenário de falha: manipulação maliciosa ou ransomware¶
Isole o anfitrião afetado da rede.
Identifique a última cópia de segurança que saiba que está em bom estado (antes da infeção).
Siga os passos de Cenário de falha: hóspede cheio/perda de sistema para implementar o sistema em um novo anfitrião.
Validação e testes¶
Verificação de cópia de segurança: Teste de restauração automática de cópias de segurança do Weblate.
Exercício de Recuperação de Desastre: Realizar, pelo menos uma vez por ano, envolvendo a restauração completa de um ambiente de teste.
Verificações de Integridade Automáticas: BorgBackup assegura integridade dos arquivos de cópia de segurança.
Etapas de pós-recuperação¶
Confirme que todos os serviços estão operacionais e acessíveis.
Notifica utilizadores e partes interessadas do estado da recuperação.
Linha temporal do documento, causa principal, e lições aprendidas.
Aplicar atualizações ou alterações de infraestrutura para prevenir reincidências.
Siga Política de divulgação de vulnerabilidades no caso da vulnerabilidade ter sido envolvida.