Resposta direta: diante de falha em storage compartilhado, reduza gravações, identifique volumes e serviços afetados e preserve logs antes de reiniciar componentes. Acione o responsável pela camada, escolha failover ou restauração conforme integridade e objetivos de recuperação e valide dados antes de devolver tráfego às aplicações.
Revisão técnica: 08/09/2026.
Confirme escopo e sintomas
Registre início, volumes, hosts, máquinas virtuais e aplicações afetadas. Diferencie latência, erro de I/O, volume ausente, somente leitura e corrupção. Compare serviços que usam o mesmo storage com discos locais ou outro conjunto. Não atribua a lentidão à rede sem correlacionar métricas de armazenamento.
Preserve evidências e integridade
Guarde alertas, eventos de controladora, caminhos, multipath, filas e mensagens do sistema operacional. Reduza tarefas intensivas e pare aplicações que repetem gravações falhas. Se o sistema montar um volume somente para leitura, siga o cuidado descrito no guia de sistema de arquivos Linux protegido.
Verifique todas as camadas
Analise aplicação, sistema de arquivos, volume lógico, rede de armazenamento, controladora, discos, replicação, capacidade e energia. Confirme mudanças recentes e manutenção do fornecedor. Um componente redundante pode ter falhado antes sem alerta, deixando o segundo evento expor a dependência.
Escolha contenção e recuperação
Avalie retirar carga, mudar caminho, promover réplica, restaurar ou reconstruir. Confirme consistência e ponto dos dados antes do failover. Não trate réplica sincronizada como backup independente: erro lógico ou corrupção pode ter sido replicado. Defina um limite de tempo para abandonar tentativas sem avanço.
Valide dados e aplicações
Depois da recuperação, teste leitura, gravação, permissões, bancos, filas, máquinas virtuais e reinicialização controlada quando necessária. Compare contagens e períodos de dados. Monitore latência e erros por um ciclo representativo. Libere tráfego em etapas e mantenha reversão até o aceite.
Fortaleça a continuidade
Revise alertas de latência, capacidade, caminhos e degradação de redundância. Separe backups e teste restauração no prazo exigido. Documente arquitetura, dependências e contatos. Registre causa e ações no relatório pós-incidente e teste cenários de perda do storage inteiro, não apenas de um disco.