Como Configurar Cluster HA no Proxmox VE

9 min de leitura Virtualização
Como Configurar Cluster HA no Proxmox VE

Implementar alta disponibilidade (HA) no Proxmox VE é essencial para ambientes de produção onde a interrupção de serviços não é uma opção. Um cluster HA garante que, em caso de falha de hardware ou software em um nó do cluster, as máquinas virtuais e contêineres sejam automaticamente reiniciados em outro nó saudável, minimizando o tempo de inatividade.

Este tutorial detalha o processo completo de configuração de um cluster Proxmox com HA, desde o planejamento da infraestrutura até a validação do failover. Siga cada etapa rigorosamente para garantir a estabilidade e a segurança do seu ambiente de virtualização.

1. Pré-requisitos e Planejamento da Infraestrutura

Antes de iniciar a configuração, é crucial ter uma arquitetura de rede e armazenamento robusta. O Proxmox HA depende fortemente de comunicações de baixa latência e acesso compartilhado ao armazenamento.

  • Nós do Cluster: Recomenda-se um número ímpar de nós (3, 5, 7) para evitar "split-brain" em decisões de quorum. Para este tutorial, assumiremos um cluster de 3 nós.
  • Rede de Cluster: Cada nó deve ter pelo menos uma interface de rede dedicada ou VLAN separada exclusivamente para a comunicação do cluster (portas 8006 e 22). Isso isola o tráfego de gerenciamento e replicação do tráfego de dados dos clientes.
  • Armazenamento Compartilhado: Para HA funcionar corretamente, as máquinas virtuais devem residir em armazenamento acessível por todos os nós do cluster (ex: Ceph, NFS, iSCSI, FC). O armazenamento local não é compatível com HA nativo.
  • Sincronização de Tempo: Todos os nós devem ter a hora sincronizada via NTP/Chrony. Diferenças de tempo podem causar falhas na eleição do nó mestre e problemas de consistência de dados.

2. Preparação dos Sistemas Operacionais (Hosts)

O Proxmox VE deve ser instalado em todos os nós antes da formação do cluster. Certifique-se de que todas as atualizações estão instaladas e que o hostname está corretamente configurado.

No terminal de cada nó, defina um hostname fixo e edite o arquivo /etc/hosts para garantir a resolução interna correta entre os nós do cluster. Isso evita problemas de DNS durante a comunicação interna.

# Exemplo de configuração no /etc/hosts
192.168.1.10 pve-node1 proxmox-cluster
192.168.1.11 pve-node2 proxmox-cluster
192.168.1.12 pve-node3 proxmox-cluster

Verifique a conectividade de rede entre os nós usando o comando ping.

ping -c 4 pve-node2
ping -c 4 pve-node3

3. Formação do Cluster Proxmox

O primeiro nó (geralmente o mais antigo ou com maior capacidade) torna-se o "Master" do cluster. A criação do cluster é feita através da interface web ou linha de comando.

  1. Acesse o primeiro nó: Vá para Datacenter</code > na árvore à esquerda, clique em <code>Cluster e depois em Create Cluster.
  2. Defina o nome do cluster: Escolha um nome identificável (ex: br-prod-cluster-01). O Proxmox gerará automaticamente um ID único para o cluster.
  3. Adicione os nós restantes: Nos segundos e terceiros nós, vá em Datacenter > Cluster > Join Cluster. Insira o IP do nó mestre (o primeiro nó criado) e a senha de root. Confirme a adição.

Agora que os três nós estão no cluster, verifique o status. No menu Cluster, você deve ver os três nós listados como "Online". O nó mestre será destacado com uma estrela.

4. Configuração do Armazenamento Compartilhado

O HA não pode proteger VMs em armazenamento local. Você precisa configurar um storage que seja visível por todos os nós.

  1. NFS (Exemplo Comum): Se você tiver um servidor NFS externo, vá em Datacenter > Storage > Add > NFS.
  2. Detalhes: Insira o ID do storage (ex: nfs-ha-storage), o endereço IP do servidor NFS, o caminho do diretório exportado e a identificação NFS-Export. Marque a opção Content para VMs (Disk Image).
  3. Teste: Após adicionar, clique em "Content" e verifique se as VMs existentes podem ser vistas. Se estiver usando Ceph, a configuração é feita nativamente pela interface de gerenciamento do Ceph no Proxmox.

Importante: Mova qualquer VM que deseja proteger por HA para este armazenamento compartilhado. VMs em storage local não podem ser migradas automaticamente pelo HA.

5. Habilitando a Alta Disponibilidade (HA)

Agora, ativamos o módulo HA globalmente no cluster.

  1. Vá em Datacenter > Cluster.
  2. Clique na aba High Availability.
  3. Mude a opção HA Management para Enabled.
  4. Clique em Apply Changes.

Com o HA habilitado, o Proxmox monitorará constantemente os recursos e a saúde dos nós. Agora, precisamos definir quais VMs são protegidas.

6. Configurando Recursos de HA para Máquinas Virtuais

Nem toda VM precisa estar em HA. Defina explicitamente quais VMs críticas devem ter failover automático.

  1. Vá em Datacenter > Cluster > High Availability.
  2. Clique em Add e selecione VM.
  3. Selecionar VM: Escolha a ID da máquina virtual (ex: 100). Certifique-se de que ela está no storage compartilhado.
  4. Primary Node: Defina o nó preferencial onde a VM deve rodar normalmente. Se esse nó falhar, a VM será movida para outro nó.
  5. Isolation Response: Escolha como lidar com a isolação do nó. Recomenda-se None ou Reboot. Evite Migrate se não houver storage compartilhado confiável, pois pode causar corrupção de dados.
  6. Minimal HA State: Defina o estado mínimo que a VM deve manter. Started é o padrão para VMs. Pinned significa que a VM não será migrada mesmo se o nó primário falhar (não recomendado para HA real).
  7. Restart Priority: Defina a ordem de reinicialização em caso de falha global. Nós com prioridade mais alta tentam reiniciar as VMs primeiro.
  8. Max Reboot: Defina o número máximo de vezes que o cluster tentará reiniciar a VM antes de desistir e alertar os administradores.

Repita esse processo para todas as VMs críticas. Você também pode configurar HA para Contêineres (LXC) seguindo o mesmo fluxo.

7. Configuração de Regras de Restrição (Affinity/Anti-Affinity)

Para evitar pontos únicos de falha lógicos, é recomendável usar regras de restrição para garantir que VMs redundantes não fiquem no mesmo nó físico.

  1. No menu High Availability, clique em Add > Rule.
  2. Tipo: Escolha Anti-Affinity.
  3. Selecionar VMs: Selecione as VMs que não devem coexistir no mesmo nó (ex: dois servidores de banco de dados em cluster). O Proxmox garantirá que, se uma estiver no Nó 1, a outra estará no Nó 2 ou 3.

Isso aumenta significativamente a resiliência do ambiente. Se o Nó 1 cair, apenas uma VM crítica ficará indisponível (se houver falha simultânea de hardware nos outros nós), em vez de todas as VMs redundantes.

8. Monitoramento e Alertas

O HA só é eficaz se a equipe de TI for notificada imediatamente sobre falhas ou tentativas de failover.

  1. Vá em Datacenter > Cluster > High Availability.
  2. Clique na aba Options.
  3. Configure o Email Notification inserindo os detalhes do servidor SMTP e os endereços de e-mail dos administradores.
  4. Ative as notificações para eventos como HA State Change, Node Unreachable e VM Restart Failed.

Considere também integrar com ferramentas externas como Zabbix, Prometheus ou Grafana via API REST do Proxmox para dashboards em tempo real.

9. Testando o Failover (Validação)

A configuração não está completa sem testes reais. Simule falhas para garantir que o cluster reage conforme esperado.

Teste 1: Reinicialização do Nó
  1. Identifique a VM em HA no pve-node1.
  2. Reinicie o serviço pve-ha-lrm ou reinicie o nó inteiro via SSH: reboot.
  3. Acompanhe a aba Logs do cluster. Você deve ver entradas indicando que o nó ficou inacessível e que a VM foi marcada para reinicialização.
  4. Verifique se a VM apareceu no pve-node2 ou pve-node3.
  5. Confirme que o acesso à VM (via console ou rede) foi restabelecido após alguns minutos.
Teste 2: Simulação de Falha de Hardware
  1. Desligue abruptamente a máquina física do pve-node1 (simulando queda de energia ou placa-mãe queimada).
  2. O cluster detectará a perda do nó após o timeout configurado (geralmente 30-60 segundos).
    O tempo exato depende da configuração de tune no Corosync.
  3. A VM será migrada para um dos nós restantes. Verifique os logs em pve-node2 e pve-node3 para confirmar a migração automática.

10. Troubleshooting Comum

Se o HA não funcionar como esperado, verifique os seguintes pontos:

  • Status do Serviço: Em cada nó, execute pve-ha-lrm status e pve-ha-crm status. Ambos devem estar ativos.
  • Logs do Cluster: Verifique os logs em tempo real com tail -f /var/log/pvecluster/corosync.log. Erros de conexão ou quorum aparecerão aqui.
  • Storage: Certifique-se de que o storage compartilhado está montado e acessível em todos os nós. Se um nó não conseguir acessar o storage da VM, ele não poderá iniciá-la.
  • Quorum: O cluster precisa de quorum para operar. Se dois dos três nós ficarem offline, o restante perderá o quorum e não realizará failovers para evitar corrupção de dados. Isso é um comportamento esperado de segurança.

Conclusão

A configuração de um cluster HA no Proxmox VE transforma uma infraestrutura de virtualização básica em um ambiente empresarial resiliente. Ao seguir estes passos — desde o planejamento de rede até a validação do failover — você garante que seus serviços críticos permaneçam disponíveis mesmo diante de falhas de hardware.

Lembre-se: o HA é uma camada de proteção, não substitui backups regulares. Continue mantendo snapshots e cópias de segurança externas para proteger contra corrupção lógica de dados ou ataques de ransomware. Para mais tutoriais sobre administração de servidores e virtualização Linux, explore nossa seção de conteúdos técnicos.

Compartilhar: Link copiado!
Esse tutorial foi útil?

Comentários (0)

Seja o primeiro a comentar.

Deixe seu comentário

Seu comentário será analisado antes de ser publicado.

0/2000