既然你正准备迈入 3 节点 PVE 集群的“黄金架构”,这不仅意味着票数更稳,更意味着你现在可以真正放心地开启 HA(高可用) 自动故障转移功能了。
在 3 节点环境下,为了让某台物理机宕机后,业务能以最快、最安全的方式在其他节点拉起,我为你梳理了以下四项核心调优策略:
1. 启用硬件看门狗 (Hardware Watchdog) — 隔离机制的核心【可以使用软件看门狗-linux内核自带】
在 HA 体系中,最怕的不是节点直接“死机”,而是节点“半死不活”(比如网络极度拥塞导致心跳丢失,但 CPU 还在跑)。为了防止两台机器同时运行同一个虚拟机(导致数据彻底损坏),PVE 使用 Fencing(隔离) 机制。
- 调优建议: 如果你的物理机主板支持(现代服务器和大部分 PC 都支持),务必确保内核加载了看门狗驱动。
- 操作: 在 PVE 节点上运行
ls /dev/watchdog。如果存在,PVE 的 HA 管理器会自动利用它。当节点失去集群联系时,看门狗会强制物理机立即重启(硬复位),从而释放资源锁,让其他节点安全地接管虚拟机。
2. 配置“HA 组” (HA Groups) — 策略化分配
默认情况下,HA 会把宕机节点的虚拟机随便塞给剩下的节点。这可能导致某台节点的内存瞬间被撑爆。
- 调优建议: 创建 HA 组来限制虚拟机的流向。
设置方法:
- 在 数据中心 (Datacenter) -> HA -> Groups 中添加组。
- 限制范围 (Restricted): 勾选此项,虚拟机就只会在你指定的几个节点间跳动。
- 优先级 (Priority): 给节点打分。比如节点 A 性能最强,设为 10;节点 B 次之,设为 5。这样 HA 会优先尝试在节点 A 上拉起业务。
3. 调整故障切换策略 (Shutdown Policy)
当你要正常重启一台物理机进行维护时,HA 的反应速度决定了你的心情。
调优建议: 在 数据中心 -> HA -> 资源 (Resources) 中,针对每个高可用虚拟机设置:
- Shutdown Policy(关机策略): 建议选
Migrate(迁移)。 - 效果: 当你点击 PVE 节点“重启”时,HA 管理器会自动感知,并在关机前温和地将虚拟机在线迁移(vMotion)到其他节点,实现零停机维护。
- Shutdown Policy(关机策略): 建议选
4. 容错等待时间调优 (Migration Recovery)
PVE 默认在发现节点失联后,会等待大约 1-2 分钟确认该节点真的“挂了”才会开始在别处拉起。
- 调优建议: 对于跨机房或公网连接的 3 节点集群,网络延迟可能导致误判。
配置路径:
/etc/pve/ha/manager.cfg(通常保持默认即可,除非你发现频繁误报)。- 如果你希望切换更灵敏,可以适度缩短等待时间,但前提是你的网络丢包率必须极低,否则会陷入无尽的“重启-迁移-重启”死循环。
附注(raymoon): https://ytai.de/t/topic/78/1