PVE 网络异常下的工程性止损方案:从虚拟机自愈幻想到宿主机重启策略
一、问题背景 在基于 PVE(Proxmox VE)的单节点虚拟化环境中,宿主机偶发网络异常,表现为: 该现象在家用硬件、非 HA、bridge 网络架构中具有一定普遍性。 二、初始假设与验证路径 1. 虚拟机网卡模型假设 最初怀疑为 VirtIO 在宿主机网络异常时放大问题,因此进行了如下验证: 2. 验证结果 结论: 问题不在虚拟机网卡模型层面 三、systemd + bridge + KVM 的一致性边界 在异常场景下,宿主机通常通过: 恢复网络。 该操作在 systemd + bridge 环境中会导致: 此时虚拟机网络栈处于: 逻辑上未崩溃,但状态不可预测 这是虚拟化架构本身的边界问题,而非配置错误。 四、关键工程结论 经过多轮实测,可得出以下结论: 最终结论: 当宿主机发生网络中断时,最可靠的策略是直接重启宿主机 因为宿主机重启可以同时完成: 五、设计目标的转变 设计目标从: “尽量让虚拟机自己恢复网络” 转变为: “一旦检测到宿主机网络中断,直接重启宿主机,保证整体收敛” 这是典型的工程止损决策,而非妥协。 六、最终方案:宿主机网络监控 + 自动重启 方案原则 七、宿主机网络重启 Watchdog …