NUMA-Aware GPU Capacity Planning: From Batch Scheduling to p99 Latency on Multi-Tenant Servers By infiniti.network.service July 27, 2026July 27, 2026 GPU infrastructure failures rarely look like Tags : AI infrastructure batch scheduling dedicated servers GPU capacity planning MIG multi-tenant GPU network QoS NUMA-aware tuning p99 latency storage staging