Serving infrastructure · 7 experiments · 9 decisions
GPU Inference Decision Lab
An EKS/vLLM lab that turns serving measurements into architecture decisions for admission, autoscaling, context limits, scheduling, and quantization.
- 100% queued delivery across burst and spike-to-zero admission runs
- 1.20 req/s long-context knee repeats with 36.8s p95 queue delay
- FP8 KV rejected on the current g4dn/vLLM path