real servingReal vLLM on an H100
vLLM 0.29.0 serving Qwen2.5-7B-Instruct on a DigitalOcean H100, driven with four tenants at 2–16 requests/s. 6,241 requests, 0 errors, about $2.15.
Token and time-share meters disagree by 12–14 points on the RAG tenant; utilization reads 97–99% at every load.
Code and data →



