vLLM desde cero: tu primer servidor de inferencia
De cero a tu propio servidor vLLM en una GPU alquilada: 8 capítulos prácticos, por menos de $5 y con números medidos en cada paso.
8 artículos
Una guía práctica para pasar de cero conocimiento de inferencia a tu propio servidor vLLM en una GPU alquilada: por menos de $5 y con números medidos en cada paso.
Qué vas a construir
Un modelo local corriendo en tu máquina con Ollama
Un servidor vLLM con un modelo de 30B en FP8 en una GPU de 48 GB
Un gateway con llaves por persona, presupuestos y logs
Tus propios benchmarks de TTFT, tokens/s y concurrencia
Son 8 capítulos, cada uno con comandos que corrieron en un pod real y un checkpoint de tiempo y costo. Empieza por el capítulo 1 y no saltes pasos: cada uno monta sobre el anterior.
Contenido de la guía
- 01
Qué es servir un modelo de IA (y por qué existe vLLM)
- 02
Tu primer modelo local en 10 minutos (Ollama)
- 03
Alquila tu primera GPU sin miedo (~$1 la hora)
- 04
Tu primer servidor vLLM (hello world)
- 05
Los 5 flags de vLLM que importan de verdad
- 06
Mide tu vLLM: TTFT, tokens/s y concurrencia sin engañarte
- 07
LiteLLM: llaves, presupuestos y la factura de tu vLLM
- 08
Cuando explota: los 7 errores de servir vLLM en GPU alquilada