Mi primer servidor de inferencia propio
El PoC completo: que medi, que rompi y cuanto costo servir un modelo open-source en una GPU alquilada.
8 artículos
Servir tu propio modelo dejó de ser un tema de laboratorio: hoy se alquila una GPU por menos de un dólar la hora y un modelo abierto de 30B cabe en 48 GB de VRAM. La pregunta ya no es si se puede, sino si te conviene.
Esta serie es el PoC completo que hicimos para responderla con números: dos ingenieros, una L40S alquilada, un modelo MoE de código y una regla — nada se decide sin medir. Ocho capítulos con el stack (opencode → LiteLLM → vLLM), el hardware y sus costos reales, los bugs que nos costaron horas, las mediciones de latencia y throughput, la matemática de la memoria y el informe final que —spoiler— recomendó no migrar todavía con las cuentas en la mano.
Vas a encontrar: setups que puedes copiar, los 7 bugs del entorno alquilado con síntoma, causa y fix, y números propios (TTFT, tokens/s, VRAM y costo) en lugar de benchmarks ajenos. Y también lo que no medimos: la calidad del modelo, la latencia en red privada y el comportamiento con 30 usuarios concurrentes. Esa honestidad es parte del valor: un PoC que dice "todavía no" te ahorra una decisión cara.
Empieza por el capítulo 1 (el plan) y sigue el orden: la serie está pensada como un recorrido, del "¿se puede?" al "¿y ahora qué?".
Contenido de la guía
- 01
Plan: servir mi propio modelo para bajar la factura
- 02
Los 7 bugs del entorno alquilado
- 03
El error de mi propio benchmark
- 04
Prefix caching: la misma carga, 3× más rápido
- 05
El cuello de botella no era la GPU: era la red
- 06
48 KB por token: por qué 48 GB no aguantan 30 sesiones
- 07
MoE por dentro: 30B totales, 3B activos
- 08
El informe que dijo "no migren todavía"