</>
Inference Engineering: de cero a producción
Correr modelos de verdad: local, cuantización, VRAM, serving, medición y costos.
8 artículos
Contenido de la guía
- 01
Inference Engineering: qué es y qué se optimiza (TTFT, tokens/s, VRAM, costo)
- 02
Inferencia local en 2026: de LM Studio a vLLM (con matemática de VRAM)
- 03
Cuantización con números: calidad vs VRAM vs velocidad
- 04
¿Qué hardware necesitas? GPU, VRAM y cloud
- 05
Servir en producción: batching, concurrencia y autoscaling
- 06
Medir inferencia sin engañarte: tokens/s, TTFT y benchmarks mentirosos
- 07
El costo real de tu feature de AI: API vs self-host vs borde
- 08
Servir varios modelos en producción: routing, versionado y canary