Codea Bien Logo
</>

Inference Engineering: de cero a producción

Correr modelos de verdad: local, cuantización, VRAM, serving, medición y costos.

8 artículos

Contenido de la guía

  1. 01

    Inference Engineering: qué es y qué se optimiza (TTFT, tokens/s, VRAM, costo)

  2. 02

    Inferencia local en 2026: de LM Studio a vLLM (con matemática de VRAM)

  3. 03

    Cuantización con números: calidad vs VRAM vs velocidad

  4. 04

    ¿Qué hardware necesitas? GPU, VRAM y cloud

  5. 05

    Servir en producción: batching, concurrencia y autoscaling

  6. 06

    Medir inferencia sin engañarte: tokens/s, TTFT y benchmarks mentirosos

  7. 07

    El costo real de tu feature de AI: API vs self-host vs borde

  8. 08

    Servir varios modelos en producción: routing, versionado y canary