EP.007 — El router de modelos: una IA para cada tarea
Nuestra arquitectura favorita: un despachador que envía cada petición al modelo adecuado (pequeño para lo fácil, MoE para lo serio). Eficiencia máxima en hardware doméstico.

De qué hablamos
No uses el martillo de 100GB para clavar chinchetas. Explicamos nuestra arquitectura de router: cómo decidimos qué modelo atiende cada petición, cómo lo montamos con nginx y n8n, y los números de latencia que hemos conseguido.
Capítulos
- 00:00 El problema: un modelo para todo es un desperdicio
- 06:30 La taxonomía de tareas (fácil/media/seria)
- 14:45 El clasificador: ¿quién decide qué modelo?
- 22:10 nginx como router: config exacta
- 30:00 Números: latencias y costes reales
- 38:30 Cuándo NO montar un router
Menciones y links
- Receta: Cluster dos sparks + MoE
- Receta: API local con vLLM
- Post: Los modelos del momento