El foso es el rack
Cualquiera puede hablar de IA. Muy pocos pueden demostrar un modelo de 300–700B corriendo en su propia casa, con vatios medidos. Ese es el foso de En Local: un mini-datacenter de aficionado-pro que enseñamos en cámara. El cluster es el personaje.
◆ El inventario
El cluster: 768GB unificados
DGX Spark OEM: GB10 Grace Blackwell, 128GB unificados por nodo, 1 PFLOP FP4, ConnectX-7 2×200GbE. ~27W en reposo, ~112W a plena carga por nodo.
En pares corren modelos de 300B–400B (DeepSeek V4 Flash, GLM NVFP4). Con cuatro nodos sirven modelos de la escala GLM ~700B a ~22 tok/s. Contenido «imposible» para el resto del timeline.
El tejido RoCE
2×400G + 2×200G + 8×50G. El switch que usa la comunidad Spark. Cableado QSFP, MTU 9000, RoCE de verdad frente al TCP que frena el NCCL. Eso también es contenido.
Capacidad enorme, poco ancho de banda
Ryzen AI Max+ 395: hasta ~96–108GB para la iGPU a ~215GB/s. MoE de 30B a 70–100 tok/s, gpt-oss-120B ~50 tok/s, denso de 70B a 4–6 tok/s (honrado). Ideal para servir modelos 24/7, embeddings y TTS.
La cámara rápida
896GB/s donde el modelo cabe: 8B a ~110 tok/s, 32B Q4 a ~23 tok/s. ComfyUI, WAN, clips del podcast, miniaturas y voice-clone local. Todo el material visual del canal nace aquí.
✦ La arquitectura viva
cada pieza aparece en cámara cada 2 semanas — regla de oro1 Strix Halo: modelo MoE 30B–70B siempre caliente + embeddings BGE-M3 + TTS local. Cada mañana resume papers y repos — alimenta el podcast y la newsletter.
1× 5090: 8B–32B a toda velocidad para los vídeos de «en 15 segundos lo corres». El benchmark en un frame sale de aquí.
2 GX10 enlazados: el modelo de la semana que no cabe en una GPU de consumo. Las fichas de GLM-5.3, DeepSeek V4 y Qwen3.8 salen de aquí.
1 GX10 / 1 Halo: ALIA-40B instruct + Salamandra, RAG en español sobre BOE, contratos, documentación clínica. La demo que nadie más enseña corriendo.
1× 5090 + 1 Halo: imagen y vídeo local para el propio canal. Miniaturas, clips, artefactos del podcast.
El resto de GX10: LoRA/QLoRA de dominio en español, cuantizaciones GGUF/NVFP4 y A/B de runtimes (vLLM, SGLang, llama.cpp, TensorRT-LLM).
● Los números que nos definen
Cada cifra de esta web sale de nuestro banco de pruebas: seis medidas consecutivas, temperatura, potencia y energía junto a tok/s.Medido, derivado o no medido — nunca confundidos.
◇ Los dos del rack
Toni
Rack y número — benchmarks, configs, cluster
Benchmarks, configs, cluster, fine-tunes. Grabar terminal + vatímetro + fotos del rack. Backups, luz, discos y NCCL.
Jaume
Cara y red — guion, comunidad, comercial
Guion, voz del podcast, hilos de opinión. Respuestas, DMs, Spaces y newsletter. Comercial: diagnósticos y pilotos.
El credo
- Publicamos medido o no publicamos
- Números concretos: tok/s, GB, W, €
- Los errores también se publican
- La newsletter es el activo; X es el megáfono
Síguenos y escúchanos
El podcast semanal + los benchs diarios. Todo desde el rack, todo en español.