
EP.008 — Seguridad y backups: porque la nube también te hackea
Auditamos la seguridad de nuestro laboratorio en directo: SSH, APIs, backups. Lo que estaba bien, lo que estaba fatal y la checklist final para tu setup.
Toni y Jaume corren, comparan y despliegan modelos de IA en su propio rack: 6× GB10 clusterizados, 768GB de memoria y benchmarks con tok/s y vatios. Lo que otros cuentan, aquí se demuestra.
$ bench --modelo glm-5.3 --contexto 1M --vatios

Auditamos la seguridad de nuestro laboratorio en directo: SSH, APIs, backups. Lo que estaba bien, lo que estaba fatal y la checklist final para tu setup.

X no paga el hardware. El dinero sale de autoridad + rack real + servicios. Nuestra tesis completa: qué somos, qué no somos, y por qué el rack es el foso.

139 tok/s con DSpark — el récord del laboratorio. Pero 0/5 en seguridad sin system prompt defensivo: la inyección durmiente que se cobraba su precio dos turnos después. Velocidad y seguridad, la historia completa.

56 tok/s estructurado en TP2, concurrencia lineal hasta ×8... y la decisión más contraintuitiva: forzar thinking=false en toda la ruta porque el razonamiento oculto se comía el presupuesto. Nuestro A/B completo.

43,91 tok/s, TTFT 131ms y 1M de contexto: la primera configuración dual-spark que nos convenció. Cómo la medimos, qué flags importaban de verdad y cuál fue nuestra línea base del cluster.

Sistema práctico para almacenar, versionar y limpiar modelos en local: HF_HOME, symlinks, scripts de limpieza y la política de 'un modelo entra, un modelo sale'.

Cómo accedemos a nuestras sparks y al servidor desde cualquier parte del mundo sin exponer ni un puerto: la magia de la VPN mesh explicada sin jerga.

El Model Context Protocol explicado con analogías honestas: qué es, cómo conectar tus herramientas a un LLM en local y los servers que usamos a diario.