Los modelos del momento: qué correr en 128GB (septiembre 2025)
Nuestra selección actualizada de modelos para hardware doméstico serio: los que corren en 24GB, los que piden 48GB y los que justifican un cluster. Con enlaces y veredictos.

Esta es nuestra selección rotativa — la actualizaremos cada mes — de los modelos que corren en hardware local y valen la pena. Criterios: calidad en español, velocidad en hardware doméstico y utilidad real (medida con nuestro mini-benchmark).
Para 8-16GB de VRAM/RAM (el acceso a todos)
Qwen2.5-7B-Instruct (Q4) — El todoterreno eterno. Excelente en español, JSON fiable, sigue instrucciones. Si dudas, este.
Llama-3.1-8B (Q4) — El seguro de vida. Menos brillante que Qwen en español pero ecosistema enorme y comportamiento predecible.
Gemma-2-9B (Q4) — El refinado. Escribe mejor de lo que su tamaño sugiere. Ideal para textos y correos.
Para 24-48GB (el sweet spot entusiasta)
Qwen2.5-14B (Q4) — El mejor calidad/velocidad para SERVICIO doméstico. Nuestro modelo de chat por defecto en la spark worker.
Mistral-Small-22B — Europeo, discreto, excelente siguiendo formatos. Para tareas de estructura estricta va de lujo.
Qwen2.5-Coder-14B — Si programas: mejor que muchos 70B en tareas de código reales.
Para 64-128GB (el laboratorio)
Qwen2.5-32B / GLM-4-32B (Q4) — Calidad de servicio serio. Razonamiento sólido, español nativo sorprendente.
MoE tipo DeepSeek-V3-Flash / GLM-4.5-Air (Q3, ~97GB) — Los que corren en nuestro cluster: calidad de frontier a velocidad doméstica (27 t/s decode en las dos sparks). Es la categoría que justifica tener 128GB.
Llama-3.3-70B (Q3/Q4) — El clásico premium. Aún el mejor “solo un modelo grande y a correr” si tienes la memoria.
Los de nicho que recomendamos sin dudar
bge-m3 — El embedding multilingüe definitivo para tu RAG. Obligatorio. Whisper large-v3 — La transcripción. Obligatorio x2. Kokoro-82M — TTS sorprendentemente bueno y rapidísimo para voz local. nomic-embed-text — Embeddings ligeros para empezar.
Los que NO recomendamos (para nada personal)
- Modelos “top del benchmark” sin soporte de español decente (ya nos pasó — lo contamos aquí).
- Variantes “ablasadas” (chat versiones custom) sin documentación clara del entrenamiento.
- Cualquier cosa que suene demasiado bonita para ser real en su demo GIF.
Cómo lo probamos todos
Cada modelo pasa por: mini-benchmark casero (10 tareas reales, 3 en español coloquial) + una semana de uso real en nuestros pipelines. Si no sobrevive a ambas pruebas, fuera de la selección.
Próxima actualización: octubre 2025. Los modelos nuevos de este mes aún están en el horno de pruebas.