← Todos los postsBlog · 8 de septiembre de 2025

El zoo de los modelos: LLM, multimodales, de código, embedings... ¿quién es quién?

Guía de fauna: todos los tipos de modelos de IA que vas a ver citados, explicados como para contárselo a tu cuñado.

Cada semana salen tres modelos nuevos con nombres imposibles: Qwen3-VL, GLM-4.5-Air, Llama-4-Scout… Para no perdernos, aquí va la guía de campo del zoo. Con esta, la próxima noticia de “lanzan X” te enterarás a la primera.

Los LLM: la estrella del show

LLM = Large Language Model (modelo de lenguaje grande). Es el clásico: le escribes texto, te responde texto. Llama, Qwen, Mistral, GLM, DeepSeek… todos compiten aquí.

Conceptos para entenderlos:

  • Parámetros (7B, 70B, 405B): el “tamaño del cerebro” en miles de millones. Más B = más capacidad pero más memoria y menos velocidad.
  • Contexto (128K, 1M): cuánto texto puede “tener en la cabeza” a la vez. 128K tokens ≈ una novela de 300 páginas.
  • Razonamiento / thinking: algunos modelos “piensan en voz alta” antes de responder (o1, R1, QwQ…). Mejores en matemáticas y lógica, más lentos y más caros.
  • MoE (Mixture of Experts): el modelo tiene muchos “expertos” internos y solo activa los necesarios por pregunta. Es como un hospital: no llama a todos los médicos para poner una vacuna. Permite modelos enormes que corren a velocidad razonable.

Los multimodales: ven y oyen

Un modelo multimodal acepta más que texto:

  • Visión (VL): le pasas una imagen y la describe, responde sobre ella o extrae datos. (Qwen-VL, Llama-Vision, GLM-4V…)
  • Audio: transcribe (Whisper) o incluso habla (modelos TTS como Kokoro).
  • Vídeo: la frontera actual — algunos ya procesan vídeo, con mixed results.

Caso de uso estrella: le pasas la foto de una factura y te devuelve JSON con los datos.

Los de código: especialistas en programar

Modelos afinados para programar: Qwen-Coder, DeepSeek-Coder, Codestral… Suelen ganar a los generalistas de su tamaño en tareas de código, a costa de ser peor “charlando”.

Complemento imprescindible: SWE-bench como benchmark de referencia (ya lo explicamos aquí).

Los de embeddings: los bibliotecarios

Un modelo de embedding convierte texto en un vector de números que representa su significado. No conversa: su trabajo es que textos parecidos tengan vectores cercanos.

¿Para qué? Para búsqueda semántica y RAG (dar contexto a un LLM con tus documentos). Modelos típicos: BGE, E5, Nomic-Embed. Pequeños y rapidísimos, son los grandes olvidados y son imprescindibles.

Los de imagen: pintores y fotógrafos

  • Generación: Stable Diffusion, Flux… crean imágenes desde texto. En local corren bien con una GPU de 8-12GB.
  • Edición: inpainting (rellenar partes), outpainting (ampliar), ControlNet (pose exacta)…

Los pequeños pero mortíferos: SLM y edge

SLM = Small Language Model (1-4B). Corren hasta en un móvil o una Raspberry: Gemma, Qwen2.5-3B, Phi… Perfectos para automatizaciones simples donde no necesitas un genio, solo respuestas rápidas y baratas.

La chuleta definitiva

¿Quieres chatear/razonar?      → LLM (Qwen, GLM, Llama, DeepSeek...)
¿Imagen + texto?               → VL (Qwen-VL, GLM-4V)
¿Solo código?                  → Coder (Qwen-Coder, Codestral)
¿Buscar en tus documentos?     → Embeddings (BGE, Nomic)
¿Transcribir audio?            → Whisper
¿Generar imágenes?             → Flux, SDXL
¿En un móvil/Raspberry?        → SLM (Gemma, Phi, Qwen-3B)

En El Laboratorio probamos todos estos en nuestra cohorte de sparks. Lo que aprendemos, aquí caen.