← Todos los postsBlog · 8 de octubre de 2025

Nuestro setup de grabación (y cómo la IA lo mejora cada semana)

Del micrófono al MP3: el hardware y software de grabación de En Local, con los trucos de audio que hemos aprendido y lo que la IA aporta al proceso.

Nos preguntáis por el “cómo se hace” del podcast. Aquí va el entre bastidores completo, con lo que la IA aporta a cada paso.

El hardware (modesto y funcional)

  • 2 micrófonos dinámicos (los dinámicos perdonan habitaciones sin tratar, los de condensador no)
  • 2 auriculares cerrados (para monitorear sin bleeding)
  • Interfaz de audio USB de 2 entradas
  • Un portátil para grabar (la spark graba copia de seguridad por si acaso)
  • La habitación: alfombra, estanterías con libros y pánico a las paredes lisas. Acústica casera que funciona.

El software de grabación

Reaper como DAW: ligero, barato, y perfecto para podcasts (los “tracks” separados por hablante son claves para nuestra pipeline de transcripción).

Nuestro setup de sesión:

  1. Grabación local a 48kHz/24bit, una pista por micrófono
  2. Copia de seguridad automática de audio a la spark durante la sesión (por si el disco del portátil decide morir a mitad de episodio)
  3. Marcadores de errores en directo (una palmada: luego se localizan con el waveform)

La IA en cada paso

Antes de grabar

  • Guion y estructura: nuestro LLM local revisa el guion y señala: “esto se entiende solo si has leído el post” / “este chiste necesita contexto”. Editor infatigable.
  • Investigación: RAG sobre las noticias de la semana con nuestro pipeline de resúmenes.

Durante

  • Nada. La IA no toca la grabación en directo (aún). La naturalidad es el activo.

Después

  • Transcripción: Whisper large-v3, 6 minutos por hora de audio
  • Limpieza de audio: RX Elements (no es IA generativa, es reparación: quita zumbidos y golpes)
  • Show notes, capítulos y títulos: LLM local con nuestro prompt de pipeline
  • Clips para redes: detección de “frases potentes” por el LLM + cortes con ffmpeg (automatizado, revisado por humanos)

Lo que NO hacemos (y por qué)

  • No usamos clonación de voz: nuestros errores son nuestros. La voz natural, con sus muletillas, es parte del encanto (eso decimos; la verdad es que nos da pereza).
  • No reescribimos con IA lo que hablamos: la transcripción es literal. Editamos nosotros.
  • No automatizamos la edición de audio (todavía): la diferencia entre “bien” y “cansado de escuchar” está en los cortes, y eso aún lo hace mejor un humano con oído.

El coste total

  • Hardware: lo que teníamos (si empiezas de cero: ~300€ para dos personas)
  • Software: Reaper (60€ una vez) + RX Elements (~50€ en oferta)
  • IA: 0€ (todo corre en las sparks)
  • Tiempo por episodio: ~4 horas de producción total, de las cuales la IA se come 2

¿Preguntas sobre el setup? Escríbenos y hacemos post de detalle sobre lo que toque.