Audio · Producción musical

Auto-Ducking Audio: bajo la música cuando hablas

Carga tu voz y tu música de fondo, ajusta el umbral y la cantidad de ducking, previsualiza en tiempo real y exporta el resultado como MP3 o WAV. Todo ocurre en tu navegador: los archivos nunca salen del dispositivo, no necesitas cuenta y la herramienta sigue funcionando aunque pierdas la conexión.

Cómo funciona

▣ Tu audio se procesa en tu navegador. No se envía a ningún servidor.

Mezclador automático

Carga tus pistas
Pista de voz
Arrastra MP3/WAV/OGG/FLAC/M4A o haz clic para seleccionar
Música de fondo
Arrastra MP3/WAV/OGG/FLAC/M4A o haz clic para seleccionar

Formatos aceptados: MP3 · WAV · OGG Vorbis/Opus · FLAC · AAC/M4A (los dos últimos pueden fallar en Safari).

Ajusta el ducking

Más bajo = detecta voces más suaves; más alto = solo voces fuertes.

Cuánto baja la música cuando hay voz. -12 dB ≈ la mitad de volumen.

Cuánto tarda la música en bajar al nivel ducked.

Cuánto tarda la música en volver a su nivel normal.

Volumen base de la música cuando NO hay voz.

MP3 ahorra espacio; WAV es calidad máxima sin comprimir.

Previsualiza y exporta

Recomendado: hasta 15 min en escritorio, 5 min en móvil.

Cómo funciona el auto-ducking

1 · Detección de voz (VAD)

Analizamos la pista de voz en ventanas de 46 ms con tres métricas: RMS (energía), Zero Crossing Rate (textura) y centroide espectral (brillo). Solo marcamos "voz activa" si las tres pasan sus umbrales, con histéresis de 100 ms attack / 200 ms release para evitar parpadeo.

2 · Cálculo del envelope

Para cada ventana, decidimos la ganancia de la música: 0.355 cuando no hay voz (~-9 dBFS) y 0.089 cuando hay voz (~-21 dBFS con duck -12 dB). Las transiciones usan attack lineal y release exponencial para una sensación natural.

3 · Render offline

Usamos OfflineAudioContext para procesar el audio a 5-20x velocidad real sin bloquear tu navegador. 10 minutos de podcast se procesan en 30-120 segundos.

4 · Codificación final

El resultado se codifica con lamejs (MP3) o wavefile (WAV 16-bit). Ambos son librerías JavaScript que corren enteramente en tu navegador: cero uploads, cero servidores.

Preguntas frecuentes

¿Mi archivo de audio sale de mi navegador en algún momento?

No. Todo el procesamiento se hace en tu navegador con Web Audio API nativa y librerías JavaScript estáticas (lamejs para MP3, wavefile para WAV). El audio nunca se envía a ningún servidor. Puedes comprobarlo abriendo la pestaña Red de las herramientas de desarrollo: solo verás peticiones a los dominios de Google (AdSense y Funding Choices) si has dado tu consentimiento, nada más.

¿Qué formatos de audio puedo cargar y exportar?

Puedes cargar MP3, WAV, OGG Vorbis, OGG Opus, FLAC y AAC/M4A (estos dos últimos con soporte limitado según navegador; Chrome y Firefox los decodifican nativamente, Safari tiene restricciones). Para exportar, puedes elegir WAV 16-bit PCM a 44.1 kHz estéreo, o MP3 a 128, 192 o 256 kbps CBR.

¿Cuánto tarda en procesar mi podcast?

Para 10 minutos de audio en un escritorio moderno (4 núcleos, 2 GHz+), el pipeline completo (análisis VAD + render offline + codificación MP3) tarda entre 1 y 3 minutos, gracias al render offline de OfflineAudioContext que procesa a 5-20x velocidad real. En móvil, para 5 minutos de audio, espera entre 1 y 2 minutos.

¿Cuál es la calidad de la detección de voz comparada con Audacity o Auphonic?

Usamos un VAD heurístico basado en RMS, Zero Crossing Rate y centroide espectral con histéresis de 100 ms attack y 200 ms release. Funciona excelentemente para grabaciones de voz en estudio (micrófono dedicado, ambiente silencioso). Para audio muy ruidoso o con música muy mezclada, puede no ser tan preciso como Auphonic (que usa ML en cloud) o como un humano afinando manualmente en Audacity.

¿La herramienta tiene límite de uso diario o de tamaño de archivo?

No hay cuota diaria: es gratis ilimitado. El único límite es la memoria RAM de tu navegador. Recomendamos hasta 15 minutos de audio en escritorio y hasta 5 minutos en móvil para garantizar buena experiencia de usuario. Archivos por encima de 200 MB pueden no procesarse por cuota del navegador.

¿Necesito conexión a internet para usarla?

Para la primera carga sí (HTML, CSS, JS, librerías vendor y fuentes). Después, gracias al Service Worker, la herramienta queda cacheada y sigue funcionando aunque pierdas la conexión. Cuando estés offline, los anuncios y el banner de Funding Choices no se mostrarán; el resto de la herramienta sigue 100% operativa.

¿Por qué esta herramienta si ya existen AudioKit y Auphonic?

AudioKit y ende.app cargan ffmpeg.wasm (~30 MB) y tardan más de 10 segundos en arrancar; Auphonic sube tus archivos a la nube y cobra más allá de 2 horas al mes. Nuestra herramienta carga en menos de 1 segundo (lamejs + wavefile = 197 KB) y procesa todo en local sin cuota. Para podcasters hispanohablantes que valoran privacidad y simplicidad, es la opción más rápida.

Lo que esta herramienta sí y no hace

✓ Lo que sí hace

  • Procesa el audio 100% en tu navegador: el archivo nunca sale del dispositivo.
  • Baja la música automáticamente cuando detecta voz con un VAD heurístico (RMS + ZCR + centroide espectral).
  • Renderiza el audio final a 5-20x velocidad real gracias a OfflineAudioContext.
  • Exporta a WAV 16-bit PCM 44.1 kHz estéreo o MP3 128/192/256 kbps CBR.
  • Ofrece 5 controles de ajuste fino: umbral, cantidad de ducking, attack, release y nivel de música.
  • Funciona offline después de la primera carga (Service Worker cache-first).
  • Es gratis ilimitado, sin registro y sin cuota diaria.

✕ Lo que NO hace

  • No es VAD de calidad ML: en audio muy ruidoso (cafetería, calle, viento), los picos de ruido pueden confundirse con voz. Para esos casos existe Auphonic (de pago, cloud).
  • No soporta edición multipista: solo mezclamos 2 pistas (voz + música). Para 3+ pistas o efectos por canal, usa Audacity o Reaper.
  • No normaliza loudness LUFS: no aplicamos ITU-R BS.1770 ni targets de plataforma (podcast -16 LUFS, Spotify -14 LUFS, broadcast -23 LUFS). Para eso, post-procesa con Auphonic o un limiter externo.
  • No convierte entre formatos no estándar: solo MP3 (lamejs) y WAV (wavefile). Sin OGG, FLAC, Opus ni AAC de salida (estos se reservan para v1.1.0).
  • No aplica efectos: sin EQ, sin reverb, sin noise reduction ML. Es solo ducking.
  • No elimina silencios: deja las pausas tal cual. Para "auto-cut silence" necesitas Descript o Audacity.
  • No separa voz de música: si subes una pista mezclada, no "destila" la voz. Para source separation necesitas un modelo ML dedicado.
  • Archivos >15 min en escritorio NO soportados en MVP: por UX y batería. Avisamos antes de procesar.

▣ Privacidad y seguridad

El audio se procesa 100% en tu navegador, pero el archivo queda cacheado por el Service Worker para que la herramienta funcione offline. Si compartes el dispositivo, limpia la caché del navegador (Ctrl+Shift+Del → "Archivos en caché") después de usar esta herramienta. No usamos cookies, no usamos localStorage con datos personales, no hacemos tracking propio. La única telemetría es Google AdSense + Funding Choices, que respetan Consent Mode v2 y se desactivan hasta que tú confirmes el consentimiento.

◉ Compatibilidad de navegadores

  • Chrome / Edge / Brave 90+: soporte completo. AudioWorklet, OfflineAudioContext, File System Access API, todos los formatos.
  • Firefox 100+: soporte completo excepto File System Access API (usa el fallback <a download>).
  • Safari macOS 14.1+: soporte completo, pero FLAC y OGG tienen restricciones. WAV y MP3 funcionan siempre.
  • Safari iOS 14.5+: lamejs rinde ~3x realtime; limitamos a 5 min por batería y UX.
  • Android Chrome 90+: lamejs ~5x realtime; 5-10 min de audio se procesan correctamente.
  • Requisito obligatorio: HTTPS (Web Audio API requiere contexto seguro).

◈ Comparativa honesta con la competencia

Hemos analizado 9 alternativas: 4 directas (AudioKit Podcast Music Mixer, ende.app Podcast Automixer, Audacity desktop, Auphonic cloud) y 5 secundarias (Adobe Podcast Enhance, Krisp, Descript, VEED.io, Kapwing). El hueco claro que cubrimos: bundle ligero (~67 KB gz vs ~30 MB de ffmpeg.wasm), en español nativo, gratis ilimitado sin cuota diaria y 100% local sin uploads. AudioKit y ende.app ofrecen funciones similares pero cargan ffmpeg.wasm (10-30 segundos de carga inicial) y limitan a 5 mezclas/día gratis. Auphonic es superior en calidad ML pero sube tus archivos a la nube y cobra a partir de 2 horas/mes. Audacity es la referencia desktop pero requiere instalación y curva de aprendizaje.

§ Licencias de terceros

  • lamejs 1.2.1 LGPL 2.1 © zhuker. Encoder MP3 puro JavaScript. LGPL permite uso en web estática sin abrir el código propio, siempre que se mantenga la atribución y el archivo no se modifique. Lo respetamos: vendor no ofuscado, atribución visible aquí.
  • wavefile 11.0.0 MIT © rochars. Encoder/decoder WAV puro JavaScript. MIT permite uso comercial sin restricciones, solo requiere mantener el aviso de copyright.
  • Web Audio API: nativa del navegador, sin licencia.

⚠ Limitaciones técnicas

  • Duración máxima recomendada: 15 min en escritorio, 5 min en móvil (límite de UX/batería, no tecnológico).
  • Memoria pico: ~350 MB para 10 min de audio (3 AudioBuffers simultáneos).
  • Sample rate de salida: 44.1 kHz fijo. Para 48 kHz necesitas post-procesar.
  • Bit depth WAV: 16-bit PCM. Sin 24-bit en MVP.
  • MP3: CBR 128/192/256 kbps. Sin VBR en MVP.
  • Tamaño máximo de archivo: 200 MB (cuota arbitraria del navegador).