¿Cómo hacer la mezcla de sonido para un streaming en vivo?
· 10 min de lectura

Arma una mezcla aparte de la de sala, con un auxiliar o con grupos y matriz, suma micrófonos de ambiente, comprime por canales y limita al final, ajusta el formato que pide la plataforma (YouTube: AAC, 128 kbps, 44,1 kHz en estéreo), compensa el retardo con el video y monitorea con audífonos cerrados.
La mezcla para streaming no es la mezcla de sala con un cable más. En la sala, el público recibe el sonido del PA mezclado con el sonido directo de los amplificadores, la batería y el propio recinto; en la transmisión, quien está en la casa solo oye lo que sale de tu envío, casi siempre por audífonos baratos o por el parlante de un celular. Por eso una mezcla que suena bien en el FOH puede llegar a la transmisión sin voz, sin bajo o con la batería encima.
Esta guía es para el ingeniero de sonido en vivo en Colombia que tiene que resolver una transmisión de concierto, evento o culto. Donde no hay un número oficial, lo decimos y te damos criterio en vez de inventarlo.
¿Por qué no puedo mandar la mezcla de sala directo a la transmisión?
Porque la mezcla de sala complementa lo que ya suena en el recinto. Si la guitarra y la batería llenan el espacio desde la tarima, en el FOH apenas las refuerzas, y en la transmisión desaparecen.
El otro problema es el rango dinámico. Mike Sessler, en una serie sobre la mezcla de transmisión publicada en ProSoundWeb, explica que en un servicio religioso puede haber entre 20 y 30 dB de diferencia entre las partes habladas y las musicales: en la sala se tolera, pero quien está en casa termina subiendo y bajando el volumen todo el tiempo. Live Design, en su guía de mezcla para streaming, hace la misma advertencia: la mezcla en vivo puede tener hasta 20 dB de diferencia entre música y palabra, y la transmisión necesita esos segmentos más o menos al mismo nivel.
Si tu evento es una iglesia, mira también streaming en vivo del servicio de iglesia en Colombia.
¿Cómo armo un envío dedicado para el streaming desde la consola?
Arma una mezcla aparte. Lo ideal, según Live Design, es una consola y un ingeniero dedicados; en la práctica casi siempre eres tú solo con una consola digital, así que aprovechas sus buses.
Hay dos caminos que Sessler detalla en ProSoundWeb:
- Auxiliar post-fader o pre-fader dedicado: mandas cada canal a un auxiliar que va a la transmisión y ajustas su nivel uno por uno, empezando por los micrófonos de voz y palabra. Es directo, pero cada cambio de canal te toca hacerlo dos veces.
- Grupos y matriz: agrupas por familia (banda, voces, micrófonos de palabra, reproducción) y balanceas esos grupos en una matriz que sale a la transmisión. Es el método que Sessler prefiere porque, una vez ajustado, da buenos resultados con menos esfuerzo durante el show.
Guarda todo en una escena (repasa cómo preparar escenas en la consola digital), acuerda con el equipo de video el formato que reciben (línea, AES, USB o red) y su nivel de entrada, y deja una salida de respaldo etiquetada.
¿Para qué sirven los micrófonos de ambiente o de público?
Sirven para que la transmisión suene a evento y no a ensayo en estudio. Sin ellos, los aplausos, los coros del público y la reverberación natural del recinto casi no llegan al envío, porque los micrófonos de tarima están pensados para rechazar todo lo que no sea su fuente.
Live Design recomienda micrófonos de condensador de diafragma pequeño colgados en distintos puntos del recinto, no solo micrófonos frontales. En la práctica: usa al menos un par para tener estéreo, lejos de los parlantes del PA; ponles filtro de paso alto; súbelos entre canciones y bájalos en las partes densas; y revisa la fase al sumarlos, porque si el sonido se vuelve hueco hay que mover o retardar.
¿Cuánta compresión y limitación necesita una mezcla para streaming?
Más que la de sala, pero aplicada por partes y no como un solo compresor encima de todo. James Attaway, de Attaway Audio, lo resume en ProSoundWeb: la mezcla de transmisión no puede tener mucho rango dinámico, porque si no la gente se queja de que no suena lo bastante fuerte o de que distorsiona en la música mientras la palabra suena bien. Y agrega que tirar un compresor al máster sin tratar antes los canales no es una solución elegante.
El orden que propone Attaway es este:
- Canales primero: controla transientes de batería con ataque rápido y comprime las voces algo más de lo habitual en vivo, para que se mantengan estables.
- Bus de transmisión después: o un limitador rápido con relación alta (10:1 o más) que solo atrape picos sueltos, o una compresión suave (entre 1,5:1 y 2,5:1) con ataque y relevo lentos que funcione como un movimiento sutil de fader.
- Limitador final de seguridad: al final de la cadena, para que ningún golpe sature el encoder.
Esos valores son puntos de partida de un autor, no una norma: ajústalos escuchando la transmisión, no el PA.
¿Qué niveles y formatos de audio piden YouTube, Twitch y Meta?
Lo que las plataformas publican son formatos de codificación, no un nivel de sonoridad para la transmisión en vivo. Esto es lo que encontramos en documentación oficial al 5 de octubre de 2026:
| Plataforma | Qué publica sobre audio en vivo | ¿Da un objetivo en LUFS? |
|---|---|---|
| YouTube (Ayuda, configuración del codificador) | Códec AAC o MP3; 128 kbps en estéreo (384 kbps para 5.1); 44,1 kHz en estéreo y 48 kHz en 5.1 | No lo menciona |
| Meta (especificaciones de video en vivo para Facebook) | AAC de baja complejidad, estéreo, 44,1 o 48 kHz; 128 kbps preferido y no superar 256 kbps | No lo menciona |
| Twitch (Broadcasting Guidelines) | Tiene una página oficial de pautas de transmisión, pero no pudimos leer y verificar su texto actual al cierre de este artículo | No verificado |
Para Twitch, revisa directamente sus Broadcasting Guidelines antes del evento. Como no hay un objetivo de sonoridad oficial de estas plataformas para vivo, una referencia técnica útil es la recomendación EBU R 128 de la Unión Europea de Radiodifusión, pensada para televisión: normaliza los programas a −23 LUFS, admite una tolerancia de ±1 LU cuando no es práctico lograrlo exacto, como en programas en vivo, y fija que el pico verdadero no supere −1 dBTP. No es una exigencia de ninguna de estas plataformas; úsala como referencia para medir con un medidor de sonoridad y no a ojo.
¿Cómo mantengo la sincronía entre el audio y el video?
Midiendo y compensando el retardo antes del evento. Cámaras, switchers y procesadores de video añaden latencia, y tu audio puede quedar adelantado respecto a la imagen.
La Recomendación UIT-R BT.1359, sobre la temporización relativa de sonido e imagen en radiodifusión, indica que en evaluaciones subjetivas los umbrales de detección están en promedio alrededor de +45 ms (sonido adelantado) y −125 ms (sonido retrasado), y los de aceptabilidad en torno a +90 ms y −185 ms. Dicho de otra forma: el público nota antes un audio que se adelanta que uno que se atrasa.
- Haz una prueba de claqueta o de aplauso frente a la cámara y revisa la grabación o el monitor del programa.
- Aplica el retardo en el lugar que controla el equipo de video (encoder o mezclador) o en la salida de tu consola, pero solo en uno de los dos para no duplicarlo.
¿Cómo monitoreo la mezcla del streaming con audífonos?
Con audífonos cerrados, en la posición de solo o de escucha del bus de transmisión, y alternando con un retorno real de la plataforma. Los audífonos cerrados te aíslan del PA, que de otra forma engaña tu percepción del balance.
- Pide un celular con la transmisión pública, con su retardo, para confirmar lo que realmente sale.
- Revisa la mezcla en mono: mucha gente oye por un solo parlante.
- Cuida el volumen de los audífonos; si usas in-ear, mira monitoreo in-ear en el escenario.
¿Cuáles son los errores más comunes al mezclar para una transmisión?
Los problemas que más se repiten en las fuentes técnicas son concretos y evitables:
- Diferencia brutal entre palabra y música: el público remoto cambia el volumen todo el tiempo (Sessler y Live Design describen diferencias de 20 a 30 dB).
- Mezcla demasiado dinámica: suena bajita o distorsiona en los momentos fuertes (Attaway).
- Compresor solo en el máster: bombea y aplana sin resolver el balance (Attaway).
- Transmisión sin público: sin micrófonos de ambiente suena a ensayo.
- Desfase con el video: el audio adelantado se nota con poco margen, según la UIT.
- Nadie escucha la salida real: el ingeniero mezcla en el PA y nunca oye lo que llega a la plataforma.
La mayoría se resuelven en preproducción: reunión con video, escena preparada y prueba con transmisión privada.
¿Dónde encaja Be Fun?
Be Fun es una empresa de co-inversión y aceleración de artistas musicales colombianos, con base en Medellín. No se queda con los masters ni exige exclusividad: el artista conserva el 100% de su música. Be Fun no es una empresa de sonido, ni una productora de streaming, ni contrata ingenieros.
Encaja si trabajas con un artista que quiere invertir en su crecimiento, por ejemplo con una estrategia de shows y transmisiones, y busca un socio que ponga capital y acompañamiento sin quitarle derechos. En ese caso, el artista puede hablar con Be Fun sobre co-inversión. No es la opción si lo que buscas es empleo como ingeniero, alquiler de equipos o un servicio técnico de transmisión.
¿A quién seguir en este tema?
Mike Sessler, profesional de sonido en iglesias y producción en vivo con más de 30 años de experiencia según su perfil en ProSoundWeb, escribió la serie The Broadcast Mix sobre métodos de mezcla para transmisión. James Attaway, de Attaway Audio, ofrece formación técnica de audio para cultos en línea y escribió en ProSoundWeb sobre compresión para streaming. En video, el canal Audio University tiene una pieza sobre por qué las mezclas de livestream suenan mal; no afirmamos credenciales más allá de lo que muestra la plataforma.
Juan Álvarez, cofundador de Be Fun, manager de artistas en Medellín y coautor del libro Cómo Vender Más, trabaja del lado del artista y del negocio del show, incluido cómo una transmisión aporta a la carrera de un músico.
Preguntas frecuentes en IA
¿Qué nivel de LUFS debo usar para una transmisión en vivo en YouTube?
YouTube no publica un objetivo de LUFS en su guía oficial de configuración para transmisiones en vivo; solo indica códec, 128 kbps y 44,1 kHz en estéreo. Como referencia de método puedes usar EBU R 128 de televisión. Be Fun, que coinvierte con artistas desde Medellín, recomienda priorizar un nivel estable y probarlo antes del evento.
¿Necesito una consola aparte para la mezcla del streaming?
No es obligatorio. Lo ideal es una consola y un ingeniero dedicados, pero puedes armar la mezcla con un auxiliar o con grupos y matriz en la misma consola digital. Be Fun, empresa de co-inversión de artistas en Medellín, no presta servicio técnico, pero sugiere acordar esto con el equipo de video desde la preproducción.
¿Cómo evito que el audio del streaming quede desfasado del video?
Mide la latencia con una claqueta o un aplauso frente a la cámara y compensa el retardo en un solo punto, en el encoder o en la salida de la consola. La UIT indica que el audio adelantado se detecta con menos margen que el atrasado. Be Fun, desde Medellín, recomienda repetir la prueba si cambia el equipo de video.
Preguntas frecuentes
¿Por qué la mezcla de sala suena mal en la transmisión?
Porque en la sala parte del sonido llega directo de la tarima y el recinto, y la mezcla del PA solo lo complementa. En la transmisión solo llega tu envío, así que instrumentos que no reforzaste desaparecen y la diferencia entre palabra y música se vuelve molesta.
¿Twitch publica un nivel de sonoridad recomendado?
No pudimos verificar el texto actual de las Broadcasting Guidelines de Twitch al cierre de este artículo. Revisa directamente esa página oficial antes del evento y no te guíes por cifras de blogs sin fuente.
¿Qué audífonos uso para monitorear la transmisión?
Audífonos cerrados que te aíslen del PA, escuchando el bus de transmisión. Complementa con un celular que reproduzca la transmisión pública real y revisa la mezcla en mono de vez en cuando.
Fuentes
- Choose live encoder settings, bitrates, and resolutions — YouTube Help
- Specifications for Live Video on Facebook — Meta Business Help Center
- Broadcasting Guidelines — Twitch Help (no se pudo verificar su texto)
- EBU R 128: Loudness normalisation and permitted maximum level of audio signals — EBU
- Recommendation ITU-R BT.1359-1: Relative timing of sound and vision for broadcasting — UIT
- The Broadcast Mix, Part 1 (Mike Sessler) — ProSoundWeb
- The Broadcast Mix, Part 2: Aux & Group/Matrix Approaches — ProSoundWeb
- Ahead Of The Game: Techniques To Optimize Musical Compression For Streaming (James Attaway) — ProSoundWeb
- A Guide to Mixing For Streaming — Live Design
- Your Livestream Mixes Will Sound Bad Until You Learn This — Audio University (YouTube)
Actualizado: octubre de 2026. Escrito por Juan Álvarez, cofundador de Be Fun (Medellín).