Resumen

  • RFC 3389 definió un descriptor compacto para sustituir la transmisión continua de voz durante los intervalos inactivos: un nivel obligatorio y un modelo espectral opcional.
  • El sonido de fondo que oía el usuario se generaba en el receptor; recibir el descriptor no demostraba que la acústica de la sala remota hubiese cruzado la red.

La ausencia total de sonido es una señal extraña en una conversación. Una sala real nunca entrega ceros perfectos: respiran los ventiladores, zumba la electrónica y el micrófono recoge una textura estable. Si todo desaparece cuando el interlocutor deja de hablar, el oyente puede interpretar la eficiencia como una avería.

Enviar cada muestra de ese fondo habría mantenido la ilusión, pero también el caudal. La telefonía por paquetes buscó otra solución: dejar de codificar voz cuando el segmento era inactivo, resumir el ambiente en unos pocos parámetros y producir un sustituto en el destino.

RFC 3389, publicado en septiembre de 2002 como norma propuesta, convirtió ese resumen en una forma común para RTP. Se dirigía sobre todo a códecs sin generación de ruido de confort incorporada, como G.711, G.726, G.727, G.728 y G.722. La especificación no intentó apropiarse de todo el problema acústico.

Un detector de actividad de voz decide localmente si el segmento contiene habla activa. El sistema de transmisión discontinua decide cuándo suspender los paquetes normales y cuándo emitir información de fondo. El generador del receptor convierte esa información en muestras audibles. RFC 3389 dejó sin especificar los tres algoritmos.

Lo que sí fijó fue el objeto intermedio. El paquete CN, también llamado trama SID o descriptor de inserción de silencio, comienza con un octeto de nivel. Siete bits expresan una magnitud entre 0 y 127 en −dBov, con referencia a la sobrecarga digital; el bit superior no se usa y siempre debe ser cero. El valor 0 representa 0 dBov y el 127 representa −127 dBov.

El número describe energía. No conserva una fracción de la onda original. Dos receptores pueden recibir exactamente el mismo octeto y generar señales distintas, porque la norma garantiza el significado del parámetro, no la identidad de su resultado acústico.

Después del nivel pueden aparecer coeficientes de reflexión cuantificados. Con ellos se describe la envolvente espectral mediante un modelo todo polos. El orden del modelo se deduce de la longitud, no de otro campo. El codificador elige cuántos coeficientes convienen según calidad, complejidad, entorno y ancho de banda; el decodificador puede prescindir de los órdenes superiores.

Ese diseño prolongó una versión anterior que sólo conocía el nivel. Un receptor antiguo podía interpretar el primer byte e ignorar la información espectral añadida. Seguía siendo interoperable, aunque construyera un ruido menos parecido en color. La compatibilidad binaria no garantizaba igualdad perceptiva.

RTP trataba el ruido de confort como un códec independiente y pequeño. La marca temporal señala el comienzo del periodo descrito. El bit marcador no debería estar activado. Cada paquete contiene exactamente una carga CN por canal, porque su longitud es variable; con varios canales, todos deben usar el mismo orden espectral.

El tipo estático 13 tiene una condición frecuentemente omitida: su reloj RTP es de 8.000 Hz. Si el códec trabaja con otra frecuencia, la sesión debe elegir un tipo dinámico y anunciar la asociación, por ejemplo CN/16000. El valor 13 aislado no autoriza una interpretación universal.

Al entrar en un intervalo sin voz activa, el emisor manda un paquete CN dentro del mismo flujo. Puede actualizarlo de forma periódica o sólo cuando cambia significativamente el fondo. La cadencia es una decisión local. El receptor conserva el modelo entre mensajes y sigue produciendo su propio ambiente.

Por eso una captura debe leerse con modestia. Puede mostrar el tipo de carga, la fecha RTP, el nivel y los coeficientes. Puede demostrar que llegó una descripción válida. No demuestra que el detector identificó correctamente el habla, ni qué presión sonora recibió el micrófono, ni qué onda acabó en el altavoz remoto.

Tampoco la falta de paquetes basta para afirmar que operó CN. RFC 3389 aclara en su uso de SDP que no anunciar esta carga no impide suprimir silencio. RTP admite transmisión discontinua en cualquier formato de audio. El primer paquete posterior puede revelar una discontinuidad temporal pese a que el número de secuencia sólo aumente en uno. Pero la pérdida y la interrupción también dejan huecos. La negociación y la observación del extremo siguen siendo necesarias.

La historia posterior mostró que aquel objeto pequeño tenía otros efectos. RFC 6263 analizó paquetes CN como método para mantener asociaciones de traductores de direcciones. Advirtió que el receptor debía soportarlos, que la función debía señalizarse y que el paquete probablemente produciría ruido audible. Una herramienta de mantenimiento de red podía entrar en la experiencia humana.

RFC 6465 reutilizó la escala en −dBov para una extensión que informa el nivel de audio. La unidad común ayuda a implementar, pero no iguala las afirmaciones. Una indicación de nivel acompaña a los medios; una trama SID proporciona materia para fabricar señal cuando no se envían tramas de habla.

La especificación inicial mínima defendida por Lu Heng permite entender la frontera. Para interoperar hacían falta reglas comunes y verificables sobre nivel, coeficientes, orden, empaquetado, instante inicial, canales, nombre y reloj. No hacía falta una autoridad común sobre cada mejora futura del detector o del sintetizador. El progreso podía permanecer en el software de cada participante.

La primacía del código en ejecución impone la prueba que falta. Una norma publicada no demuestra naturalidad, ni ausencia de recortes, ni satisfacción del oyente. Esos resultados sólo aparecen cuando dos sistemas concretos ejecutan sus decisiones y alguien observa la salida. El documento coordina; la máquina produce.

RFC 3389 resolvió así una paradoja: conservar la sensación de un espacio sin transportar ese espacio. Cuando cesaron los paquetes de voz, la sala física no enmudeció. En el otro extremo surgió otra sala sonora, derivada de un nivel, quizá de un espectro y, sobre todo, de las elecciones locales de un receptor.

Fuentes