Resumen
- El nuevo
draft-nygate-ippm-mrl-00cronometra desde la última muestra hablada que sale del extremo llamante hasta el inicio del audio de respuesta, con un solo reloj monótono. - Obliga a publicar MRL de ingreso y de reproducción, dispersión entre umbrales de inicio, continuidad tras el primer sonido, calibración, mezcla de turnos y el total de intentos descartados.
- Es una propuesta individual, no trabajo adoptado por IPPM ni métrica registrada; mide un intervalo del par camino-sistema, no la calidad ni la veracidad de la respuesta.
El número negativo que no debe corregirse
En una conversación natural, una breve señal de escucha puede solaparse con el final de la frase. Un sistema con segmentación agresiva puede anticipar que la persona terminó y empezar a hablar. Si el primer audio llega antes de la última muestra del estímulo, t1 - t0 es negativo. Convertirlo en cero eliminaría un comportamiento observable.
El mismo signo, sin embargo, puede nacer de otra realidad. Muchos servicios saludan al abrir la llamada. Si el detector busca desde el principio, encuentra ese saludo en vez de la respuesta a la pregunta. El borrador describe una captura donde una respuesta real de 900 ms apareció como -2085 ms por seleccionar un saludo de 800 ms. Por eso el final del audio no solicitado debe quedar marcado antes de iniciar la detección.
La diferencia resume la propuesta publicada el 7 de septiembre de 2026. Datatracker registra Mouth-to-Ear Response Latency for Conversational Voice Systems como Internet-Draft individual activo, revisión 00. El autor propone estado Informational, pero todavía pregunta si IPPM es el foro adecuado y menciona DISPATCH o Independent Submission. No solicita acción de IANA. No hay adopción, consenso, registro ni certificación de resultados.
El final de la voz del usuario es una frontera externa
MRL empieza cuando la última muestra hablada de un estímulo pregrabado sale por el punto RTP del extremo llamante. La muestra se anota fuera de línea, se ubica en su paquete RTP y se interpola dentro de la trama. El sistema probado no decide dónde empieza su propio cronómetro.
La prohibición de usar detección de actividad vocal en tiempo de ejecución es esencial. Ese detector tarda en decidir; su latencia forma parte de lo que la persona espera. Si el reloj empieza después de esa decisión, una etapa lenta queda borrada del indicador. Añadir una cola fija a la anotación produce el mismo sesgo: desplaza t0 y reduce todos los valores.
El final se observa en el mismo equipo. Las dos marcas proceden de un único reloj monótono, evitando sincronizar relojes entre llamante y servicio. El método sí incluye el camino de red: el resultado pertenece a la combinación concreta de trayecto y configuración del sistema.
Un paquete recibido todavía no es audio reproducido
El borrador exige dos resultados. Ingress MRL termina cuando llega la muestra de inicio, sin aplicar búfer. Conserva la variación de la ruta y permite ver el conjunto sistema-camino. Playout MRL termina cuando esa muestra saldría de un búfer de compensación de fluctuación con profundidad objetivo declarada. Representa mejor lo que oye la persona, pero también mide una política del cliente.
Presentar solo Ingress acorta la espera humana. Presentar solo Playout atribuye al proveedor una decisión local de almacenamiento. La pareja revela dónde vive la diferencia. Un cambio de búfer no puede hacerse pasar por una mejora del modelo.
Tampoco son equivalentes los puntos de captura. Un registro del operador puede incluir dos tramos, transcodificación y su canal de grabación; un puente añade manejo de medios; un dispositivo añade pila de audio y hardware. El informe puede declararlos, pero sin caracterizar los términos agregados solo ofrece un límite superior. No debe mezclar esos datos con mediciones en el extremo RTP.
El primer ruido puede vencer al primer argumento
El habla sintética suele crecer gradualmente. El inicio depende de cuánto debe superar el piso de ruido y durante cuánto tiempo. La propuesta fija variantes sensible, principal y estricta; la separación entre sus resultados acompaña al titular como incertidumbre del inicio. Esa información impide que un umbral favorable parezca una propiedad absoluta del producto.
Después mide continuidad. Un suspiro, una señal sonora o un “eh” pueden aparecer pronto y ser seguidos por silencio mientras el contenido se prepara. MRL conserva el primer inicio, pero dentro de los 2000 ms posteriores busca el mayor intervalo bajo el umbral. Si supera 150 ms, declara respuesta discontinua y publica un segundo inicio al comienzo del último tramo continuo.
La regla evita decidir qué audio “significa” algo, una clasificación difícil de reproducir. Al mismo tiempo, no está validada como frontera universal. El propio apéndice reconoce que los 150 y 2000 ms no proceden de un corpus real de rellenos. Los datos brutos deben permitir revisar esos valores.
La distribución necesita memoria
Cada informe identifica códec, periodo de trama, profundidad de reproducción, variantes de inicio, estímulo y su hash, sistema y configuración. Las capturas conservan cargas y tiempos brutos, no solo el resultado derivado. Una regla futura puede recalcular la misma llamada.
La calibración utiliza un respondedor de demora programada. El instrumento declara sesgo y error bajo condiciones concretas; sin calibración, cada cifra es un límite superior. Probar únicamente retrasos múltiplos del tamaño de trama puede ocultar errores de cuantización, de modo que la calibración también necesita diseño adversarial.
Los turnos no se intercambian. El primero puede cargar establecimiento de sesión, arranque en frío, cachés vacías y conexiones sin abrir. Los siguientes pueden disfrutar de contexto. Debe indicarse cuántas observaciones corresponden a cada índice, y la mezcla no puede ocultarse.
Finalmente están los descartes. Intentos, informes y descartes deben cerrar aritméticamente. Las causas de descarte viajan con el percentil. La pérdida del cuadro de inicio retrasa la detección en tramas completas y transforma la estimación en límite superior; eliminarla en silencio premiaría la fragilidad.
Rapidez, corrección y permiso son decisiones distintas
MRL no evalúa si el reconocimiento entendió, si la respuesta es cierta o si resolvió la tarea. Un sistema rápido y equivocado puede puntuar bien. Las respuestas incrementales que luego se corrigen tampoco quedan caracterizadas por el primer audio. La dirección debe mantener estas medidas en capas separadas.
La prueba activa requiere permiso. Generar tráfico contra un servicio ajeno sin autorización puede incumplir condiciones y, a escala, parecer denegación de servicio. Las capturas incluyen audio de entrada y salida, potencialmente personal o biométrico. Convienen estímulos sintéticos o consentidos, controles de acceso y retención limitada.
La aportación inmediata del borrador no es declarar un ganador. Es exigir que el número lleve su intervalo, sus elecciones y sus ausencias. Solo entonces una cifra de latencia puede convertirse en evidencia comparable en vez de autoridad simbólica.
Fuentes
- Registro actual en Datatracker
- Historial de Datatracker
- Lista de Internet-Drafts recientes
- Texto de la revisión 00
- RFC 3550: RTP
- RFC 6076: métricas de telefonía SIP
- RFC 6390: diseño de métricas nuevas
- RFC 7679: retardo unidireccional
- RFC 7799: medición activa y pasiva
- RFC 8911: registro de métricas de rendimiento
- Heng Lu sobre una especificación inicial mínima
- Heng Lu sobre capas de realidad y poder simbólico
- Heng Lu sobre la primacía del código ejecutado
Informe para miembros
Contexto ampliado del perfil
Inicia sesión con el nivel de membresía adecuado para desbloquear el informe completo y las notas de las fuentes.
Solo para Strategic Circle
Strategic Circle
Abierto a todos los lectores. Desbloquea informes de perfil después de unirte e iniciar sesión.
Únete a Strategic CircleSolo para Leadership Alliance
Leadership Alliance
Para propietarios y directivos cualificados de activos de propiedad intelectual; inicia sesión para desbloquear los informes de la alianza.
Unirse a Leadership Alliance
