Resumo

  • draft-nygate-ippm-mrl-00, publicado em 7 de setembro, mede do último sample falado transmitido ao início do áudio de resposta com um relógio monotônico no lado chamador.
  • O relatório inclui MRL de ingresso e de playout, incerteza do limiar, continuidade depois do primeiro som, calibração, índice dos turnos e a conta completa de tentativas e descartes.
  • O texto é um Internet-Draft individual, ainda sem adoção pelo IPPM ou registro na IANA; velocidade não demonstra resposta correta, útil ou concluída.

O primeiro turno não pertence à mesma população

Uma pessoa liga e faz a primeira pergunta. Antes de responder, o serviço abre sessão, aquece modelo, preenche cache e estabelece conexões. Na segunda pergunta, parte desse trabalho já ocorreu e o contexto está disponível. Misturar os dois tempos produz uma média real, mas sem objeto operacional claro.

O rascunho Mouth-to-Ear Response Latency for Conversational Voice Systems exige que cada medição carregue o índice do turno. A distribuição deve dizer quais índices contém e quantas observações vieram de cada um. Estudos só de primeiro turno e só de estado aquecido são válidos; escondê-los na mesma curva, não.

O Datatracker registra a revisão 00 como novo Internet-Draft individual aceito em 7 de setembro de 2026. O autor indica intenção Informational, mas mantém aberta a escolha entre IPPM, DISPATCH e Independent Submission. Não há ação solicitada à IANA, adoção de grupo, consenso ou validação de benchmark. A proposta deve ser lida como método submetido a crítica.

A borda inicial vem do áudio conhecido

MRL começa no instante em que o último sample de fala de um estímulo pré-gravado é transmitido na interface RTP do chamador. Esse fim é anotado offline, associado ao pacote que o transportou e interpolado dentro do frame. O relógio não começa quando o sistema testado anuncia que detectou o fim.

Usar detecção de voz em tempo de execução esconderia o atraso do próprio detector, embora ele pertença à espera do usuário. Acrescentar uma extensão fixa ao fim da fala também empurraria t0 para frente e reduziria todos os resultados. A definição impede que uma etapa interna escolha a fronteira que a julga.

O fim t1 é observado no mesmo chamador. Um único relógio monotônico fornece as duas marcas, dispensando sincronização com o sistema testado. A rota, contudo, continua dentro do intervalo. MRL descreve uma combinação de caminho e configuração.

Valores negativos são preservados. Backchannels e endpointing agressivo podem iniciar áudio antes do fim do estímulo. Um cumprimento automático também pode gerar negativo falso caso seja confundido com resposta. Por isso, áudio não solicitado precisa terminar e ficar registrado antes da busca pelo onset.

Chegada e reprodução dividem responsabilidade

Ingress MRL para na chegada do sample inicial, sem buffering. Playout MRL para quando ele sairia de um de-jitter buffer com profundidade-alvo informada. A primeira mostra sistema e caminho com jitter; a segunda aproxima a espera audível, mas inclui a escolha local de buffer.

As duas são obrigatórias. Ingress sozinho favorece o cronômetro antes da reprodução. Playout sozinho atribui ao fornecedor uma política do cliente. Se uma muda e a outra não, a divergência ajuda a localizar o mecanismo.

O ponto de observação também viaja com o número. Captura no host, ponte, gravação de operadora e dispositivo de áudio inserem termos diferentes. Sem medição desses acréscimos, o resultado é um limite superior. Curvas de pontos distintos não formam uma única distribuição comparável.

O ruído mais cedo pode vencer a fala contínua

Áudio sintetizado cresce gradualmente; onset depende do piso de ruído, margem e duração sustentada. O rascunho define variantes sensível, principal e estrita e manda publicar a dispersão entre elas. Esse intervalo é incerteza da definição, não detalhe opcional.

Um agente pode emitir um suspiro, earcon ou “hum” enquanto prepara a resposta. O primeiro áudio fica rápido, mas uma pausa longa vem depois. Em vez de classificar significado, o método mede estrutura: nos 2000 ms posteriores ao primeiro onset, procura a maior lacuna abaixo do limiar. Acima de 150 ms, marca descontinuidade e calcula um segundo onset para o começo do segmento final contínuo.

Os valores de 150 e 2000 ms ainda são perguntas abertas. O autor diz que não foram extraídos de um corpus real de fillers. Guardar payloads e timestamps brutos permite revisar a regra sem repetir a coleta.

Sobreviventes não bastam

O relatório declara tentativas, resultados e descartes. Motivos de descarte precisam fechar a conta. Se nenhum pacote chega ou nenhum onset é encontrado, a chamada não pode simplesmente sumir. Perda do frame de início desloca a detecção por frames inteiros; o valor passa a ser limite superior e leva essa marca.

Estímulo e configuração ganham identidade: hash do áudio, codec, período do frame, alvo de buffer, parâmetros de onset, identificador do sistema e hash recomendado da configuração. Isso impede que uma troca de voz, modelo ou rota seja apresentada como continuação silenciosa da mesma série.

Calibração usa um respondedor de atraso programado. O instrumento declara viés e erro sob condições específicas. Sem calibração, registra null e trata os números como limites superiores. Testar somente atrasos alinhados ao frame pode esconder quantização, portanto o procedimento também precisa desafiar o instrumento.

Um cronômetro não julga a resposta

MRL não mede reconhecimento correto, verdade, relevância ou conclusão da tarefa. Um sistema pode errar depressa. Áudio incremental que depois é revisto tampouco fica explicado pelo primeiro onset. Cada conclusão requer seu próprio instrumento.

Também há limites de autoridade e privacidade. Chamadas ativas contra sistema alheio devem ter autorização e taxa acordada; volume elevado pode parecer negação de serviço. Capturas incluem fala humana e respostas sensíveis. Estímulo sintético ou consentido, controle de acesso e retenção limitada fazem parte da governança.

A novidade não é um campeão em milissegundos. É a tentativa de fazer o número carregar a fronteira que lhe dá sentido: ponto, relógio, buffer, onset, continuidade, configuração, turno, calibração e denominador. Só depois dessa prova duas latências podem ocupar a mesma tabela.

Fontes