要約
- 9 月 7 日公開の
draft-nygate-ippm-mrl-00は、発話刺激の最後のサンプルを送った時点から応答音の起音までを、発信側一台の単調時計で測る。 - パケット到着時の Ingress MRL とバッファ再生時の Playout MRL、起音閾値のばらつき、最初の音の後の連続性、校正、ターン別内訳、棄却分母を必須にする。
- これは個人 Internet-Draft であり、IPPM 採用文書でも登録済み尺度でもない。測るのは時間であって、答えの正しさや有用性ではない。
二本の時計を一本の順位にしない
発信アプリは RTP パケットを受け取った。しかし、再生側は揺らぎを吸収するため、その音をしばらくバッファに置く。ネットワーク入口の時刻だけを使えばサービスは速く見える。スピーカーへ出す時刻だけを使えば、端末が選んだ深いバッファまでサービスの責任に見える。
新しい Mouth-to-Ear Response Latency for Conversational Voice Systems は、この二つを Ingress MRL と Playout MRL と名付け、両方の報告を求める。Ingress は起音サンプルの到着で止まり、経路のジッターを平滑化せずに残す。Playout は明示された目標深度のバッファから出る時点で止まり、人が待つ時間に近い。片方だけでは、どの層が差を生んだか分からない。
Datatracker では、改訂 00 が 2026 年 9 月 7 日に初めて受理された個人 Internet-Draft とされる。著者は Informational を想定する一方、IPPM の範囲に入るかを問い、DISPATCH と Independent Submission も候補に挙げている。IANA への登録要求はない。したがって、これは採用済み規格や認証ではなく、検証を待つ測定提案である。
発話終了は測定対象の外から決める
開始時刻 t0 は、あらかじめ録音した刺激の最後の音声サンプルが発信側 RTP 境界を出た瞬間である。音声末尾をオフラインでサンプル単位に注釈し、RTP タイムスタンプとフレーム内位置へ対応させる。
実行中の音声活動検出に開始点を選ばせない。検出器が「話し終えた」と判断するまでの遅れは、利用者が待つ時間の一部だからだ。その判断後に計時を始めれば、遅い endpointing ほど数字から消える。固定値を末尾へ足す方法も、全結果を同じだけ不当に短くする。
終了時刻 t1 も発信側で観測し、両時刻は同じホストの単調時計から取る。異なる機械の時計合わせは不要になるが、経路遅延は残る。結果は特定の経路と受検システムの組み合わせに属する。
ホストのパケットキャプチャ、会議ブリッジ、通信事業者の録音、端末音声装置で測ることもできる。ただし、追加されたスタック、転送区間、トランスコード、バッファ、ハードウェアを明示しなければならない。量を別途特徴づけられない場合は点推定ではなく上限であり、RTP 端点の分布と混ぜられない。
「聞こえた」と「答え始めた」の間
合成音声は徐々に大きくなることがある。起音は物理的に一意の点ではなく、雑音床をどれだけ、何ミリ秒超えるかで動く。草案は sensitive、headline、strict の三条件を定め、その MRL 差を起音定義の不確かさとして公開させる。小数点以下の精度より、この幅の方が大きい場合もある。
最初の音が回答とは限らない。earcon、息継ぎ、フィラーを早く出し、その後に長い無音を置けば、first-audio は速くなる。草案は音の意味を機械判定しない。第三者が同じ捕捉データから再計算しにくいからである。
代わりに構造を見る。最初の起音後 2000 ミリ秒以内で、閾値を下回る最長区間を求める。150 ミリ秒を超えれば不連続とし、最後の連続区間の開始から二つ目の MRL を示す。最初の値を消さない点が重要だ。読者は「音を出す速さ」と「話し続けるまで」を並べて読める。
もっとも、150 と 2000 は確定した自然定数ではない。著者は実際のフィラー行動のコーパスに基づいていないと明記し、レビューを求める。原データとパラメータを残すことが、将来の修正を可能にする。
自動挨拶も分離される。質問前の音声を応答として拾えば、大きな負値がもっともらしく出る。負値自体は、予測的 endpointing や backchannel によって本当に起こり得るため、ゼロへ丸めてはならない。挨拶終了点と捕捉がなければ、両者を判別できない。
速いサンプルだけを残さない
一つの分布は、試行数、報告数、棄却数と理由を伴う。応答起音が見つからなかった通話を全て落として P95 を作れば、失敗した利用者は順位から消える。開始フレームの損失は検出をフレーム単位で遅らせるため、結果は上限になる。これは削除対象ではなく注記すべき経路状態である。
最初のターンも後続と同じではない。セッション確立、コールドスタート、空のキャッシュ、未接続の外部処理は初回に乗る。後続は会話文脈を使える。ターン番号と件数を示さずに混ぜれば、同じ製品でも都合のよい分布を作れる。
刺激音声のハッシュ、codec、フレーム周期、バッファ深度、起音条件、受検構成の識別子、校正条件も必要になる。捕捉には生のペイロードと時刻を置き、派生値だけにしない。既知遅延の参照応答器で校正されていない装置の数字は上限として扱う。
速さは正しさを継承しない
MRL が判断するのは時間だけである。認識精度、内容の真偽、関連性、タスク完了は別の測定である。早く間違えるシステムは、この尺度では好成績になり得る。最初の音声を後で訂正するストリーミング応答も、first-audio だけでは性質を表せない。
測定者の権限も必要だ。他社サービスへ無断で大量の試験通話を送れば、利用条件違反やサービス妨害と区別できなくなる。捕捉された人声と応答には個人情報や生体的意味があり得る。合成または同意済み刺激、アクセス制御、期限付き保存を設計に含めるべきだ。
この草案が持ち込むのは新しい速さの王冠ではない。計時区間、観測層、バッファ、起音、連続性、構成、ターン、棄却分母を数字から切り離さないという最低限の証拠契約である。比較の前に、二つの時計が同じ出来事を測ったことを示さなければならない。
出典
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加
