Кратко
- В опыте с одним сервером было 254 894 985 тестов и в среднем 3,43 авторитетного запроса на тест; в последующем опыте с двумя серверами — 150 221 951 тест и 2,57 запроса.
- Доля тестов с единственным запросом выросла с 58% до 71%. Однако серии проводились отдельно и на группах разного размера, поэтому опубликованные данные не доказывают, что изменение вызвано вторым сервером.
- Следующий полезный результат — квитанция воспроизводимости: случайное назначение режимов в одном временном окне, сопоставимые сети и резолверы, неизменная авторитетная топология, открытая нормализация и временные распределения для проверки альтернатив.
Заметная разница между двумя базовыми сериями
APNIC Labs задала прикладной вопрос: меняет ли наличие двух авторитетных серверов число запросов от рекурсивных резолверов? В первой серии с одним сервером 254 894 985 тестов породили 875 316 423 запроса, в среднем 3,43 на тест. В 147 233 117 тестах — 58% по отчёту — был только один запрос.
Во второй серии с двумя серверами было 150 221 951 тест и 385 725 364 запроса, то есть 2,57 на тест. Единственный запрос наблюдался в 106 376 529 случаях, или 71%. Среди тестов с повторами их среднее число тоже снизилось: с 3,80 до 2,56.
Масштаб не позволяет игнорировать наблюдение. Поздняя серия действительно содержит меньше запросов на тест и больше одиночных обращений. Но название режима ещё не является объяснением. Автор сам называет результат неожиданным и подчёркивает, что не может дать окончательную причину.
Разный объём — не главный вопрос
Сравнение примерно 255 миллионов тестов со 150 миллионами само по себе допустимо. В больших наблюдательных массивах используют доли и нормализацию; APNIC нормализовала данные перед сравнением временных профилей. Существеннее понять, насколько совпадали условия двух запусков.
Предыдущая публикация описывает уникальные случайные имена, запросы к которым запускались через измерительные точки рекламы Google, неподписанную зону, короткие ответы без усечения, обслуживание по UDP и TCP и наблюдение в течение 24 часов. Отмечены географические различия, особенно Россия. В конфигурации с одним сервером по одному двухстековому авторитетному узлу находилось в шести зонах: Северная Америка, Южная Америка, Европа с Африкой, Индия, Азия и Китай.
Для причинного сравнения нужны ответы на дополнительные вопросы. Работали ли оба режима в одинаковые даты и часы? Сохранялась ли доля стран, сетей доступа, адресов резолверов и семейств IP? Совпадали ли размещение, маршрутизация, anycast или unicast, TTL, код и размер ответа, период учёта повторов? Нормализация выравнивает знаменатели, но не устраняет скрытую смену аудитории или сетевого пути.
Поэтому неверно говорить, что неодинаковые выборки делают опыт бесполезным. Верный вывод: квитанция режима неполна. Меньшая вторая группа может быть убедительной при прозрачном назначении и контролях; сотни миллионов наблюдений не закрывают причинность, если вместе с режимом меняются время или состав.
Форма временных кривых важнее среднего
Распределения дают более сильную подсказку. При одном сервере свыше 85% повторов приходили в первую секунду, при двух — 75%. В обеих сериях около 90% повторов укладывались в пять секунд. У двухсерверной кривой видны пики примерно на 0,75, 1,5 и 3 секундах.
В самом быстром диапазоне 17% повторов первой серии происходили менее чем за 10 миллисекунд, во второй — 12%. После нормализации основное различие оказалось между 10 и 70 миллисекундами, особенно между 10 и 40. Это короче обычного UDP-тайм-аута рекурсивного резолвера, поэтому простая схема «подождал — не получил — повторил» недостаточна.
Одна из предложенных автором гипотез — ферма резолверов. DNS-ориентированный фронтенд может распределять работу между несколькими рекурсивными узлами, и несколько узлов могут одновременно искать одно имя. PowerDNS описывает dnsdist как балансировщик перед рекурсивными серверами. Это подтверждает существование архитектуры, но не её участие в опыте APNIC. Без внутренних трасс за одним внешним адресом могут скрываться раздача по бэкендам, гонки, выбор IPv4/IPv6, состояние кэша или особенности программы.
Единого алгоритма выбора авторитетного сервера также нет. В заметках APNIC о DNS-OARC 43 описаны разные начальные оценки, обучение задержке и предпочтения IPv6 у BIND, PowerDNS Recursor, Knot Resolver и Unbound. Второе двухстековое имя добавляет варианты имён и адресов; результат зависит от реализации и топологии.
Из чего должна состоять квитанция
В повторном опыте тесты следует случайно делить между одним и двумя серверами в общем временном окне либо чередовать короткие заранее объявленные блоки. Число тестов в каждом блоке должно быть открыто, чтобы смена дня, рекламной кампании или трафика не превратилась в «эффект сервера».
В безопасных агрегатах следует показать состав по крупному региону, сети доступа, стабильному адресу резолвера и семейству IP. Цель не в идентификации пользователей, а в проверке сопоставимости групп за 58% и 71% и устойчивости результата внутри слоёв.
Вся авторитетная поверхность, кроме добавленного имени, должна оставаться неизменной: программа, содержимое зоны, TTL, DNSSEC, код и размер ответа, усечение, UDP/TCP, окно наблюдения, адреса, площадки и маршрутизация. Необходимо указать anycast или unicast. Два имени за одной площадкой проверяют не ту же отказоустойчивость, что два топологически независимых сервиса.
Наконец, нужны формула нормализации, исключения, знаменатели, исходные и нормализованные кривые и интервалы неопределённости. Отдельно стоит показать диапазоны до 10 мс, 10–70 мс, поздние пики и хвост после пяти секунд. Раздачу фронтендом, параллельность бэкендов, семейство IP, реализацию, кэш и географию кампании нужно объявить конкурирующими объяснениями до просмотра результата.
Два сервера остаются разумным минимумом по другой причине
Этот разбор не отменяет практику нескольких авторитетных серверов. RFC 2182 рекомендует физически и топологически разделённые серверы ради надёжности и распределения нагрузки. Предыдущее исследование APNIC также указывало как минимум на два разных двухстековых и географически разнообразных сервиса, причём после двух добавочная выгода в его измерениях уменьшалась.
Основание здесь — непрерывность: при отказе сервера, пути или площадки зона остаётся доступна через другой сервис. Для этого не требуется утверждать, что второй сервер всегда уменьшает среднее число рекурсивных запросов с 3,43 до 2,57. Операторы могут уже сейчас обеспечивать разнообразие ради устойчивости, но потребовать контролируемого повтора до применения коэффициента в расчётах мощности, выборе ПО или прогнозах.
Надёжный вывод узок. APNIC увидела существенный сдвиг между двумя опубликованными базовыми сериями и честно оставила механизм открытым. Общая квитанция времени, состава и топологии превратит эту неопределённость в проверяемый операционный результат.
Источники
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров
