Кратко
- Archie превратил удалённые каталоги FTP в индекс имён и путей, но сами файлы в индекс не копировались.
- В руководстве за май 1991 года описан ночной сбор данных с части сайтов и обновление каждого сайта примерно раз в месяц. Возраст наблюдения был частью смысла результата.
Выдача описывала прошлое наблюдение
Результат поиска легко принять за утверждение о настоящем. В случае Archie точнее считать его записью с датой: при последнем сборе каталога это имя находилось по такому пути на таком архиве. Убедительное совпадение не доказывало, что файл по-прежнему можно получить.
Archie строил индекс на данных анонимного FTP. Руководство от 20 мая 1991 года сообщает примерно о 600 известных FTP-архивах. Каждую ночь система анонимно подключалась к части из них и загружала рекурсивный список каталогов либо уже подготовленный файл со списком. Каждый сайт обновлялся приблизительно раз в месяц. Сжатые списки хранились на сервере McGill quiche.cs.mcgill.ca и были доступны интернет-сообществу по анонимному FTP. Archie не требовалось копировать программы, документы и данные из каждого архива к себе: он собирал имена и пути, по которым пользователи могли находить удалённые материалы. (Руководство Archie, 1991)
Команды показывали разницу между поисковым указателем и хранилищем файлов. prog искал имена и мог возвращать хост, путь, размер и время изменения. site печатал полный список известного архива. list сообщал время последнего обновления записи о сайте. После совпадения пользователю всё ещё нужно было подключиться к архиву и передать файл. RFC 1325 в 1992 году описывал результат как имя архива, IP-адрес и расположение файла; следующий шаг происходил на удалённом хосте. В RFC 1689 за 1994 год Archie прямо назван вторичным источником: файл пользователь забирал с архива по FTP. (RFC 1325; RFC 1689)
Между двумя сборами каталог мог измениться. Файл могли переместить, переименовать или удалить, а Archie продолжал показывать прежний список. Руководство не скрывало этот интервал полностью: команда list позволяла увидеть время обновления сайта. Но оно и не обещало при каждом запросе заново проверять удалённый сервер. Совпадение подтверждало, что имя и путь наблюдались ранее; наличие файла сейчас и возможность его использовать подтверждались только текущим состоянием архива и успешной передачей.
Покрытие тоже имело явные пределы. В руководстве сказано, что база включала только UNIX-сайты и не позволяла ограничивать поиск конкретными серверами. Это влияло не только на удобство: такие условия определяли, какие архивы попадали в индекс и что пользователь мог сравнить. Единый каталог облегчал поиск по распределённым коллекциям, но не был полным списком всех интернет-файлов и не унифицировал сами архивы.
В мае 1991 года эксплуатация уже требовала заметных ресурсов. Руководство оценивало базу примерно в 70 МБ и указывало на ощутимую нагрузку от обновлений и поиска на Sun 4/280. Archie оставался разработкой; ПО ещё не распространялось на внешние площадки, а размещение серверов в других местах относилось к долгосрочным планам. Поэтому интервал сбора, объём хранения и нагрузка запросов были одной задачей проектирования. Более частое сканирование могло сократить период устаревших записей, но увеличивало сетевую работу архивов и обработку на индексирующем сервере.
Показатели роста нельзя отрывать от дат. Таблица в работе Алана Эмтажа и Питера Дойча, представленной на зимней конференции USENIX 1992 года, датирована 30 октября 1991-го: известно 1 025 сайтов, индексировалось 886, в базе было 1 502 976 ссылок на файлы и 686 104 уникальных имени. Ссылки и уникальные имена — разные величины; одно имя не обязательно обозначало единственный объект в сети. RFC 1325 в мае 1992 года говорил примерно о 1,5 млн имён на 900 архивах и о девяти серверах Archie по всему миру. Выбор ближайшего сервера должен был снять часть нагрузки с McGill. Это подтверждает расширение точек доступа и цель распределить запросы, но не доказывает, что на каждом сервере были одинаковые или одинаково свежие списки. (Эмтаж и Дойч, статья USENIX 1992 года; RFC 1325)
В записи об Archie из RFC 1689, обновлённой 1 ноября 1993 года, указано около 27 коммерческих серверов, не все из них общедоступны. Переход от одной машины в McGill к нескольким серверам расширил доступ, но не объединил поиск и выдачу файла в одну систему полномочий. Архивариусы по-прежнему контролировали сами файлы; Archie давал датированное описание мест, где встречались их имена. (RFC 1689)
Значение Archie не в том, что центральный ответ делал удалённый файл актуальным. Сервис позволил искать публичные архивы, не претендуя на владение ими. Вместо вопроса «где может лежать файл?» возник и следующий: «когда этот путь проверяли и сможет ли архив отдать файл сейчас?». Поиск указывал дорогу к источнику, но не становился самим источником.
Источники
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров
