Zusammenfassung

  • Archie machte entfernte FTP-Verzeichnisinventare nach Dateinamen und Pfaden durchsuchbar, übernahm die Dateien selbst aber nicht in den Index.
  • Das Handbuch vom Mai 1991 beschreibt nächtliche Abrufe bei einem Teil der Archive, während jede einzelne Liste etwa monatlich erneuert wurde. Eine Suchantwort war deshalb immer an den Zeitpunkt der letzten Beobachtung gebunden.

Der Index kannte einen anderen Zeitpunkt als sein Nutzer

Eine Suchantwort klingt nach Gegenwart. Bei Archie war sie genauer als ein datierter Vermerk zu lesen: Dieser Name stand auf diesem Archiv unter diesem Pfad, als das System dessen Verzeichnis zuletzt erfasst hatte. Ein plausibler Treffer war noch kein Beleg dafür, dass sich die Datei weiterhin herunterladen ließ.

Archie baute seinen Index aus anonymen FTP-Verzeichnissen. Das Handbuch vom 20. Mai 1991 nennt rund 600 bekannte FTP-Archive. Jede Nacht verband sich das Datenbanksystem anonym mit einem Teil davon und holte ein rekursives Verzeichnislisting ab – oder eine Datei mit einem bereits vorbereiteten Listing. Jedes Archiv wurde ungefähr einmal im Monat aktualisiert. Die komprimierten Listen lagen auf McGills Rechner quiche.cs.mcgill.ca und waren über anonymes FTP für die Internetgemeinschaft verfügbar. Archie musste nicht sämtliche Programme, Dokumente und Daten aus den entfernten Archiven nach McGill kopieren. Es sammelte die Namen und Pfade, mit denen sich diese Bestände leichter finden ließen. (Archie-Handbuch von 1991)

Die Befehle machten den Unterschied zwischen Verzeichnisindex und Dateiserver praktisch sichtbar. prog suchte nach Namen und konnte Host, Pfad, Größe und Änderungsdatum zurückgeben. site zeigte das vollständige Listing eines bekannten Archivs. list nannte den Zeitpunkt, zu dem dessen Eintrag zuletzt aktualisiert worden war. Nach einem Treffer musste der Nutzer selbst eine Verbindung zum Archiv herstellen und die Datei übertragen. RFC 1325 beschrieb 1992 die Antwort als Archivname, IP-Adresse und Ablageort. RFC 1689 bezeichnete Archie 1994 als sekundäre Quelle: Die Datei wurde anschließend per FTP direkt vom Archiv geholt. (RFC 1325; RFC 1689)

Zwischen zwei Abrufen konnte sich ein Verzeichnis ändern. Eine Datei konnte verschoben, umbenannt oder gelöscht werden, während Archie noch das vorherige Listing anzeigte. Das Handbuch verschwieg diesen Abstand nicht vollständig; es machte den letzten Aktualisierungszeitpunkt einsehbar. Es versprach aber auch keine Live-Prüfung bei jeder Suche. Ein Treffer belegte, dass ein Name mit Pfad beobachtet worden war. Ob die Datei noch vorhanden und nutzbar war, ließ sich erst am aktuellen Archiv und mit einer erfolgreichen Übertragung feststellen.

Auch die Abdeckung hatte Grenzen. Laut Handbuch waren nur UNIX-Systeme enthalten; außerdem ließ sich eine Suche nicht auf ausgewählte Server beschränken. Das war mehr als eine Bedienungsfrage. Es bestimmte, welche Bestände im Index vorkamen und welche Vergleiche überhaupt möglich waren. Ein gemeinsamer Katalog erleichterte den Zugang zu verteilten Archiven, bildete aber weder sämtliche Internetdateien ab noch vereinheitlichte er die Archive.

Der lokale Betrieb kostete bereits 1991 spürbar Ressourcen. Das Handbuch veranschlagte die Datenbank auf rund 70 MB und beschrieb eine merkliche Last durch Aktualisierungen und Suchläufe auf der Sun 4/280. Archie galt noch als Entwicklungsprojekt; die Software wurde nicht an externe Standorte verteilt, und weitere Server standen erst auf der Planungsliste. Aktualisierungsrhythmus, Speicher und Abfragelast waren deshalb keine getrennten Fragen. Häufigere Abrufe hätten ältere Einträge verkürzen können, aber sie hätten zusätzliche Verbindungen zu den Archiven und mehr Verarbeitung am Indexserver erfordert.

Die rasch wachsenden Zahlen sind an ihre jeweiligen Stichtage gebunden. Eine Tabelle in Alan Emtages und Peter Deutschs Beitrag zur USENIX-Winterkonferenz 1992 ist auf den 30. Oktober 1991 datiert: 1.025 bekannte, 886 indexierte Sites, 1.502.976 Dateiverweise und 686.104 eindeutige Dateinamen. Verweise und eindeutige Namen messen Verschiedenes; ein Name war nicht zwingend ein weltweit eindeutiges Objekt. RFC 1325 nannte im Mai 1992 etwa 1,5 Millionen Namen auf rund 900 Archiven und neun Archie-Server weltweit. Die Wahl eines näheren Servers sollte einen Teil der Last von McGill nehmen. Das belegt mehr Zugangspunkte und ein Ziel zur Lastverteilung, aber keine identischen oder gleich frischen Listen auf allen Servern. (Emtage und Deutsch, USENIX-Beitrag 1992; RFC 1325)

Der Archie-Eintrag in RFC 1689, zuletzt am 1. November 1993 aktualisiert, nennt rund 27 kommerzielle Server, von denen nicht alle öffentlich waren. Mehr Server verbreiterten den Zugang über McGill hinaus, machten Suche und Dateiauslieferung aber nicht zu einer gemeinsamen Zuständigkeit. Die Archivbetreiber kontrollierten weiterhin die Dateien; Archie lieferte eine datierte Beschreibung der Orte, an denen ihre Namen aufgetaucht waren. (RFC 1689)

Archies Leistung bestand nicht darin, eine entfernte Datei durch eine zentrale Antwort aktuell zu machen. Der Dienst machte öffentliche Archive auffindbar, ohne zu behaupten, sie selbst zu besitzen. Aus „Wo könnte diese Datei liegen?“ wurde auch die Frage „Wann wurde dieser Pfad zuletzt gesehen, und kann das Archiv sie jetzt noch liefern?“. Die Suche führte zur Quelle; sie ersetzte die Quelle nicht.

Quellen