Resumen

  • Archie convirtió inventarios de directorios FTP remotos en nombres y ubicaciones consultables; los archivos no se trasladaban al índice.
  • El manual de mayo de 1991 describe consultas nocturnas a una parte de los sitios, pero una actualización aproximada de una vez al mes para cada uno. La antigüedad de la observación, por tanto, importaba.

La respuesta describía una observación, no el presente

Un resultado de búsqueda suele leerse como una afirmación sobre el momento actual. En Archie era más parecido a una nota fechada: ese nombre aparecía en esa ruta de ese archivo la última vez que el sistema recopiló su directorio. La diferencia podía pasar inadvertida si una coincidencia convincente se tomaba como prueba de que el fichero seguía disponible.

Archie construía el índice a partir de FTP anónimo. Un manual fechado el 20 de mayo de 1991 dice que su base conocía unos 600 sitios de archivos FTP. Cada noche, el sistema se conectaba de forma anónima a una parte de ellos para obtener una lista recursiva de directorios o, si el sitio ya la había preparado, un archivo con esa lista. Cada sitio se actualizaba aproximadamente una vez al mes. Los listados comprimidos se guardaban en quiche.cs.mcgill.ca, en McGill, y cualquiera en Internet podía recuperarlos por FTP anónimo. El rastreador no tenía que copiar a McGill todos los programas, documentos y datos de cada archivo: reunía los nombres y las rutas que permitían encontrar mejor esos recursos remotos. (Manual de Archie de 1991)

Los comandos mostraban la separación entre un índice de nombres y un servidor de archivos. prog buscaba coincidencias y podía devolver el host, la ruta, el tamaño y la fecha de modificación. site permitía consultar el listado completo de un archivo conocido. list indicaba cuándo se había actualizado por última vez el inventario de un sitio. Tras encontrar una coincidencia, todavía había que conectarse al archivo y transferir el fichero. La RFC 1325 describió el mismo paso en 1992: Archie devolvía el nombre del archivo remoto, su dirección IP y la ubicación; la acción siguiente ocurría en el host de origen. En 1994, la RFC 1689 llamó a Archie una «fuente secundaria» y explicó que el usuario descargaba el fichero del archivo mediante FTP. (RFC 1325; RFC 1689)

Esa separación le daba al índice un reloj. Un directorio podía cambiar entre dos consultas. Un fichero podía moverse, cambiar de nombre o desaparecer mientras Archie seguía mostrando la última lista que había recogido. El manual de mayo de 1991 no ocultaba por completo esa antigüedad: mostraba la fecha de actualización del sitio. Pero tampoco decía que cada resultado fuese una comprobación en vivo. Una coincidencia probaba que se había observado un nombre en una ubicación; solo el estado actual del archivo y una transferencia completada podían probar que el fichero aún estaba allí y servía.

La cobertura también tenía límites explícitos. El manual enumeraba «solo sitios UNIX» como una restricción y advertía que el usuario no podía limitar la consulta a determinados sitios. No eran simples detalles de interfaz: condicionaban qué archivos podían aparecer y qué preguntas podía responder el índice. Un directorio central facilitaba explorar una colección extensa, pero no representaba todos los ficheros de Internet ni convertía archivos diferentes en un sistema uniforme.

En mayo de 1991, mantener el servicio tenía un coste visible. El manual calculaba una base de unos 70 MB y decía que las actualizaciones y las búsquedas cargaban de forma perceptible la Sun 4/280 donde funcionaba. Archie seguía en desarrollo; todavía no se distribuía el software a otros sitios y ampliar la red de servidores era un plan a largo plazo. La frecuencia de rastreo, el almacenamiento y la carga de consultas formaban parte del mismo problema. Consultar con más frecuencia podía reducir la edad de las observaciones, pero cada rastreo consumía recursos de red en los archivos y capacidad de procesamiento en el sistema que los indexaba.

Las cifras deben conservar su fecha. La tabla del artículo de Alan Emtage y Peter Deutsch presentado en USENIX en el invierno de 1992 está fechada el 30 de octubre de 1991: Archie conocía 1.025 sitios, había indexado 886 y registraba 1.502.976 referencias de archivos frente a 686.104 nombres únicos. Las referencias y los nombres únicos no son la misma medida: un nombre no representaba necesariamente un objeto global único. En mayo de 1992, la RFC 1325 hablaba de aproximadamente 1,5 millones de nombres en unos 900 archivos y de nueve servidores Archie en todo el mundo. También decía que elegir un servidor cercano permitía aliviar parte de la carga de McGill. Eso documenta más puntos de acceso y un objetivo de reparto de carga, pero no demuestra que todos los servidores tuvieran listados idénticos o igual de recientes. (Artículo de Emtage y Deutsch, USENIX 1992; RFC 1325)

En la ficha de Archie de la RFC 1689, actualizada el 1 de noviembre de 1993, el sistema comercial rondaba los 27 servidores, algunos privados. Pasar de una máquina en McGill a más servidores amplió el acceso, pero no concentró la búsqueda y la entrega bajo una misma autoridad. Los operadores de los archivos seguían controlando los bytes. Archie reunía una descripción fechada de los lugares donde se habían visto sus nombres. (RFC 1689)

La aportación de Archie no consistió en hacer actual un fichero remoto con una respuesta central. Hizo consultables los repositorios públicos de Internet sin fingir que le pertenecían. La pregunta pasó de «¿dónde podría estar este archivo?» a «¿cuándo se observó por última vez y todavía puede servirlo ese sitio?». La búsqueda abría un camino hacia la evidencia; no era su fuente.

Fuentes