Resumo
- O Archie transformava inventários remotos de diretórios FTP em nomes e localizações pesquisáveis; os arquivos listados não eram transferidos para o índice.
- O manual de maio de 1991 descreve a coleta noturna em uma parte dos sites, mas uma atualização de cada site aproximadamente a cada mês. A idade da observação fazia parte do resultado.
Uma resposta de busca vinha com um relógio
Um resultado parece falar do presente. No Archie, era mais exato entendê-lo como um registro com data: aquele nome aparecia naquele caminho daquele arquivo na última vez em que o sistema coletou o diretório. Uma correspondência plausível não bastava para provar que o arquivo continuava disponível.
O índice era montado a partir de FTP anônimo. O manual do Archie datado de 20 de maio de 1991 informa que o banco acompanhava cerca de 600 sites de arquivos FTP. Todas as noites, o sistema se conectava anonimamente a uma parte deles e buscava uma listagem recursiva dos diretórios — ou um arquivo de listagem já preparado pelo próprio site. Cada site era atualizado aproximadamente uma vez por mês. As listas compactadas ficavam em quiche.cs.mcgill.ca, em McGill, e podiam ser obtidas pela comunidade da Internet via FTP anônimo. O serviço não precisava copiar programas, documentos e dados dos arquivos para sua própria máquina: reunia nomes e caminhos para facilitar a localização dos recursos mantidos em outros lugares. (Manual do Archie, 1991)
Os comandos separavam a consulta da entrega. prog pesquisava nomes e podia mostrar host, caminho, tamanho e data de modificação. site imprimia uma listagem completa de um arquivo conhecido. list revelava quando o inventário de um site tinha sido atualizado. Depois de encontrar a correspondência, o usuário precisava se conectar ao arquivo e transferir o conteúdo. A RFC 1325, de 1992, descreveu esse resultado como nome do arquivo, endereço IP e localização; a busca não substituía a etapa seguinte no host remoto. Em 1994, a RFC 1689 classificou o Archie como uma fonte secundária e explicou que o usuário buscava o arquivo diretamente no repositório por FTP. (RFC 1325; RFC 1689)
Essa arquitetura tinha um intervalo de atualização. O diretório podia mudar entre duas coletas. Um arquivo podia ser movido, renomeado ou removido, enquanto o índice ainda apresentava a lista anterior. O manual de maio de 1991 não escondia totalmente o intervalo: era possível consultar a data da última atualização. Mas não prometia verificar o host toda vez que alguém pesquisasse. O registro demonstrava que um nome e um caminho tinham sido vistos; apenas o estado atual do repositório e uma transferência concluída poderiam mostrar que o arquivo permanecia lá e podia ser usado.
A cobertura também tinha limites explícitos. O manual diz que só sites UNIX entravam no banco e que o usuário não podia restringir a pesquisa a sites específicos. Não era apenas uma questão de interface: isso definia o que o índice podia representar e comparar. Um diretório central facilitava a busca entre coleções distribuídas, mas não era uma imagem completa dos arquivos na Internet nem uniformizava os repositórios.
Manter o serviço também consumia recursos. Em maio de 1991, o manual estimou o banco em cerca de 70 MB e relatou que as atualizações e buscas sobrecarregavam de maneira perceptível a Sun 4/280 que o executava. O Archie ainda era experimental; o software não estava sendo distribuído para outros sites e a expansão para servidores adicionais permanecia como plano futuro. Frequência de coleta, armazenamento e carga de consulta pertenciam ao mesmo problema de engenharia. Visitar cada arquivo mais vezes poderia reduzir a idade dos registros, mas exigiria mais tráfego nos repositórios e mais trabalho no host de indexação.
Os números de crescimento têm datas diferentes. A tabela do artigo de Alan Emtage e Peter Deutsch apresentado na USENIX no inverno de 1992 retrata 30 de outubro de 1991: 1.025 sites conhecidos, 886 indexados, 1.502.976 referências a arquivos e 686.104 nomes únicos. Referências e nomes únicos não são a mesma coisa; um nome não equivale necessariamente a um objeto mundialmente único. Em maio de 1992, a RFC 1325 falava em aproximadamente 1,5 milhão de nomes em cerca de 900 repositórios e nove servidores Archie no mundo. Um comando permitia escolher um servidor mais próximo para reduzir parte da carga de McGill. Esse registro mostra a expansão dos pontos de acesso e o objetivo de distribuir a carga; não prova que todos os servidores possuíam listas idênticas ou igualmente recentes. (Artigo de Emtage e Deutsch, USENIX 1992; RFC 1325)
Na ficha de Archie da RFC 1689, atualizada em 1º de novembro de 1993, o sistema comercial contava aproximadamente 27 servidores, nem todos públicos. A passagem de uma máquina em McGill para várias ampliou o acesso, sem juntar descoberta e entrega em uma única autoridade. Os operadores continuavam a controlar os arquivos; o Archie oferecia um retrato datado dos lugares onde os nomes haviam aparecido. (RFC 1689)
A contribuição do Archie não foi tornar atual um arquivo remoto por meio de uma resposta centralizada. Foi deixar repositórios públicos mais legíveis e pesquisáveis sem fingir que pertenciam ao indexador. A pergunta deixou de ser apenas “onde esse arquivo pode estar?” e passou a incluir “quando essa localização foi observada e o repositório ainda consegue entregá-lo?”. A busca abria um caminho para a evidência; não era a fonte do arquivo.
Fontes
Briefing para membros
Contexto aprofundado do perfil
Faça login com o nível de assinatura correto para desbloquear o briefing completo e as notas das fontes.
Apenas para Strategic Circle
Strategic Circle
Aberto a todos os leitores. Desbloqueie Briefings de perfil após se inscrever e fazer login.
Junte-se ao Strategic CircleSomente para Leadership Alliance
Leadership Alliance
Para proprietários e gestores qualificados de ativos de PI; faça login para desbloquear os briefings da Leadership Alliance.
Junte-se ao Leadership Alliance
