Resumo Executivo

  • Zakir Durumeric é professor assistente de ciência da computação na Stanford University, cofundador da Censys e principal contribuidor para o ecossistema de medição ZMap.
  • O ZMap e ferramentas relacionadas transformam respostas de sistemas voltados para a internet em evidências estruturadas sobre serviços, domínios e certificados, mas não estabelecem propriedade ou vulnerabilidade por si mesmas.
  • A Censys comercializa a medição externa contínua para análise de segurança e de superfície de ataque, tornando cobertura, atribuição, atualidade e processos de correção parte do produto.
  • A importância mais ampla de Durumeric está em tornar observáveis as falhas sistêmicas de implantação, ao mesmo tempo em que expõe os limites éticos e institucionais da medição ativa em larga escala.

Em 2013, o ZMap mudou a escala de tempo da medição da internet

Em 2013, uma equipe de pesquisa da University of Michigan demonstrou que o espaço de endereçamento IPv4 público podia ser varrido em uma única porta em menos de uma hora por meio de uma conexão de gigabits, sob condições adequadas. O feito não significou que a internet havia sido completamente mapeada. Ele mudou a rapidez com que os pesquisadores podiam fazer uma pergunta restrita a uma população muito grande e repetir o exercício com frequência suficiente para medir a mudança.

Zakir Durumeric foi um dos projetistas centrais e o principal autor nomeado do artigo original do ZMap, trabalhando com Eric Wustrow e dentro de um grupo de pesquisa mais amplo que incluía J. Alex Halderman e outros colaboradores. A varredura da internet existia muito antes do ZMap, e o projeto não foi obra de uma única pessoa. Sua contribuição foi redesenhar a medição ativa ampla em torno de velocidade, reprodutibilidade e uma separação clara entre a descoberta inicial e a análise mais profunda de protocolos.

Essa distinção é importante porque a internet pública não tem um inventário completo e atualizado continuamente. As organizações frequentemente têm uma visão imperfeita até mesmo de seus próprios sistemas. Endereços na nuvem mudam, serviços esquecidos permanecem online e a infraestrutura pode sobreviver à equipe que a criou. Nenhuma autoridade central registra cada serviço, certificado, domínio e implantação de software publicamente acessível.

A medição ativa aborda o problema de fora. Um sistema envia uma sonda controlada para um endereço ou nome selecionado e registra a resposta. Repetido em uma grande população, o método pode mostrar quão amplamente um protocolo está implantado, com que rapidez uma vulnerabilidade é corrigida, se padrões inseguros persistem ou como as práticas de certificados mudam.

A evidência resultante é poderosa e limitada. Uma varredura mostra o que um sistema apresentou a um ponto de medição durante um intervalo definido. Firewalls, roteamento de rede, anycast, balanceadores de carga, políticas geográficas e limites de taxa podem alterar o resultado. Um endereço pode representar uma plataforma de nuvem, um serviço compartilhado, uma carga de trabalho temporária ou um cliente oculto por trás de um endpoint controlado pelo provedor.

A contribuição de Durumeric não foi, portanto, uma alegação de possuir uma cópia perfeita da internet. Ele ajudou a criar um método para observar sistematicamente grandes partes de sua superfície exposta, deixando que pesquisadores e usuários decidissem o que essas observações significam.

A University of Michigan forneceu o ambiente para um tipo diferente de scanner

Durumeric concluiu seu doutorado em ciência da computação e engenharia na University of Michigan. A instituição proporcionou um ambiente onde segurança de redes, engenharia de sistemas, criptografia e pesquisa empírica da internet podiam ser combinados. Essa combinação era necessária porque a varredura em escala de internet depende de mais do que um gerador rápido de pacotes.

Um programa de medição viável precisa de acesso à rede, métodos de geração de alvos, desempenho de receptor, processamento de dados, conhecimento de protocolos e procedimentos para lidar com as organizações contatadas pela varredura. Os pesquisadores também devem escolher uma pergunta suficientemente restrita para justificar o contato com uma grande população. A engenharia e o desenho da pesquisa são inseparáveis.

Escaneadores convencionais geralmente mantêm estado para cada alvo e tentativa de conexão. Essa abordagem é apropriada quando um administrador deseja informações detalhadas sobre uma rede definida, mas torna-se custosa quando a população-alvo contém bilhões de endereços possíveis. Memória, tempos de espera e rastreamento de conexões tornam-se restrições antes que a investigação atinja a escala da internet.

O ZMap foi projetado em torno de sondagem sem estado e de alta velocidade. Para uma varredura TCP básica, ele pode transmitir um pacote cuidadosamente construído sem reter um objeto de conexão convencional para cada destino. O scanner valida as respostas que retornam e passa os resultados para um pipeline de processamento separado.

O design move, em vez de remover, a complexidade. O ZMap deve construir pacotes que possam ser reconhecidos quando as respostas retornam, distinguir respostas válidas de tráfego não relacionado e evitar que seu próprio sistema receptor se torne um gargalo. A geração de alvos deve distribuir o tráfego pelo espaço de endereçamento, em vez de direcionar uma rajada sustentada para uma única rede.

A ordenação pseudoaleatória de alvos ajuda a distribuir a carga operacional. A varredura sequencial poderia contatar todos os endereços em um grande prefixo antes de passar ao próximo, criando um fluxo concentrado em direção a uma organização. Uma permutação distribui essas sondas de forma mais ampla e permite que uma varredura seja dividida entre trabalhadores configurados corretamente sem contatar repetidamente os mesmos alvos.

A velocidade era importante porque varreduras longas criam conjuntos de dados internamente inconsistentes. Se uma pesquisa demora várias semanas, serviços podem ser criados, removidos ou reconfigurados antes que a execução termine. Uma janela de coleta mais curta oferece aos pesquisadores um instantâneo mais coerente e permite que repitam a medição após uma divulgação, mudança de política ou campanha de correção.

A velocidade também aumenta a responsabilidade. Um scanner pode alcançar muitas redes em um curto período, acionar alertas de segurança e expor defeitos em equipamentos frágeis. Limites de taxa, infraestrutura de origem identificável, páginas explicativas públicas, endereços de contato monitorados e procedimentos de exclusão pertencem, portanto, ao sistema de medição, em vez de serem medidas opcionais de relações públicas.

O scanner era apenas o primeiro estágio

Uma resposta a uma sonda básica raramente responde à pergunta de pesquisa por si mesma. Um SYN-ACK TCP pode indicar que uma porta está acessível, mas não estabelece o protocolo da aplicação, a versão do software, a configuração de segurança ou a identidade da organização que opera o serviço. A contribuição mais ampla de Durumeric reside, em parte, em tratar a varredura como um sistema de dados em estágios, em vez de um único executável.

O ZMap identifica endpoints responsivos de forma eficiente. O ZGrab, e mais tarde o ZGrab2, realizam interações mais caras na camada de aplicação contra a população menor que respondeu. Ferramentas relacionadas consultam o sistema de nomes de domínio, processam material criptográfico e avaliam certificados em relação a regras técnicas.

Essa separação torna a medição ampla mais prática. O estágio de descoberta pode usar uma interação mínima, enquanto handshakes mais profundos são reservados para sistemas relevantes ao estudo. Também melhora a reprodutibilidade, pois cada estágio pode registrar sua configuração, versão da ferramenta e saída estruturada.

O ZGrab2 pode interagir com serviços como HTTP, Transport Layer Security, Secure Shell e protocolos de email. Seus módulos estabelecem handshakes documentados e registram campos legíveis por máquina, em vez de depender de analistas para inspecionar banners individuais. Os pesquisadores podem então comparar versões de protocolos, propriedades de certificados e comportamento de serviços em grandes populações.

A evidência permanece específica à interação oferecida. Um servidor pode se comportar de maneira diferente quando recebe outra versão de protocolo, um nome de domínio via Server Name Indication, um conteúdo de requisição diferente ou uma credencial de cliente. Um balanceador de carga ou gateway de segurança pode responder em vez da aplicação subjacente. A afirmação exata é que o endpoint produziu uma resposta particular a uma sonda particular.

O ZDNS estende a mesma abordagem para o sistema de nomes. Grandes conjuntos de consultas podem ser executados por meio de um framework reproduzível e retornados como registros estruturados. Os pesquisadores podem examinar a implantação de registros, a infraestrutura autoritativa, o comportamento dos resolvedores e as dependências de domínios sem adaptar uma ferramenta de consulta de propósito geral em um sistema de lote não documentado.

Os resultados de DNS dependem do tempo, da escolha do resolvedor, do estado do cache, da geografia e da política de rede. Redes de distribuição de conteúdo geralmente direcionam clientes diferentes para endereços diferentes, enquanto servidores autoritativos podem impor limites de taxa ou respostas personalizadas. O ZDNS torna essas observações mais fáceis de coletar; não transforma uma resposta em uma propriedade permanente de um domínio.

Ferramentas criptográficas, incluindo ZCrypto e ZLint, adicionam outra camada analítica. Certificados e objetos relacionados podem ser analisados e verificados em relação a perfis técnicos definidos. Em escala, os pesquisadores podem identificar objetos malformados, chaves fracas, extensões incomuns, erros de emissão repetidos e mudanças na prática das autoridades certificadoras.

Um resultado de lint tem um significado mais restrito do que um veredicto de segurança. Algumas verificações dizem respeito à conformidade com padrões ou interoperabilidade, enquanto outras identificam condições com consequências de segurança mais diretas. A regra, o contexto do certificado, o comportamento do software e a data afetam a interpretação.

Juntas, as ferramentas formam um pipeline: descobrir um endpoint responsivo, estabelecer uma conversa de protocolo, coletar evidências estruturadas e analisar o objeto resultante. Cada estágio filtra a população e introduz suposições. O trabalho de Durumeric ajudou a tornar essas suposições repetíveis o suficiente para serem inspecionadas, em vez de ficarem ocultas dentro de uma varredura monolítica.

Evidências em escala populacional mudaram a resposta de segurança

O ecossistema ZMap tornou-se importante porque pesquisadores o usaram para conectar fraquezas de protocolos e software com implantações reais. Uma vulnerabilidade pode ser grave na teoria e rara na prática, ou tecnicamente simples e presente em milhões de sistemas. A medição em escala de internet fornece evidências sobre essa diferença.

O trabalho inicial de Durumeric incluiu estudos em larga escala de HTTPS e infraestrutura de chave pública. Varreduras amplas podiam mostrar quais versões de protocolo permaneciam em uso, como os certificados eram emitidos, onde as chaves públicas eram reutilizadas e se as mudanças de segurança recomendadas haviam alcançado os sistemas implantados. Essas perguntas não podem ser respondidas com confiabilidade por meio de alguns sites selecionados ou declarações de fornecedores.

Uma das primeiras investigações examinou as chaves criptográficas produzidas durante a falha no gerador de números aleatórios do OpenSSL no Debian, divulgada em 2008. O defeito reduziu drasticamente o espaço de chaves possível, permitindo que pesquisadores comparassem chaves públicas observadas na internet com valores fracos conhecidos. O estudo mostrou que chaves vulneráveis podiam permanecer implantadas muito tempo depois que a falha do software subjacente se tornara pública.

A lição foi além do defeito específico. A publicação de um patch ou aviso não estabelece a remediação. Chaves, certificados e sistemas podem persistir durante mudanças de pessoal, migrações e fronteiras organizacionais. A medição pode testar se uma fraqueza histórica ainda está visível, em vez de supor que a divulgação encerrou o risco.

O Heartbleed demonstrou o valor e a dificuldade da medição rápida durante um evento de segurança ativo. A vulnerabilidade do OpenSSL, divulgada em abril de 2014, podia permitir que um atacante recuperasse a memória de serviços TLS afetados sob certas condições. Pesquisadores usaram a varredura em escala de internet para estimar a exposição e monitorar como a população mudou após a divulgação.

A resposta exigiu mais do que a aplicação de patches no software. Chaves e certificados potencialmente comprometidos também precisavam ser substituídos, e as práticas de revogação eram irregulares. As evidências populacionais mostraram a diferença entre a disponibilidade de uma correção e a conclusão da remediação na infraestrutura implantada.

Testar uma vulnerabilidade pode ser mais intrusivo do que identificar uma porta aberta. Uma sonda pode exercitar o comportamento defeituoso e, em alguns casos, recuperar dados. Os pesquisadores devem restringir o que coletam, minimizar a retenção e pesar o valor público da medição contra a carga imposta aos sistemas remotos.

A pesquisa Logjam combinou análise criptográfica com evidências sobre a implantação de parâmetros Diffie-Hellman. Ela examinou configurações fracas de nível de exportação e a reutilização de grupos primos comuns, mostrando como a pré-computação cara contra um parâmetro amplamente compartilhado podia afetar muitos serviços, em vez de um único endpoint.

O DROWN expôs outra forma de dependência entre sistemas. O suporte ao protocolo obsoleto SSLv2 em um serviço podia colocar em risco conexões TLS modernas sob condições específicas, particularmente quando a mesma chave RSA era reutilizada. Dados em escala de internet ajudaram a revelar relações entre serviços que poderiam ter sido gerenciados por equipes diferentes, mas compartilhavam material criptográfico.

Esses projetos foram esforços de pesquisa coletiva, e Durumeric não deve receber crédito exclusivo por suas contribuições criptográficas ou analíticas. Sua importância reside em ajudar a criar a capacidade de medição pela qual as fraquezas teóricas dos protocolos puderam ser comparadas com a implantação em larga escala.

A investigação do Mirai estendeu essa abordagem a um ecossistema de abuso. A botnet comprometeu dispositivos conectados à internet por meio de credenciais padrão amplamente conhecidas e gerou grandes ataques de negação de serviço distribuída. Os pesquisadores combinaram varredura com análise de malware, telemetria de rede e observações da infraestrutura de ataque para estudar seu crescimento e alvos.

As respostas dos serviços podiam ajudar a identificar prováveis populações de dispositivos, mas a atribuição a produtos permanecia incerta. Banners podem ser enganosos, dispositivos podem compartilhar endereços públicos e fabricantes podem reutilizar componentes de software. A pesquisa mostrou o valor das evidências populacionais, ao mesmo tempo em que demonstrou por que um padrão de resposta não deve ser tratado como uma identidade de dispositivo inquestionável.

Nesses casos, a medição mudou a conversa sobre segurança. Os pesquisadores podiam estimar a prevalência, comparar a remediação ao longo do tempo e identificar padrões ou dependências comuns. Eles não podiam corrigir os sistemas afetados, obrigar os proprietários a agir ou garantir que cada endereço tivesse sido atribuído corretamente.

A Censys transformou um instrumento de pesquisa em um serviço comercial

A medição em escala de internet começou a adquirir um papel operacional diferente quando os dados se tornaram continuamente pesquisáveis. A Censys originou-se do ambiente de pesquisa da University of Michigan e indexou informações sobre hosts, serviços e certificados para que os usuários pudessem consultar os resultados, em vez de operar todo o pipeline de coleta eles mesmos.

Durumeric cofundou a Censys com David Adrian. A empresa desenvolveu produtos comerciais em torno de inteligência de internet, gerenciamento de superfície de ataque e investigação de ameaças. O material público associado ao perfil identifica Durumeric como fundador e CEO, além de seu cargo de docente em Stanford.

A transição de sistema de pesquisa para empresa mudou o que precisava ser mantido. Um projeto de pesquisa pode demonstrar um método e publicar um conjunto de dados. Um serviço comercial deve coletar continuamente, operar infraestrutura de armazenamento e busca, atualizar módulos de protocolo, resolver perguntas de clientes, proteger atividades sensíveis e fornecer acesso confiável.

A Censys muda a economia da visibilidade de fora para dentro. Antes que os conjuntos de dados compartilhados da internet se tornassem amplamente disponíveis, uma organização podia construir seu próprio sistema de varredura ou encomendar avaliações periódicas. Manter a coleta global, analisadores de protocolo, índices históricos e modelos de atribuição exigia engenheiros especializados e infraestrutura substancial.

Uma plataforma compartilhada distribui esse custo entre os clientes. Equipes de segurança podem pesquisar certificados, nomes de host, serviços e endereços associados à sua organização e, em seguida, comparar os resultados com inventários internos. A diferença pode revelar sistemas esquecidos, ambientes de teste expostos, serviços de terceiros e ativos criados fora dos processos normais.

O resultado permanece uma pista, e não um registro de ativo automaticamente verificado. Um endereço na nuvem pode pertencer a um provedor enquanto a aplicação pertence a um de seus clientes. Um certificado pode conter um nome corporativo antigo. Um domínio pode apontar para um fornecedor, alvo de aquisição ou serviço gerenciado. As organizações precisam reconciliar a observação de fora para dentro com contratos, contas na nuvem e registros internos de propriedade.

A empresa também comercializa evidências históricas. Investigadores de segurança muitas vezes precisam saber o que estava visível antes de um incidente, mudança de certificado ou divulgação. Um registro de quando um serviço apareceu pela primeira vez, qual certificado ele apresentou e como seu comportamento de protocolo mudou pode ajudar a reconstruir uma linha do tempo de exposição.

Os dados históricos exigem a mesma cautela das varreduras atuais. Um endpoint pode ser perdido durante um ciclo de coleta por causa de perda, manutenção ou filtragem. Uma mudança no comportamento do analisador pode criar uma tendência aparente. A ausência de um conjunto de dados não prova que um serviço estava indisponível, e a presença em um endereço não prova que a mesma organização o controla hoje.

A Censys é, portanto, melhor descrita como uma camada de evidência externa continuamente construída, e não como um inventário completo da internet. Seu valor depende da cobertura, frequência de coleta, suporte a protocolos, atribuição, procedimentos de correção e da capacidade de mostrar aos usuários como uma conclusão foi alcançada.

O problema mais difícil começa depois que um serviço responde

Encontrar um endpoint responsivo muitas vezes é mais fácil do que decidir o que ele representa. Um endereço é uma localização de rede, não uma identidade de negócio estável. Registros de roteamento podem identificar o sistema autônomo que anuncia um prefixo, enquanto os dados de registro podem identificar um titular de recurso. Nenhum desses identifica necessariamente o cliente, a aplicação ou a equipe responsável pelo serviço.

Nomes DNS, certificados, conteúdo web e banners de protocolo podem fortalecer a atribuição. Também podem ser genéricos, obsoletos ou deliberadamente enganosos. Provedores de nuvem detêm faixas de endereços usadas por milhares de clientes, e redes de distribuição de conteúdo terminam conexões em nome de organizações cujos sistemas de origem estão em outro lugar.

A atribuição, portanto, combina vários sinais e deve produzir um nível de confiança, em vez de uma resposta categórica. Aquisições, subsidiárias, contratados e provedores de serviços gerenciados tornam o problema mais difícil. Um resultado atribuído incorretamente pode desperdiçar o tempo de um cliente, direcionar mal uma divulgação ou prejudicar a reputação de uma organização que não controla o sistema.

A mesma cautela se aplica à identificação de software. Um banner pode indicar um produto e versão enquanto um fornecedor aplicou um patch de segurança sem alterar a string exibida. Um proxy reverso pode expor seu próprio software em vez da aplicação por trás dele. Um serviço pode imitar outro produto ou ser intencionalmente configurado como um honeypot.

Uma versão visível associada a uma vulnerabilidade não é prova de explorabilidade. A funcionalidade relevante pode estar desativada, um controle compensatório pode estar em vigor ou a impressão digital pode estar errada. Inversamente, uma resposta genérica pode ocultar um produto afetado. A medição apoia a priorização; a confirmação exige evidências adicionais.

O IPv6 torna a cobertura populacional mais difícil. O espaço de endereços IPv4 público é grande, mas enumerável. O IPv6 é grande demais para ser varrido endereço por endereço, então os pesquisadores constroem conjuntos de alvos candidatos a partir de DNS, dados de roteamento, certificados, traceroutes, observações passivas e padrões na atribuição de endereços.

Esses métodos introduzem viés de seleção. Sistemas ausentes de fontes de nomeação pública ou de certificados podem permanecer invisíveis. O esquema de endereçamento de um provedor pode ser mais fácil de inferir do que o de outro, enquanto endereços voltados para a privacidade ou que mudam rapidamente são difíceis de rastrear. Uma pesquisa em IPv6 geralmente descreve a população-alvo construída, em vez de todo o espaço de endereços do protocolo.

A infraestrutura de nuvem introduz uma forma diferente de instabilidade. Endereços podem ser realocados rapidamente, cargas de trabalho podem existir apenas por um curto período e serviços gerenciados podem separar o endpoint visível da organização que fornece a aplicação. Um registro que estava correto quando foi coletado pode se tornar enganoso se for apresentado sem contexto de tempo e atribuição.

Os certificados fornecem uma segunda visão da infraestrutura. Os registros públicos podem expor nomes de domínio, emissores, chaves e períodos de validade antes que um serviço seja alcançável por varredura. Quando combinados com observações de DNS e hosts, podem identificar relacionamentos que nenhuma fonte única revela.

Um certificado ainda não prova que todos os nomes listados estão ativos ou controlados pelo operador atual. Certificados podem sobreviver a serviços, incluir nomes internos ou ser emitidos durante trabalhos de implantação abandonados. A concordância entre fontes aumenta a confiança, enquanto a discordância muitas vezes expõe a limitação que precisa ser investigada.

Essa tradução de resposta de pacote para alegação organizacional é tanto o gargalo comercial quanto o analítico. Os clientes não pagam apenas para saber que um endereço respondeu. Eles precisam saber qual ativo ele pode representar, por que foi associado a eles, quando a evidência foi coletada e qual ação o resultado justifica.

A medição pode expor a dependência de infraestrutura

Uma vez que várias fontes de evidência são unidas, a medição da internet pode descrever mais do que hosts individuais. Um serviço pode depender de uma plataforma de nuvem, operador de nome de domínio, autoridade certificadora, rede de distribuição de conteúdo e provedor de identidade. A concentração dessas dependências pode ser importante mesmo quando cada serviço individual está configurado corretamente.

A pesquisa mais ampla de Durumeric examinou como os relacionamentos visíveis de infraestrutura podem ser formalizados e medidos. Registros DNS, certificados, informações de roteamento e respostas de serviço podem mostrar que grandes populações dependem de um número limitado de provedores. Uma interrupção ou mudança de política em um desses provedores pode, portanto, afetar organizações que parecem independentes.

As evidências públicas não podem revelar todos os arranjos contratuais ou operacionais. Um registro DNS mostra o provedor atual, mas não o plano de migração do cliente. Um emissor de certificado faz parte da cadeia de confiança, mas pode não ser o único emissor disponível. Um endereço na nuvem não revela se uma carga de trabalho pode fazer failover para outro lugar.

A medição pode, no entanto, tornar a concentração visível o suficiente para ser investigada. O objeto de estudo torna-se o grafo de serviços em torno de uma organização, e não apenas o endereço. Isso expande a medição ativa da pesquisa de vulnerabilidades para a economia e governança da infraestrutura digital.

A mesma capacidade pode ser mal utilizada se uma dependência visível for apresentada como controle permanente. As organizações podem mudar de fornecedor, manter backups não divulgados ou usar sistemas internos que um scanner externo não pode ver. A evidência de dependência é mais forte quando identifica um relacionamento observável e mais fraca quando alega conhecer a estratégia completa de resiliência do cliente.

A varredura responsável é um sistema operacional, não uma isenção de responsabilidade

A varredura em escala de internet contata sistemas cujos operadores não solicitaram individualmente a medição. Mesmo uma sonda tecnicamente válida e de baixo custo pode acionar um alerta de intrusão, consumir tempo da equipe ou expor um defeito em equipamento antigo. A operação responsável exige, portanto, um processo permanente, em vez de uma declaração de boas intenções.

As fontes de medição devem ser identificáveis. DNS reverso e uma página de informações públicas podem explicar o propósito do tráfego, os protocolos envolvidos e como entrar em contato com o operador. O canal de contato deve ser monitorado, e a organização precisa ter autoridade para pausar uma varredura quando um efeito inesperado é relatado.

As solicitações de exclusão criam tanto uma salvaguarda ética quanto uma limitação metodológica. Remover uma rede de futuras varreduras respeita a decisão do operador, mas cria um ponto cego. A população excluída pode ser sistematicamente diferente dos alvos restantes se redes críticas, sensíveis à segurança ou frágeis forem mais propensas a optar pela exclusão.

Os pesquisadores devem preservar a versão da lista de bloqueio e explicar como as exclusões afetam o conjunto de dados. A população precisa pode ser o espaço de endereços roteável alvo remanescente após as faixas reservadas, exclusões, falhas e restrições locais, em vez de uma alegação não qualificada sobre toda a internet pública.

A taxa é outra escolha de política. Uma fonte com largura de banda suficiente pode transmitir mais rápido do que uma rede de destino pequena ou dispositivo frágil pode receber confortavelmente. A ordenação aleatória distribui o tráfego, mas uma rede que detém um grande bloco de endereços ainda pode receber muitas sondas. Pesquisas repetidas também criam uma carga cumulativa.

O conteúdo da sonda importa mais do que o rótulo anexado à ferramenta. Um handshake básico é diferente de uma tentativa de autenticação, verificação de exploração ou requisição que recupera dados não intencionais. O ZMap fornece uma estrutura para enviar pacotes; o pesquisador ou operador escolhe a interação e assume a responsabilidade por seus efeitos.

O tratamento de reclamações também melhora a qualidade da medição. Um operador pode explicar que uma resposta veio de um middlebox, honeypot ou plataforma compartilhada. O feedback pode revelar falsas suposições no método de coleta. Um scanner que trata as organizações remotas apenas como alvos perde legitimidade e evidências úteis.

A própria infraestrutura que realiza a varredura precisa de sua própria segurança. Ela processa dados de pacotes e aplicações não confiáveis, então respostas malformadas podem atingir analisadores ou consumir recursos. As plataformas de medição precisam de validação de entrada, isolamento, gerenciamento de dependências e resposta a vulnerabilidades como qualquer outro serviço exposto.

O acesso aos sistemas de dados e de geração de pacotes também requer controle. Um scanner comprometido poderia ser redirecionado para tráfego prejudicial, enquanto um conjunto de dados roubado poderia revelar relacionamentos de infraestrutura valiosos para atacantes. Observações brutas, listas de alvos e pesquisas de clientes não devem ser tratadas como artefatos de pesquisa inofensivos.

O uso dual não pode ser removido do campo. As mesmas impressões digitais de serviço podem apoiar inventário e reconhecimento. Registros históricos podem auxiliar na reconstrução de incidentes e no planejamento de ataques. A publicação de ferramentas reduz as barreiras tanto para pesquisadores legítimos quanto para usuários abusivos.

Restringir as ferramentas de pesquisa pública não eliminaria a varredura em larga escala por atacantes capazes. O modelo de governança mais realista é preservar métodos transparentes, padrões seguros, conduta documentada e responsabilização para cada operador. Durumeric não controla todas as organizações que baixam o ZMap, assim como o desenvolvedor de um utilitário de rede não controla cada pacote gerado posteriormente com ele.

A limpeza de dados pode alterar o resultado tanto quanto a varredura

A medição em escala de internet produz registros malformados, duplicados, incompletos e contraditórios. Os pesquisadores devem decidir como lidar com retentativas, tempos de espera, redirecionamentos, certificados compartilhados, erros de protocolo e banners que não se encaixam no esquema esperado.

Essas decisões alteram a população que está sendo descrita. Um endereço pode hospedar centenas of domínios. Um serviço pode aparecer por meio de muitos endereços. Uma aplicação balanceada por carga pode retornar certificados diferentes durante a mesma pesquisa. Uma atualização de analisador pode classificar uma resposta antiga de forma diferente do software usado em um estudo anterior.

Um projeto defensável registra o pipeline de processamento de dados tão cuidadosamente quanto a configuração de geração de pacotes. Versões de ferramentas, listas de alvos, exclusões, carimbos de data/hora, comportamento de retentativa e a atrição por estágio ajudam outros pesquisadores a entender como a contagem final foi produzida.

Os requisitos de atualidade dependem do uso pretendido. Um estudo de adoção de protocolo pode tolerar instantâneos periódicos, enquanto a resposta a incidentes e o gerenciamento de superfície de ataque exigem observações mais atuais. Cada registro deve conter um horário de coleta e proveniência suficiente para distinguir uma descoberta ao vivo de um contexto histórico.

Falsos positivos e falsos negativos também têm custos operacionais diferentes. Uma atribuição falsa pode enviar uma equipe de segurança para um ativo que ela não possui. Um serviço não detectado pode deixar uma exposição real não descoberta. A pesquisa ampla pode relatar a incerteza em toda a população, enquanto a aplicação automatizada ou alertas de alta gravidade para clientes exigem evidências mais fortes.

O limiar apropriado, portanto, depende da ação anexada aos dados. Uma plataforma de busca pode expor possíveis associações para investigação. Ela não deve converter cada sinal fraco em um ativo organizacional definitivo apenas porque um resultado categórico é mais fácil de exibir.

Nenhum ponto de medição vê toda a internet

A medição ativa atinge alvos por meio das rotas, filtragem e políticas disponíveis para a rede do scanner. Uma pesquisa da América do Norte pode receber respostas diferentes de uma conduzida na Ásia, África ou Oriente Médio. Geofencing, censura, anycast e hospedagem regional podem alterar o resultado observado.

Um endereço anunciado de vários locais pode retornar a instância selecionada pelo roteamento do Border Gateway Protocol para a origem do scanner. Uma mudança de rota pode alterar a resposta mesmo quando nenhuma configuração de aplicação mudou. As informações de roteamento podem ajudar a interpretar uma varredura, mas os registros do plano de controle não revelam todas as decisões de encaminhamento.

Pontos de observação distribuídos melhoram a perspectiva e aumentam o custo. Cada fonte precisa de operação segura, detalhes de contato identificáveis e conformidade com a lei e as políticas do provedor em sua jurisdição. Mais locais não criam uma visão universal; eles produzem várias visões cujas diferenças podem, elas mesmas, tornar-se evidências.

É por isso que "em escala de internet" deve descrever a amplitude do alvo, em vez de onisciência. Uma plataforma pode contatar uma grande parcela do espaço IPv4 público e ainda ver apenas a versão de cada serviço disponível a partir de seus caminhos selecionados.

A medição passiva fornece um contraste útil. Ela registra o tráfego que passa por um ponto de observação e pode mostrar como os usuários reais interagem com os protocolos. Ela é limitada aos links disponíveis para o pesquisador e pode envolver dados de usuário muito mais sensíveis do que uma sonda ativa controlada.

Os dois métodos respondem a perguntas diferentes. A varredura ativa pode mostrar quantos endpoints respondem a uma interação definida. Os dados passivos podem mostrar quanto do tráfego observado usa um protocolo. Um serviço muito usado e um milhão de serviços raramente usados produzem resultados muito diferentes sob essas medidas.

A diversidade institucional também importa. O Center for Applied Internet Data Analysis, ou CAIDA, desenvolve topologia, roteamento e infraestrutura de medição a partir de uma base institucional separada na University of California San Diego. O ecossistema ZMap concentra-se mais diretamente em serviços voltados para a internet, implantação criptográfica e infraestrutura exposta.

Os projetos podem se complementar sem compartilhar o controle organizacional. Instrumentos e conjuntos de dados independentes permitem que os pesquisadores identifiquem pontos cegos e impeçam que um coletor se torne a fonte inquestionável da verdade sobre a internet.

Stanford ampliou a agenda de medição

Durumeric é professor assistente de ciência da computação na Stanford University, onde seu trabalho abrange segurança, confiança, segurança e medição da internet. A universidade lhe dá uma nova base institucional para estudantes, colaboradores e pesquisa de longo prazo, enquanto a Censys opera o ambiente comercial de coleta e produto.

Os dois papéis são conectados, mas distintos. Espera-se que a pesquisa acadêmica produza conhecimento generalizável e resista ao escrutínio público. Uma empresa deve proteger os clientes, manter serviços, diferenciar produtos e gerar receita. A transparência sobre financiamento, afiliação e acesso aos dados é importante quando a pesquisa utiliza infraestrutura comercial.

O trabalho posterior de Durumeric se estende além de hosts expostos e implantação criptográfica. As medições ativas podem examinar a censura comparando como protocolos, domínios e serviços se comportam entre redes e regiões. Uma conexão com falha pode resultar de filtragem, roteamento, congestionamento ou política do servidor, então os estudos mais fortes usam experimentos repetidos e vários pontos de observação.

A mesma abordagem empírica se expandiu para assédio, desinformação e outros sistemas online prejudiciais. Esses assuntos envolvem pessoas, plataformas e conteúdo, em vez de apenas pacotes. Os dados podem ser mais sensíveis, e as classificações automatizadas podem afetar indivíduos vulneráveis ou o discurso político.

Essa agenda mais ampla mostra continuidade no método, em vez de uniformidade de assunto. Os pesquisadores constroem um conjunto de dados sobre um sistema distribuído, testam um comportamento observável e declaram o que a evidência pode e não pode estabelecer. As obrigações éticas aumentam quando os objetos de medição são pessoas e atividades sociais, em vez de respostas de protocolo público.

O ensino distribui a capacidade para além de um laboratório. Estudantes treinados em medição vão para universidades, empresas de segurança, instituições públicas e plataformas de tecnologia. O impacto na infraestrutura de um grupo acadêmico inclui as ferramentas e artigos que produz, mas também os pesquisadores que levam esses métodos para outros lugares.

Os prêmios de Durumeric refletem o estabelecimento do campo. Seu reconhecimento incluiu a seleção para Innovators Under 35 da MIT Technology Review em 2015 e uma Sloan Research Fellowship. Uma retrospectiva de 2024 sobre dez anos de ZMap documentou sua adoção na pesquisa acadêmica e industrial.

Os prêmios não validam todos os conjuntos de dados ou alegações comerciais. Sua importância é que a medição ativa em escala de internet passou de um experimento de sistemas incomum para um componente reconhecido da pesquisa em segurança e infraestrutura.

Ferramentas abertas e mapas proprietários agora coexistem

O ZMap e muitas ferramentas relacionadas são software de código aberto. Os pesquisadores podem inspecionar seu comportamento, reproduzir métodos e adaptar módulos sem depender totalmente de um provedor comercial. Organizações com a capacidade necessária podem operar suas próprias medições.

A disponibilidade aberta não torna a varredura em escala de internet barata ou simples. Requer acesso à rede, computação, armazenamento, engenharia de protocolo, contatos operacionais e revisão ética. Uma implantação mal gerenciada pode causar danos mesmo quando o código subjacente é público e tecnicamente sólido.

A manutenção é outro ponto de concentração. Os protocolos mudam, os analisadores precisam de correções de segurança e novos sistemas operacionais afetam o desempenho. A permissão legal para bifurcar um projeto não cria os engenheiros necessários para manter uma alternativa credível.

A Censys adiciona operação contínua, suporte ao produto, atribuição e uma interface pesquisável. A receita de assinatura pode financiar engenharia e infraestrutura que bolsas de pesquisa curtas podem não sustentar. Os clientes recebem conveniência e dependem das escolhas de coleta, cadência de atualização e modelo de dados do provedor.

A operação comercial também muda a divulgação. Uma equipe de pesquisa pode publicar métodos e conjuntos de dados selecionados, enquanto uma empresa tem motivos para proteger o enriquecimento proprietário, a atividade do cliente e a lógica do produto. A tensão não é resolvida rotulando um lado como aberto e o outro como fechado.

As perguntas relevantes são quais métodos de coleta permanecem inspecionáveis, como os erros podem ser contestados e se a pesquisa de interesse público mantém o acesso significativo. Um mapa comercial pode ser valioso sem ser aceito como uma autoridade pública neutra.

A concentração pode se tornar um problema maior à medida que equipes de segurança, governos e pesquisadores dependem de um pequeno número de provedores externos de inteligência. Dados compartilhados podem reduzir o tráfego de varredura duplicado e criar uma monocultura de medição. Se um provedor muda a cobertura ou a classificação, muitos usuários podem herdar o mesmo ponto cego.

Um sistema plural incluiria ferramentas abertas, vários coletores comerciais e acadêmicos, métodos transparentes e mecanismos de comparação. Conjuntos de dados independentes impõem custos, mas também impedem que a interpretação de uma plataforma se torne o inventário oficial de fato da internet.

Durumeric tornou a internet mais observável, não mais governável

O impacto na infraestrutura de Durumeric pode ser rastreado por vários estágios interligados. A pesquisa de sistemas redesenhou a varredura de alta velocidade; o ZMap tornou o método reutilizável; o ZGrab2, o ZDNS e as ferramentas criptográficas transformaram respostas básicas em evidências estruturadas; os estudos de segurança conectaram essas evidências a fraquezas sistêmicas; e a Censys converteu a medição contínua em um serviço usado por defensores e investigadores.

Stanford expande o programa de pesquisa para dependência de infraestrutura, censura, abuso e segurança online. Cada estágio envolve diferentes colaboradores e instituições, e nenhum deve ser reduzido à conquista de uma única pessoa.

Durumeric tem autoridade direta dentro de seu grupo de pesquisa e responsabilidade executiva na Censys, sujeito a restrições universitárias, corporativas, de conselho e legais. Ele pode influenciar questões de pesquisa, direção de produto, contratação de pessoal e a operação dos sistemas de medição.

Ele não possui os hosts, redes, domínios ou certificados registrados por esses sistemas. Ele não pode obrigar uma organização a corrigir um serviço, responder a uma divulgação ou aceitar uma atribuição. Ele não controla cada varredura realizada com o ZMap ou cada interpretação construída a partir de sua saída.

Sua autoridade é metodológica, institucional e comercial. Ele ajudou a definir como as observações podem ser coletadas e tornadas úteis em escala. As consequências permanecem distribuídas entre proprietários de sistemas, operadores de rede, provedores de nuvem, pesquisadores, clientes e instituições públicas.

Esse limite é o fato central do perfil. A medição em escala de internet pode revelar falhas sistêmicas que nenhum operador pode observar individualmente. Ela não pode fornecer a governança necessária para corrigi-las. A visibilidade pode criar pressão, evidências e responsabilização, mas a remediação ainda depende de pessoas e organizações com autoridade sobre a infraestrutura afetada.

Por que a BTW rastreia Zakir Durumeric

A BTW rastreia Durumeric porque a infraestrutura digital não pode ser protegida ou governada eficazmente quando sua superfície externamente visível é desconhecida. Seu trabalho ajudou a transformar a varredura ampla de um exercício especializado lento em uma capacidade de medição repetível usada por pesquisadores e defensores comerciais.

O mesmo trabalho expõe os limites da autoridade baseada em dados. Um mapa pode estar incompleto, desatualizado ou atribuído incorretamente. Um serviço acessível não é necessariamente vulnerável, e um endereço não é uma identidade organizacional estável. Uma plataforma de medição pode melhorar a responsabilização enquanto cria novos riscos de privacidade, uso dual e concentração.

A carreira de Durumeric é, portanto, um estudo de caso em que a medição se torna infraestrutura. A University of Michigan forneceu o ambiente de pesquisa, a comunidade ZMap criou uma base técnica reutilizável, a Censys adicionou a operação comercial contínua e Stanford apoia mais investigação e treinamento.

O resultado não é um inventário central da internet. É uma poderosa camada de evidência externa cujo valor depende de métodos transparentes, dados atuais, operação responsável e pluralidade institucional.

O próximo teste não é se a varredura pode se tornar mais rápida. É se as organizações que produzem esses mapas podem tornar as descobertas consequentes rastreáveis, corrigíveis e comparáveis, sem permitir que uma visão parcial se solidifique em verdade absoluta inquestionável.

Principais evidências e questões não resolvidas

As principais evidências para este perfil incluem registros da Stanford University, o histórico profissional e de publicações de Durumeric, a documentação do projeto ZMap, o material de liderança e produto da Censys, e estudos revisados por pares que usam o ecossistema de medição. Juntas, essas fontes estabelecem seus papéis, o design e a influência do ZMap, seu envolvimento na Censys e o programa mais amplo de pesquisa em segurança da internet.

As fontes do projeto e da empresa descrevem suas próprias ferramentas e operações. Elas não devem ser tratadas como prova independente de cobertura completa, atribuição precisa em todos os casos ou da eficácia de cada recurso de produto comercial.

As questões não resolvidas dizem respeito tanto à qualidade da medição quanto ao poder institucional. A cobertura externa continua difícil no IPv6, em sistemas de nuvem de curta duração, serviços filtrados regionalmente e redes que excluem scanners. Erros de atribuição podem afetar descobertas de pesquisa, fluxos de trabalho de clientes e alegações públicas, mas as taxas de erro abrangentes não são publicamente estabelecidas.

O desenvolvimento comercial levanta outras questões. Nem sempre está claro quais conjuntos de dados, métodos de coleta e procedimentos de correção permanecerão publicamente inspecionáveis à medida que os serviços pagos se expandem. Os coletores independentes enfrentam custos operacionais substanciais, enquanto a dependência de um único conjunto de dados compartilhado pode reduzir a diversidade metodológica.

As organizações medidas também precisam de maneiras credíveis de contestar ou corrigir registros imprecisos sem transformar a exclusão voluntária em um meio de ocultar evidências públicas legítimas. As plataformas de busca devem impedir que as mesmas capacidades usadas para defesa se tornem uma fonte de baixo custo de reconhecimento prejudicial.

Essas tensões determinarão se a medição ativa da internet se desenvolve como uma camada de evidência pública plural ou se consolida em um pequeno número de mapas proprietários.