Résumé

  • Nick Feamster est professeur à l’Université de Chicago, chercheur en mesure des réseaux, bâtisseur d’institutions et co-fondateur de NetMicroscope, qui s’efforce de rendre le comportement caché d’Internet exploitable pour des décisions responsables.
  • Ses travaux sur rcc ont signalé plus de 1 000 pannes non détectées auparavant dans des configurations de 17 systèmes autonomes; la plateforme de contrôle du routage (Routing Control Platform) a contribué à établir un modèle de contrôle à l’échelle du réseau ultérieurement associé au SDN.
  • Les projets sur le spam, le haut débit, la censure et les maisons intelligentes ont également mis en évidence les limites de la mesure: la réputation peut mal classifier, les sondes distantes peuvent créer des risques et les métadonnées chiffrées peuvent révéler des comportements.
  • Ses travaux actuels en apprentissage automatique examinent si les conclusions peuvent être efficaces, auditables et sûres en production; sa contribution consiste en des systèmes collaboratifs qui préservent l’incertitude plutôt que de l’effacer.

Rcc: vérifier la configuration combinée avant le déploiement

L’article de 2005Detecting BGP Configuration Faults with Static Analysis, co-écrit avec Hari Balakrishnan, présentait un vérificateur de configuration de routeur appelé rcc. Il classait les pannes persistantes en deux grandes catégories. Les pannes de validité de route surviennent lorsque le plan de contrôle sélectionne une route qui ne correspond pas à un chemin de plan de données utilisable. Les pannes de visibilité de chemin surviennent lorsqu’un chemin utilisable existe mais que les routeurs qui en ont besoin ne l’apprennent pas. Les catégories reliaient les commandes de configuration aux conséquences qu’un opérateur pouvait reconnaître.

rcc analysait les configurations de plusieurs routeurs et vérifiait des contraintes à l’échelle du réseau. L’article rapportait l’analyse de 17 systèmes autonomes, plus de 1 000 pannes non détectées auparavant et plus de 65 téléchargements par des opérateurs. Ces chiffres sont historiques et rapportés par les auteurs. Ils ne montrent pas que rcc est devenu un produit industriel universel, et les preuves fournies n’établissent pas combien de réseaux ont continué à l’utiliser. Ils établissent que le projet a été construit à partir de configurations réelles et a atteint des opérateurs hors du laboratoire des auteurs.

L’importance opérationnelle réside dans le type de preuve produite. Un vérificateur peut pointer une relation de configuration qui viole un invariant avant une panne. C’est différent d’un tableau de bord signalant une perte de paquets après qu’un service s’est dégradé. Cela donne à l’ingénieur un lien raisonné entre une règle et une classe de défaillance. Le résultat peut soutenir la revue, les tests et la discussion entre des équipes qui n’ont autrement que des vues locales.

Les limites sont tout aussi instructives. rcc ne pouvait tester que les propriétés codées par ses concepteurs et prises en charge par son analyseur. Il ne pouvait pas connaître une intention commerciale non documentée. Il ne pouvait pas garantir l’absence de défauts de fournisseur ou de pannes physiques. Il ne pouvait pas transformer une configuration propre en preuve que le réseau ne connaîtrait jamais de problème transitoire. Un réseau peut réussir tous les contrôles écrits et néanmoins violer une exigence que personne n’a exprimée.

C’est pourquoi rcc se situe au début du profil plus large. Il a établi à la fois l’ambition et la retenue qui réapparaissent plus tard. L’ambition était de rendre le comportement de l’infrastructure calculable avant qu’un préjudice ne survienne. La retenue était que la correction est toujours relative aux entrées observées et aux propriétés énoncées. Les systèmes d’IA modernes pour l’exploitation des réseaux sont confrontés au même test, à ceci près que la frontière peut être plus difficile à voir lorsqu’un modèle produit des explications fluides plutôt que des invariants explicites.

L’Internet sait généralement ce qu’il a fait, mais ne peut pas expliquer pourquoi

Un paquet atteint sa destination ou échoue à le faire. Un appel vidéo se fige. Un domaine renvoie une adresse inattendue. Un serveur de messagerie refuse une connexion. Une enceinte connectée contacte un service distant à un moment révélateur. Chaque événement laisse des traces, mais l’Internet n’a pas de registre central qui puisse donner une explication faisant autorité. Son comportement émerge de réseaux exploités indépendamment, de configurations spécifiques aux fournisseurs, d’accords d’interconnexion privés, d’équipements domestiques, de la conception des applications et de l’évolution de la demande des utilisateurs.

Cette structure est utile parce qu’elle empêche un seul opérateur de contrôler l’ensemble du système. Elle rend aussi le diagnostic difficile. Un routeur peut montrer ses propres routes sans expliquer toutes les conséquences de la politique de routage combinée. Un test de débit peut mesurer un transfert sans isoler le Wi-Fi, la capacité d’accès, la latence, l’interconnexion et les effets de l’application. Une sonde de censure peut observer une requête échouée sans identifier la personne ou l’institution responsable.

Un classificateur de trafic peut attacher une étiquette sans prouver que cette étiquette restera exacte après un changement du réseau.

Le parcours de recherche de Feamster peut être lu comme une série de tentatives pour réduire ces écarts. Les technologies varient, mais la méthode opérationnelle est reconnaissable. D’abord, choisir un comportement caché qui importe. Ensuite, trouver un point d’observation à partir duquel le comportement laisse un signal mesurable. Troisièmement, construire une représentation qui transforme le signal en une question qu’un opérateur, un décideur ou un utilisateur peut poser. Quatrièmement, tester là où la représentation échoue.

Cette dernière étape est essentielle parce qu’un système qui produit une réponse confiante sans exposer ses limites peut rendre l’infrastructure moins responsable, et non plus.

Cela fait de Feamster un sujet d’infrastructure numérique même s’il ne possède pas de fibre, n’exploite pas de système autonome public ni ne gère de cloud hyperscale. Son travail se situe dans la couche d’information autour de ces actifs. Il influence la manière dont les routes sont vérifiées, dont les abus sont identifiés, dont la qualité du haut débit est décrite, dont la censure est documentée et dont les modèles statistiques entrent dans les opérations réseau. Les routeurs et les câbles déplacent le trafic; la mesure et l’analyse déterminent si l’on peut expliquer ce qu’ils font.

Le récit le plus solide de cette carrière n’est donc pas une succession de prix ou l’affirmation qu’un chercheur a inventé plusieurs domaines. C’est l’histoire d’un programme d’observabilité qui n’a cessé de changer d’objet tout en conservant la même discipline: distinguer ce qui était directement observé de ce qui était inféré, et distinguer un résultat expérimental d’une garantie opérationnelle.

Une carrière, plusieurs identités institutionnelles

À la date de référence de la recherche, le 3 août 2026, l’Université de Chicago identifiait Feamster comme professeur titulaire de la chaire Neubauer en informatique et directeur de la recherche au Data Science Institute. Sa propre page actuelle le citait également comme directeur du Network Operations and Internet Security Lab, co-directeur de l’Internet Innovation Initiative, co-responsable de netml.io et co-directeur du pilier IA et politique. Un article du Data Science Institute de septembre 2024 utilisait le titre de directeur de la politique technologique.

Ces descriptions peuvent coexister parce que les rôles universitaires se chevauchent et évoluent, mais elles ne doivent pas être réduites à un seul titre de poste permanent.

Les distinctions institutionnelles importent. En tant que professeur, il fait de la recherche et enseigne. Par le biais du NOISE Lab et de netml.io, il travaille avec des étudiants et des collaborateurs sur le routage, la mesure, la vie privée et l’apprentissage automatique. Grâce aux projets Internet Innovation et Internet Equity, il contribue à produire des preuves pour les décisions publiques et d’infrastructure. En tant que co-fondateur et président-directeur général de NetMicroscope, il participe à une entreprise privée cherchant à commercialiser une analyse de la qualité des réseaux.

Sa biographie indique également qu’il intervient comme témoin expert dans des litiges technologiques. Aucun de ces rôles ne confère automatiquement l’autorité d’un autre. Un professeur n’est pas un régulateur; un dirigeant de startup ne transforme pas la recherche universitaire en une caution client; une opinion d’expert n’est pas une décision de justice.

Cette séparation est cohérente avec le fond de la recherche. Les meilleurs travaux de Feamster demandent quel système détient quel élément de preuve et quelle conclusion cette preuve peut étayer. Le même soin est nécessaire pour le décrire. Sa biographie actuelle lui attribue l’écriture du premier robot d’exploration Web de LookSmart et sa contribution à la conception du premier algorithme de détection de botnet de Damballa. Ce sont des faits utiles et attribuables sur un début de parcours professionnel. Ils n’établissent pas de dates d’emploi exactes, la paternité exclusive, les parts de propriété ou un historique complet des produits.

Le dossier public est beaucoup plus riche sur le travail professionnel que sur la vie personnelle. Il n’établit pas de manière fiable sa date ou son lieu de naissance, sa citoyenneté, son milieu familial, sa rémunération, ses parts dans NetMicroscope, ses investissements personnels ou sa fortune. Un profil ancré dans les preuves disponibles ne doit pas transformer ces absences en hypothèses. La carrière est suffisamment substantielle sans la décorer d’une biographie de célébrité conventionnelle que les sources ne peuvent pas étayer.

Le MIT, un robot d’exploration et une thèse sur l’échec avant l’échec

Feamster est resté au Massachusetts Institute of Technology depuis ses études de premier cycle jusqu’au doctorat. Il a obtenu un SB en génie électrique et informatique en 2000, un MEng dans le même domaine en 2001, et un doctorat en informatique en 2005 sous la direction de Hari Balakrishnan. Le titre de la thèse —Proactive Techniques for Correct and Predictable Internet Routing— énonce clairement le programme initial. Au lieu d’attendre qu’une panne de routage provoque une interruption de service pour ensuite en reconstituer la cause, le réseau devrait exposer suffisamment de structure pour vérifier des propriétés importantes avant le déploiement.

Ses premiers travaux chez LookSmart offrent un prélude utile et limité. Un robot d’exploration Web doit découvrir un vaste graphe qui change pendant qu’il est observé. Il rencontre des liens brisés, des pages dupliquées, des réponses incohérentes et des régions inaccessibles. Le robot n’est pas directement devenu les systèmes de routage ultérieurs, et les sources n’étayent pas une telle affirmation. La continuité pertinente est méthodologique: un système distribué n’est pas visible depuis un seul point de vue local, donc une connaissance utile exige une collecte systématique et une représentation explicite de ce qui a été trouvé.

La relation avec Damballa a ajouté une version contradictoire du même problème. Les botnets étaient conçus pour obscurcir leurs membres et leur contrôle. La biographie officielle de Feamster indique qu’il a contribué à la conception du premier algorithme de détection de botnet de l’entreprise. Les preuves publiques ne reconstituent pas l’équipe complète de l’entreprise ni ne montrent comment les produits ultérieurs ont utilisé ces travaux.

Elles montrent que sa première carrière a croisé la recherche universitaire sur les systèmes et une entreprise de sécurité opérationnelle qui avait besoin de déduire une coordination malveillante à partir de traces réseau.

La recherche doctorale s’est formée dans un environnement où les politiques de routage interdomaine étaient distribuées entre les appareils et les organisations. Les opérateurs configuraient les routeurs avec des commandes qui exprimaient le peering, les relations clients, les règles d’exportation, les chemins de secours et les préférences d’ingénierie de trafic. Chaque configuration pouvait sembler raisonnable isolément tandis que le réseau combiné masquait une boucle, un trou noir ou une route non intentionnelle. Le problème n’était pas simplement une implémentation défectueuse du protocole.

C’était la difficulté de raisonner sur un programme distribué assemblé à partir de nombreuses politiques locales.

Ce cadrage est devenu une signature durable. Feamster a souvent traité le système opérationnel autour d’un algorithme comme la véritable unité de recherche. L’unité comprenait les fichiers de configuration, les points de mesure, les pipelines de données, les interfaces, les incitations des opérateurs et les contraintes institutionnelles. Cela a élargi le travail au-delà d’un théorème unique ou d’un classificateur. Cela a également créé une responsabilité plus grande: une fois qu’un système touche des opérateurs réels, des foyers ou des personnes vivant sous la censure, le déploiement et l’éthique font partie de la qualité technique.

La configuration BGP comme un programme distribué

Le protocole BGP permet aux systèmes autonomes d’échanger de la reachabilité tout en conservant le contrôle sur la politique commerciale et de routage. Cette autonomie est l’une des raisons pour lesquelles l’Internet peut relier des réseaux ayant des propriétaires et des objectifs différents. Cela signifie aussi que le résultat global n’est pas conçu par un seul ingénieur. Les politiques sont composées indirectement par le biais d’annonces, de préférences, de filtrage et de la distribution interne des routes.

À l’intérieur d’un système autonome, le problème peut encore être important. Un réseau peut avoir des centaines de routeurs et plusieurs façons de distribuer les routes externes en interne. Une route apprise à une périphérie doit devenir visible là où elle est nécessaire, mais pas nécessairement partout. La politique d’exportation doit empêcher les routes de clients ou de pairs de fuir vers le mauvais voisin. Les routes de secours doivent apparaître lorsque le chemin principal tombe en panne sans créer de boucles ou d’oscillation persistante. L’opérateur connaît l’intention commerciale, mais les appareils détiennent les fragments exécutables.

Les premiers travaux de routage de Feamster traitaient ces fragments comme un programme pouvant être analysé. C’était un changement de perspective pratique. Une configuration de routeur n’était plus simplement un texte à examiner ligne par ligne. Elle devenait une entrée pour un calcul à l’échelle du réseau.

La correction pouvait être exprimée sous forme d’invariants: une route choisie devait mener à un chemin de transfert utilisable; un chemin utilisable devait être visible pour les routeurs qui en ont besoin; la politique d’exportation devait préserver les relations voulues; la distribution interne des routes ne devait pas créer d’incohérence persistante.

L’analogie avec l’analyse logicielle était productive parce qu’elle changeait le moment de l’intervention. Le dépannage traditionnel commence après un symptôme. L’analyse statique demande si une classe connue de défaillance est déjà encodée dans la configuration. Elle n’a pas besoin d’injecter du trafic ni d’attendre qu’un client signale une panne. Pour les réseaux qui transportent des services critiques, faire passer un défaut de la file d’attente des incidents à la file d’attente de révision peut être plus précieux que de raccourcir le diagnostic post-panne.

L’analogie a aussi une limite. L’état du réseau ne se limite pas à la configuration. Il inclut les routes en direct, la topologie, le comportement des fournisseurs, la convergence transitoire, les tables matérielles, les liaisons défectueuses et des connaissances commerciales qui n’ont peut-être jamais été écrites. Un vérificateur statique peut être parfaitement exact pour le modèle qu’il possède et manquer tout de même une défaillance en dehors de ce modèle. Les recherches ultérieures de Feamster sont revenues à plusieurs reprises sur cette distinction entre une représentation utile et l’ensemble du monde opérationnel.

La plateforme de contrôle du routage a sorti les décisions des routeurs individuels

rcc demandait si la configuration distribuée satisfaisait des contraintes connues. La plateforme de contrôle du routage (RCP) posait une question différente: pourquoi chaque routeur devrait-il reconstruire indépendamment les informations nécessaires pour sélectionner les routes? Les conceptions internes traditionnelles de BGP distribuaient les routes externes via un maillage complet ou via des réflecteurs de routes. Un maillage complet devenait ingérable à mesure que les réseaux grandissaient.

La réflexion de routes améliorait l’échelle mais pouvait masquer des routes, créer des choix inattendus et rendre le résultat plus difficile à raisonner.

L’article sur RCP proposait un service centralisé logiquement qui collectait les routes BGP externes et la topologie interne, sélectionnait les routes pour les routeurs individuels et communiquait ces choix via iBGP ordinaire. Les appareils de transfert ne disparaissaient pas. Ils continuaient à transférer les paquets et à parler un protocole familier à l’interface. Ce qui changeait était l’emplacement de la logique de sélection des routes et la vue disponible pour cette logique.

« Centralisé logiquement » ne signifiait pas une boîte physique fragile unique. Le service de contrôle pouvait être répliqué et distribué tout en présentant une fonction de décision cohérente. Cette distinction est également centrale pour les réseaux définis par logiciel ultérieurs. Un contrôleur peut agir à partir d’une vue à l’échelle du réseau sans exiger que tous les processus de contrôle s’exécutent sur une seule machine. Le problème d’ingénierie devient celui de la cohérence d’état, de la reprise sur panne et des interfaces sûres, plutôt qu’un choix entre centralisation complète et distribution complète.

RCP respectait également l’infrastructure installée. Il n’exigeait pas un nouveau plan de transfert ni un remplacement immédiat de tous les routeurs. Ce choix de déploiement est important dans les réseaux dont l’équipement, les contrats et les procédures opérationnelles ne peuvent pas être changés en une fois. Une architecture de recherche gagne en valeur pratique lorsqu’elle peut entrer dans un environnement en direct par une interface que les opérateurs comprennent déjà.

L’évaluation utilisait des informations de dorsale réelles, mais les documents fournis n’établissent pas un large recensement de production. L’affirmation défendable est que RCP a démontré une architecture réalisable et est devenu influent, et non qu’il a remplacé BGP interne dans toute l’industrie. Son prix Test of Time NSDI 2015 atteste d’une importance intellectuelle durable. Il ne prouve pas l’adoption par le marché ni ne confère à un article la propriété de toutes les conceptions ultérieures de contrôleur.

Une contribution majeure au SDN, pas une histoire d’inventeur unique

Le réseau défini par logiciel (SDN) est souvent raconté comme une rupture nette: le contrôle est passé dans le logiciel, le transfert est devenu programmable, et une nouvelle ère a commencé. L’histoire réelle est moins nette. Les réseaux actifs, la virtualisation des réseaux, l’architecture 4D, Ethane, RCP, OpenFlow, NOX et d’autres projets ont abordé différents aspects de la programmabilité, de la séparation du contrôle et de la gestion à l’échelle du réseau. Feamster a été un contributeur substantiel à cette lignée, mais aucune preuve ne permet de le décrire comme l’inventeur unique du SDN.

RCP a apporté une idée architecturale claire: les décisions de route pouvaient être calculées par un service de contrôle ayant une vue plus large et livrées aux appareils de transfert existants. rcc en a apporté une autre: la politique réseau pouvait être vérifiée par rapport à des invariants. Ensemble, ils ont contribué à déplacer la question opérationnelle de « quelle commande est sur ce routeur? » vers « quel comportement le système de contrôle complet met-il en œuvre? » Ce changement est l’un des fondements intellectuels des réseaux programmables.

Feamster a ensuite co-écritThe Road to SDN, qui présentait le domaine comme une accumulation d’idées plutôt qu’un moment unique d’invention. Cette position historique est utile parce qu’elle résiste à la mythologie du fondateur qui se développe souvent autour des technologies d’infrastructure. Un domaine devient possible lorsque plusieurs groupes de recherche, opérateurs, fournisseurs et communautés de normalisation résolvent des problèmes adjacents et les rendent déployables.

L’article de prospective de 2017Why (and How) Networks Should Run Themselves, co-écrit avec Jennifer Rexford, étendait l’argument de l’architecture de contrôle à l’exploitation continue. Il décrivait des boucles fermées dans lesquelles une intention de haut niveau guide les décisions, la télémétrie révèle les résultats et le système s’adapte. Le titre était délibérément provocateur. Il ne doit pas être lu comme une preuve que les ingénieurs ne sont plus nécessaires. Un réseau auto-ajustable nécessite encore des objectifs précis, une télémétrie digne de confiance, une action sûre, des permissions contraintes et un moyen de s’arrêter lorsque les preuves sont ambiguës.

Ce programme ressemble aujourd’hui moins à une vision lointaine d’automatisation qu’à un problème de conception pour les opérations assistées par IA. Les modèles de langage peuvent suggérer des configurations, résumer des incidents et sélectionner des outils. Ils peuvent aussi inventer des causes, mal comprendre la politique ou agir avec une autorité excessive. Les premiers travaux de routage fournissent une norme exigeante pour les nouveaux systèmes: les recommandations apprises devraient être entourées de vérifications explicites et de conséquences observables, et non acceptées parce que l’explication semble plausible.

Le spam a rendu le réseau autour du message plus important que le message

À Georgia Tech, l’objet d’observation est passé des erreurs de configuration aux adversaires. Les campagnes de spam et les botnets étaient conçus pour se déplacer. Les machines compromises apparaissaient et disparaissaient, les adresses changeaient, les noms de domaine étaient remplacés et l’infrastructure de contrôle était distribuée. Les signatures de contenu pouvaient attraper un message connu, mais le système de livraison lui-même révélait souvent le motif le plus durable.

L’article SIGCOMM 2006Understanding the Network-Level Behavior of Spammersanalysait plus de dix millions de messages non sollicités selon le rapport de l’article. Il examinait où les expéditeurs apparaissaient, combien de temps ils restaient actifs et comment le spam était lié à l’espace d’adressage et au comportement de routage. L’importance de l’article n’était pas un pourcentage permanent. Il montrait que les abus pouvaient être étudiés comme une infrastructure: la population des expéditeurs, les routes, le moment et la concentration des sources pouvaient révéler une coordination que le texte du message seul ne pouvait pas.

Cette approche offrait un avantage pratique. Les caractéristiques au niveau du réseau peuvent être disponibles tôt dans une connexion, avant qu’un message complet ne soit accepté ou inspecté. Cela peut réduire le traitement et permettre à un défenseur d’agir à grande échelle. Cela peut également préserver une partie de la confidentialité de la charge utile en s’appuyant sur les métadonnées. Pourtant, la même abstraction crée un risque. Un préfixe résidentiel peut contenir des utilisateurs innocents et des appareils compromis. Un hôte partagé peut servir à la fois des noms de domaine légitimes et malveillants.

Une adresse peut changer de propriétaire. La réputation de l’infrastructure n’est utile que lorsque l’incertitude, la péremption et l’appel font partie du système.

Le travail de contre-espionnage DNSBL utilisait le comportement défensif propre d’un adversaire comme signal. Les gestionnaires de botnets vérifiaient les listes de blocage basées sur le DNS pour voir si leurs machines avaient été identifiées. Des motifs de requêtes caractéristiques pouvaient donc révéler l’appartenance probable à un botnet. L’idée était élégante parce que la reconnaissance de l’attaquant devenait une preuve. Elle restait une heuristique. Une requête pouvait avoir une cause bénigne, et une liste de bots probables nécessitait toujours une corroboration avant une action perturbatrice.

SNARE utilisait des caractéristiques spatiotemporelles et au niveau du réseau disponibles pendant un échange SMTP pour noter les expéditeurs. Son évaluation rapportait une précision d’environ 93 % à un faible taux de faux positifs. Ce chiffre appartient au jeu de données, à l’environnement de menace et au seuil de l’étude. Il ne s’agit pas d’une propriété qui survit inchangée pendant dix-sept ans. Les adversaires s’adaptent, l’infrastructure de messagerie se consolide et les distributions de caractéristiques évoluent.

Le résultat est mieux compris comme la preuve que les premiers signaux réseau pouvaient soutenir un classificateur utile, et non comme un repère permanent.

Le système de réputation DNS dynamique étendait la même logique des expéditeurs aux noms de domaine. Les motifs d’enregistrement, les serveurs de noms, les changements d’adresse et le comportement de résolution peuvent faire paraître l’infrastructure malveillante différente d’un service légitime stable. Un classificateur peut utiliser ces différences pour attribuer un risque avant que toute la charge utile ne soit connue.

La méthode préfigurait l’apprentissage automatique réseau ultérieur: construire une représentation à partir des métadonnées, entraîner une règle de décision, puis affronter les conséquences opérationnelles lorsque la représentation est incomplète.

La réputation est une décision opérationnelle, pas une étiquette objective

Le regroupement comportemental des malwares basés sur HTTP a poussé la méthode plus loin. Au lieu d’exiger une signature exacte pour chaque binaire, le système regroupait les échantillons de malwares par comportement de communication et générait des signatures réseau. Cela peut rester utile lorsque le code change mais qu’un protocole de commande, un motif de destination ou un comportement temporel persiste. Cela peut également regrouper du trafic non lié lorsque la représentation est trop grossière.

La distinction entre signal et verdict détermine la manière dont le système doit être utilisé. Un modèle peut signaler qu’une adresse, un domaine ou un flux ressemble à un abus connu. Un opérateur doit décider ce qui se passe ensuite. Un résultat de faible confiance pourrait déclencher une observation. Un résultat plus fort pourrait limiter le débit d’une connexion. Le blocage d’un préfixe ou d’un domaine entier peut imposer des coûts aux utilisateurs innocents. La conception technique inclut donc le seuil, l’âge des preuves, la portée de l’action et la voie de correction.

Les premiers travaux de Feamster chez Damballa et un brevet attribué à Georgia Tech Research Corporation montrent un contexte commercial et de propriété intellectuelle pour cette recherche. Le brevet cite Feamster avec David Dagon, Wenke Lee et d’autres inventeurs sur une méthode de détection et de réponse aux réseaux attaquants. Un brevet établit un enregistrement formel de l’inventivité et de la cession. Il n’établit pas la création exclusive, l’utilisation en production, les revenus de licence ou la validité de chaque revendication dans toutes les juridictions.

La contribution plus large a été de faire de la réputation un problème d’infrastructure plutôt qu’un simple score de précision abstrait. Un défenseur a besoin d’un classificateur qui s’exécute assez tôt, au débit de ligne disponible, avec des données pouvant être collectées légalement et avec des erreurs qui peuvent être gérées. Un article peut optimiser une partie de cette chaîne. Un système de production doit porter toute la chaîne pendant des années pendant que l’adversaire change.

C’est le pont entre le travail de sécurité et le programme actuel d’apprentissage automatique de Feamster. Les projets ultérieurs consacrent une attention plus explicite au coût des caractéristiques, à la dérive, à la vie privée et au déploiement. La question sous-jacente reste la même: lorsqu’un signal réseau est converti en une décision, quelles preuves rendent la décision suffisamment fiable pour affecter le trafic réel?

Mesurer le haut débit depuis la passerelle a changé le point d’observation

Les plaintes sur le haut débit sont simples à formuler et difficiles à diagnostiquer. « Internet est lent » peut décrire une liaison d’accès contrainte, un mauvais Wi-Fi, un appareil domestique occupé, une interconnexion encombrée, un serveur distant, un délai d’application ou un test qui ne peut pas générer assez de trafic. Les mesures effectuées depuis un ordinateur portable héritent du logiciel et du réseau local de l’ordinateur portable. Les mesures dans le cœur du fournisseur ne voient pas ce que le foyer voit.

L’approche basée sur la passerelle plaçait une mesure contrôlée à la frontière entre le domicile et le fournisseur d’accès à Internet. L’étude SIGCOMM 2011 utilisait des données longitudinales provenant de près de 4 000 passerelles dans huit FAI, au sein d’un déploiement plus large dépassant 4 200 appareils. Elle examinait le débit, la latence, les technologies d’accès et les comportements de mise en forme du trafic. L’intérêt de la passerelle était analytique: elle pouvait observer le service d’accès tout en évitant une partie de la variation incontrôlée d’un hôte final ordinaire.

Ce point d’observation ne rendait pas pour autant la réponse automatique. La passerelle domestique partage un environnement local avec les appareils et le Wi-Fi. Un serveur de mesure a son propre chemin et sa propre capacité. Les tests peuvent interférer avec le trafic domestique ou s’exécuter à des moments non représentatifs. La méthode améliorait l’attribution; elle ne créait pas une vue parfaite de l’expérience utilisateur.

BISmark a transformé la méthode de la passerelle en un banc d’essai réutilisable. L’article USENIX ATC 2014 décrivait des routeurs personnalisés et un backend capable de déployer des mesures et des applications. À la date de l’article, la plateforme fonctionnait dans des centaines de foyers répartis dans une trentaine de pays et avait été utilisée par des chercheurs de neuf institutions. Ces chiffres sont datés, mais ils montrent un travail qui s’est étendu au-delà d’un seul jeu de données.

Maintenir un banc d’essai domestique est en soi un travail d’infrastructure. Le matériel doit être expédié et pris en charge. Les utilisateurs débranchent les appareils. Le micrologiciel vieillit. Les horloges dérivent. Le consentement doit rester compréhensible. Les schémas de données et les pipelines de collecte doivent survivre aux changements dans les réseaux et les applications. Le système publié est donc une preuve de la construction d’institutions autant que de la conception de mesures.

Le programme haut débit démontre aussi pourquoi la méthode importe pour la politique. Un résultat provenant d’une passerelle contrôlée n’est pas interchangeable avec un test de navigateur, un compteur de FAI ou un niveau de service annoncé. Chacun mesure une portion différente du chemin. Les décisions publiques deviennent plus défendables lorsque la position de mesure et ses limites sont visibles plutôt que cachées derrière une vitesse en titre.

Une fois les liaisons d’accès devenues plus rapides, la vitesse a cessé d’expliquer l’expérience

Les premières politiques de haut débit se concentraient souvent sur la question de savoir si un fournisseur offrait le débit annoncé. Cette question reste importante, en particulier là où la capacité d’accès est rare. Elle devient moins explicative dès lors qu’une connexion est suffisamment rapide pour que la latence, le Wi-Fi, la diffusion de contenu et la conception des applications dominent l’expérience.

Une étude portant sur plus de 5 000 réseaux haut débit a examiné les goulets d’étranglement de performance Web et a constaté que le débit d’accès brut n’était souvent plus le seul facteur limitant au-dessus d’une fourchette propre à l’étude. Un abonnement plus rapide pouvait ne pas rendre une page plus rapide si le délai d’aller-retour, les dépendances d’objets ou le comportement du serveur contrôlaient le temps d’achèvement. Le seuil exact ne doit pas être traité comme universel. Le point durable est que la qualité devient multidimensionnelle à mesure que la liaison d’accès s’améliore.

La fiabilité ajoute une autre dimension. Un service peut avoir une vitesse médiane élevée et pourtant laisser des foyers en échec en raison de courtes pannes. Un appel vidéo, un examen ou une séance médicale à distance peuvent être perturbés par une brève perte de connectivité qui disparaît d’une moyenne mensuelle. La mesure longitudinale est nécessaire parce qu’un seul test ne peut pas décrire la fréquence, la durée et le moment des défaillances.

La recherche sur le DNS chiffré a mis en lumière un compromis similaire. Les choix de résolveur et de protocole peuvent affecter la latence, la confidentialité et l’accessibilité. Dans le panel mesuré, aucune configuration unique n’était la meilleure pour tous les utilisateurs et tous les réseaux. Une amélioration de la sécurité ou de la confidentialité peut entraîner des coûts de performance dans un environnement et pas dans un autre. Le résultat plaide contre la transformation d’un seul indicateur en prescription universelle.

Les mesures de l’ère COVID ont montré à quelle vitesse l’environnement opérationnel peut changer. Les FAI entités ont connu des changements brusques de trafic et de demande d’interconnexion, suivis d’ajouts de capacité et de modifications des schémas d’utilisation. Les résultats étaient limités aux réseaux mesurés, mais ils démontraient pourquoi la planification basée uniquement sur des moyennes historiques stables peut échouer lors d’un choc sociétal.

C’est le moment où la mesure du haut débit devient de l’ingénierie de la qualité d’expérience. Les opérateurs doivent relier des signaux de bas niveau — débit, latence, perte, pannes et interconnexion — à des résultats applicatifs tels que le gel de la vidéo et la qualité des conférences. Cette connexion est devenue plus tard une partie de la thèse produit de NetMicroscope. Les résultats académiques ne prouvent pas toutes les affirmations de l’entreprise, mais la filiation technique est directe.

La mesure de l’interconnexion a transformé un différend commercial en un problème de données partagées

Le chemin entre un foyer et une application peut traverser plusieurs frontières commerciales. Un fournisseur d’accès peut échanger du trafic directement avec un réseau de contenu, par l’intermédiaire d’un point d’échange Internet, ou via un fournisseur de transit. La congestion peut se produire sur un seul lien, dans une direction et pendant une période donnée. Les arguments publics sur « l’interconnexion » peuvent donc combiner plusieurs conditions techniquement différentes.

L’Interconnection Measurement Project demandait aux FAI entités d’installer un outil de mesure commun sur les liaisons d’interconnexion. Le projet rapportait environ 2 900 liens et une utilisation d’environ 31 % aux heures de pointe en juin 2021, ainsi que des preuves d’ajouts de capacité. Ces résultats agrégés ne prouvent pas que tous les chemins d’utilisateurs étaient sans congestion. Une moyenne de lien peut cacher un pic de courte durée, une route individuelle ou une défaillance locale. La valeur du projet était l’effort pour donner à plusieurs parties une méthode et un vocabulaire communs.

Un système de mesure commun peut réduire un type de désaccord tout en en créant un autre. Les entités doivent convenir des liens inclus, de la manière dont l’utilisation est échantillonnée, de la protection des données privées et des résumés qui peuvent être publiés. Les fournisseurs peuvent avoir des raisons commerciales de limiter la divulgation. Les chercheurs ont besoin de suffisamment de détails pour tester les affirmations sans exposer les relations clients ou la topologie sensible pour la sécurité.

Le rôle de Feamster dans ce travail est mieux décrit comme la construction de capacités de mesure et de collaboration institutionnelle. Il n’a pas réglementé les contrats d’interconnexion ni contraint la participation. Le projet illustre comment sa recherche est passée d’un instrument déployé sur une passerelle domestique à un système de preuves partagé avec les opérateurs. La tâche technique était indissociable de la gouvernance: des données utiles nécessitaient la coopération des organisations qui contrôlaient les liens.

L’équité Internet a élargi la performance à l’accès, l’abordabilité et la fiabilité

Une ligne haut débit peut exister dans un quartier tout en restant inabordable. Un foyer peut s’abonner et recevoir un service peu fiable. Un fournisseur peut respecter un débit annoncé alors que le Wi-Fi, le câblage du bâtiment ou la qualité des appareils empêchent une application de bien fonctionner. Traiter la fracture numérique comme une seule carte de couverture cache ces distinctions.

L’Internet Equity Initiative de l’Université de Chicago combine des dimensions telles que l’accessibilité, l’infrastructure, l’abordabilité, l’adoption, la performance et la fiabilité. Ses portails et projets rassemblent des mesures réseau avec des données démographiques et politiques. Des appareils domestiques à Chicago ont fourni des preuves directes sur la performance du service, tandis que des ensembles de données publics ont permis des comparaisons entre lieux et populations.

La méthode peut révéler des schémas sans en expliquer toutes les causes. Une différence entre quartiers peut être associée au revenu, au type de bâtiment, à la concurrence entre fournisseurs, au niveau d’abonnement, à l’équipement ou à l’investissement historique. Un recoupement démographique soutient l’enquête; il ne prouve pas pourquoi la différence existe. Le travail politique a besoin de la même distinction que celle exigée par les travaux de routage de Feamster: une représentation rend une question testable, mais ne remplace pas les variables manquantes.

L’Université de Chicago a rapporté en 2025 que la collaboration Internet Innovation avait fourni des travaux de mesure et d’analyse à la planification du haut débit dans l’Illinois, concernant 175 000 foyers, entreprises et sites d’ancrage communautaire non desservis. Il s’agit d’une revendication institutionnelle importante. Elle impliquait l’Illinois Broadband Lab, des responsables de l’État et d’autres partenaires. Elle ne doit pas être réécrite comme si un professeur avait personnellement connecté 175 000 emplacements, ni comme une preuve que chaque construction prévue était déjà achevée.

La progression des tests de passerelle à l’équité Internet montre comment l’utilisateur visé par la mesure a changé. Un opérateur peut utiliser un résultat de passerelle pour diagnostiquer une ligne. Une ville peut utiliser un schéma de quartier pour cibler le soutien. Un État peut utiliser des données validées dans une contestation de financement. La mesure devient plus conséquente à mesure qu’elle entre dans les décisions publiques, ce qui accroît la nécessité de définitions transparentes, de données versionnées et d’un compte rendu clair de ce qui reste incertain.

La recherche sur la censure a fait de l’observabilité une question de sécurité humaine

La censure est difficile à mesurer pour la même raison structurelle que le routage est difficile à expliquer: l’observateur voit un résultat produit par plusieurs systèmes. Un échec de résolution de domaine peut refléter un filtrage d’État, un pare-feu local, une erreur DNS ordinaire, une panne de serveur ou une instabilité de routage. Une connexion réinitialisée peut être injectée, générée par un point d’extrémité ou causée par une boîte intermédiaire sans rapport avec le contrôle politique. Le signal est rarement une déclaration signée de responsabilité.

Les enjeux sont différents parce qu’une mesure peut exposer une personne. Les chercheurs cherchent des points d’observation à l’intérieur des réseaux censurés, mais les volontaires peuvent faire face à des représailles. Les techniques à distance peuvent réduire la nécessité de recruter des entités locaux, mais elles peuvent impliquer des utilisateurs, des sites web ou des systèmes qui n’ont jamais accepté de faire partie d’une expérience. Dans ce domaine, le modèle de sécurité fait partie de l’architecture de mesure.

Le travail de Feamster a commencé avec Infranet en 2002. Le système abordait la censure comme un contournement. Des serveurs web coopérants encodaient des requêtes amont secrètes dans une activité HTTP d’apparence normale et dissimulaient des informations aval dans des images. Ses hypothèses web appartiennent à un environnement technique antérieur, mais le projet a établi une idée de longue date: la censure est en partie une compétition pour savoir quels motifs de trafic peuvent être distingués d’une communication normale.

Les travaux ultérieurs sont passés de l’aide aux utilisateurs pour franchir un blocage à la mesure du blocage lui-même. Ce changement a créé une opportunité d’intérêt public. Des mesures à grande échelle et répétables pouvaient documenter un filtrage que les gouvernements ou les opérateurs de réseau ne divulguaient pas. Il a également créé une frontière éthique plus difficile. Un système de mesure peut générer des preuves pour le public tout en imposant un risque à la machine individuelle qui produit le signal.

Cette tension n’est pas secondaire dans la carrière. C’est le cas le plus clair où le fait de faire expliquer à l’Internet lui-même peut nuire à des personnes qui n’ont jamais posé la question. La qualité éthique d’une mesure de censure dépend donc de la sélection des cibles, du consentement, des limites de débit, de la rétention des données, de la divulgation et de la plausibilité des représailles, plutôt que de la seule exactitude statistique.

Encore a montré comment l’échelle peut dépasser le consentement

Encore utilisait des requêtes navigateur cross-origin pour tester si certaines ressources web étaient accessibles depuis différents réseaux. Un site web entité pouvait amener le navigateur d’un visiteur à effectuer une requête, permettant aux chercheurs de déduire si la ressource était bloquée. La conception promettait une échelle sans installer de logiciel spécial dans chaque pays.

Le même mécanisme a créé un sérieux différend éthique. Une personne visitant une page sans rapport pouvait devenir un point d’observation de mesure sans comprendre l’expérience. Une requête vers un domaine sensible pouvait être visible par un censeur. Un site web tiers pouvait sembler sonder du matériel qu’il n’avait pas choisi. La personne qui supportait le risque et le chercheur qui recevait les données n’étaient pas nécessairement la même personne.

L’article indépendantNo Encore for Encore?soutenait que la conception soulevait des préoccupations concernant le consentement éclairé, la transparence, la sécurité des utilisateurs et le préjudice aux sites tiers. Il documentait également la communication avec Feamster et les modifications apportées au système. La critique ne doit être ni gonflée en une conclusion de faute de recherche, ni réduite à une note de bas de page que les travaux ultérieurs auraient effacée. Elle a identifié un risque de conception réel dans un système construit pour un objectif public légitime.

Feamster et Ben Jones ont ensuite publiéCan Censorship Measurements Be Safe(r)?Le titre traite correctement la sécurité comme un continuum plutôt que comme une certification binaire. La couverture, la répétabilité et l’exactitude rivalisent avec l’exposition des volontaires, des cibles et des tiers. Une mesure qui atteint de nombreux réseaux peut être moins acceptable si elle ne peut pas borner le risque imposé à chaque entité.

L’épisode a modifié le contenu intellectuel de la recherche. L’éthique n’était plus une revue externe ajoutée à une méthode technique. Les modèles de menace devaient inclure les personnes qui généraient le trafic, les organisations qui hébergeaient les tests et les autorités qui pouvaient les observer. C’est une leçon durable pour toutes les mesures d’infrastructure, d’autant plus que les navigateurs, les appareils domestiques et les agents IA sont utilisés comme capteurs distribués.

Augur, Iris et les systèmes ultérieurs ont tenté d’augmenter la couverture sans cacher le risque

Augur tentait de déduire la connectivité entre des emplacements distants par des canaux auxiliaires TCP/IP sans contrôler un point de mesure traditionnel à l’une ou l’autre extrémité. L’article rapportait une validation dans près de 180 pays pendant une période de 17 jours et incluait des choix de conception destinés à éviter d’impliquer des utilisateurs individuels. L’approche élargissait la couverture géographique, mais l’inférence dépendait du comportement du système d’exploitation, de la sélection d’adresse, de l’asymétrie du filtrage et d’hypothèses statistiques.

Iris se concentrait sur la manipulation du DNS. Des requêtes répétées vers des résolveurs pouvaient être comparées d’un emplacement à l’autre pour identifier des réponses anormales. Le DNS fournit des preuves structurées, mais les systèmes légitimes mettent également en cache, redirigent, localisent et filtrent. Une différence de réponse est un point de départ pour l’attribution, et non la preuve qu’un organisme gouvernemental particulier a émis la règle.

La construction des listes de test est devenue une autre source de biais. Un programme de mesure qui ne sonde que des sites politiques de premier plan au niveau mondial peut manquer des langues locales et des sujets culturellement spécifiques. Un projet de 2018 a utilisé le traitement du langage naturel et la recherche pour identifier 1 125 sites absents de la plus grande liste de blocage de Chine à l’époque. La liste élargie a amélioré la couverture pour cette étude; elle restait un artefact daté à mesure que les domaines, le contenu et la politique évoluaient.

GFWeb, publié à USENIX Security en 2024, a examiné le filtrage HTTP et HTTPS par le Grand Pare-feu de Chine sur 20 mois. L’article rapportait le test de 1,02 milliard de noms de domaine et l’identification de centaines de milliers de domaines de premier niveau payants affectés par différents mécanismes de filtrage. Ce sont des nombres de mesure, pas un recensement des personnes affectées. Leur valeur réside dans le fait de montrer que des tests spécifiques au protocole révèlent différentes parties d’un système de filtrage et qu’une technique peut sous-estimer.

Les recherches sur le Turkménistan ont rapporté le test de 15,5 millions de domaines, l’identification de 122 000 domaines censurés et l’inférence de règles de surblocage plus larges affectant des millions d’autres. Le travail explorait également l’évasion. La publication d’une technique d’évasion peut aider les utilisateurs et simultanément enseigner au censeur ce qu’il faut bloquer ensuite. Le moment de la divulgation et la connaissance locale sont donc des décisions d’ingénierie avec des conséquences humaines.

Le bilan de Feamster dans ce domaine est substantiel et collaboratif. Il a co-écrit des systèmes, aidé à construire des communautés de recherche et continue d’enseigner le cours Internet Censorship and Online Speech. Il ne doit pas être décrit comme le seul fondateur de chaque observatoire connexe ni se voir attribuer le mérite de Geneva simplement parce que les collaborateurs et les sujets se chevauchent. Cartographier les articles et les rôles est plus précis que d’appliquer une étiquette d’inventeur générique.

L’éthique de la mesure est devenue une partie de l’exactitude technique

Les travaux sur la censure illustrent un point plus large sur l’observabilité. Un système peut être statistiquement puissant et être techniquement infructueux s’il ne peut pas être exploité de manière responsable. Les mécanismes de consentement, le choix des cibles, la fréquence des requêtes, la minimisation des données et la stratégie de publication déterminent si la méthode peut être répétée sans préjudice inacceptable.

Il ne s’agit pas d’une exigence d’élimination de tout risque. La sécurité totale peut être impossible dans un domaine où le sujet est un État ou un opérateur de réseau adverse. C’est une exigence que le risque soit explicite, réparti et comparé avec le bénéfice public attendu. Les personnes les plus exposées ne doivent pas disparaître derrière un décompte mondial de domaines.

Le même principe s’applique en dehors de la censure. Une sonde de haut débit peut révéler des schémas d’activité domestique. Un outil IoT peut collecter des métadonnées d’appareils. Un score de réputation de sécurité peut refuser le service. Un jeu de données synthétique peut mémoriser des traces qu’il était censé protéger. Dans chaque cas, le système de mesure crée une nouvelle infrastructure avec ses propres utilisateurs, privilèges et modes de défaillance.

La carrière de Feamster est précieuse précisément parce qu’elle inclut un différend documenté plutôt qu’une séquence sans faille de succès. La controverse Encore montre comment une méthode peut être critiquée, modifiée et suivie d’un travail plus explicite sur la sécurité. Elle montre aussi pourquoi les garde-fous ultérieurs ne doivent pas servir à réécrire le risque originel. Un profil sérieux peut reconnaître l’apprentissage tout en préservant le désaccord qui a rendu cet apprentissage nécessaire.

Les maisons intelligentes ont montré ce que le chiffrement ne cache pas

Le chiffrement protège le contenu de la charge utile, mais un réseau a toujours besoin du moment, de la taille des paquets, des directions et des destinations pour acheminer le trafic. Une prise intelligente, une caméra, un téléviseur ou un assistant vocal peut contacter des services prévisibles avec un motif reconnaissable. Un observateur qui ne peut pas lire le message peut néanmoins déduire qu’un appareil s’est allumé, a diffusé une vidéo ou a signalé un événement.

A Smart Home Is No Castlea démontré ce canal auxiliaire, etSpying on the Smart Homea étendu l’analyse tout en évaluant des défenses basées sur la mise en forme du trafic. Ce dernier article rapportait qu’une défense à débit constant pouvait protéger l’activité pour un surcoût d’environ 40 kilo-octets par seconde dans le cadre testé. Ce chiffre n’est pas un prix universel de la vie privée. Le mélange d’appareils, le modèle de menace, la capacité de la liaison et le niveau de dissimulation requis modifient le compromis.

Ce travail corrigeait une simplification courante en matière de confidentialité grand public. L’affirmation « chiffré en transit » peut être vraie tandis que le comportement reste exposé par les métadonnées. Une politique de confidentialité qui ne traite que du contenu peut donc omettre un risque significatif. Les défenses telles que la mise en forme et le remplissage consomment de la bande passante, de l’énergie ou de la latence, et leur coût peut incomber au foyer plutôt qu’au fabricant.

La question pratique n’est pas de savoir si l’analyse du trafic est possible en laboratoire. C’est de savoir qui peut observer le domicile, quelle inférence est assez fiable pour compter et quelle partie peut modifier la conception. Un FAI, un adversaire local, un fournisseur d’appareil et un fournisseur de cloud ont des vues différentes. La mesure identifie la fuite; la protection du consommateur exige une décision sur les valeurs par défaut, la divulgation, la remédiation et la responsabilité.

IoT Inspector est devenu un outil grand public et une infrastructure de recherche

IoT Inspector a fait passer le travail sur la maison intelligente d’une étude contrôlée à un outil open source que les utilisateurs pouvaient exécuter sur leurs propres réseaux. Il permettait à un entité de sélectionner des appareils, d’observer les destinations contactées et, avec son consentement, de contribuer à la recherche par des métadonnées étiquetées. L’article de 2020 documentait des milliers d’utilisateurs et des dizaines de milliers d’appareils répartis sur de nombreux fournisseurs et catégories.

Les rapports ultérieurs ont utilisé des totaux différents — 44 956, 54 094, plus de 55 000 ou environ 63 000 appareils — parce que les fenêtres de collecte et les conventions de rapport différaient. Choisir le plus grand nombre sans date transformerait un ensemble de données changeant en fausse précision. L’élément important est que le projet a fonctionné à une échelle où le support utilisateur, la qualité des étiquettes, la confidentialité et la maintenance logicielle sont devenus des problèmes de recherche de premier ordre.

Un outil d’inspection destiné à l’utilisateur expose également l’ambiguïté. Un domaine peut être partagé par plusieurs clients cloud. Une étiquette d’appareil peut être erronée. Une connexion à un traqueur n’explique pas à elle seule quelles données ont été transférées ni quel préjudice en a découlé. Montrer une destination peut améliorer la visibilité sans donner à l’utilisateur un recours concret.

La rétrospective de l’équipe du projet a abordé les incitations, le consentement, la minimisation des données et la maintenance opérationnelle. Ce dossier est important parce qu’une plateforme de recherche ouverte peut créer des obligations similaires à celles d’un fournisseur de services. Elle stocke des preuves sensibles, repose sur la compréhension des entités et doit continuer à communiquer ce que ses résultats peuvent et ne peuvent pas établir.

Des études connexes portant sur des échantillons d’appareils IoT médicaux, de jouets connectés et de perceptions des utilisateurs ont étendu le travail à la protection des consommateurs. Les résultats doivent rester liés au produit, à la version et à la date testés. Les modifications du micrologiciel, les corrections des fournisseurs et des déploiements différents peuvent modifier le résultat.

L’apprentissage automatique réseau est un pipeline, pas un classificateur isolé

L’apprentissage automatique est entré dans les travaux de Feamster par le biais du spam et de la réputation bien avant le cycle actuel de l’IA générative. Le programme netml.io ultérieur a rendu le pipeline environnant plus explicite. Un classificateur réseau dépend de la manière dont les paquets sont représentés, dont les étiquettes sont obtenues, où les caractéristiques sont extraites, à quelle vitesse le modèle s’exécute, comment la dérive est détectée et quelle action s’ensuit.

nPrint représentait les paquets au niveau binaire sous une forme standard, tandis que nPrintML associait la représentation à une modélisation automatisée. L’objectif n’était pas de prouver qu’une représentation est la meilleure pour toutes les tâches, mais de rendre les comparaisons plus reproductibles en réduisant les changements cachés dans l’ingénierie des caractéristiques.

Traffic Refinery abordait le coût de production de caractéristiques à haut débit. Un modèle précis est opérationnellement médiocre si l’extraction de caractéristiques perd des paquets, consomme trop de CPU ou renvoie un résultat après la fenêtre de décision. LEAF examinait la dérive conceptuelle, le changement des relations statistiques à mesure que les applications, les appareils et les réseaux évoluent. Un modèle de production a besoin de critères pour le réentraînement, le retour en arrière et la surveillance des erreurs par environnement.

CATO combinait des objectifs prédictifs et systèmes. Son évaluation à NSDI 2025 rapportait jusqu’à 3 600 fois moins de latence d’inférence et un débit sans perte 3,7 fois plus élevé dans des conditions expérimentales spécifiques. Ces chiffres ne sont pas des garanties générales de production. Leur importance conceptuelle est que l’exactitude statistique et le coût de traitement des paquets doivent être optimisés ensemble.

Les travaux actuels étendent cette logique à la classification à faible coût, à la mise en file d’attente, à la sélection de sondes, à la mesure de terrain L4S et à l’analyse des erreurs de configuration par modèle de langage. La thèse de 2005 reposait sur des invariants explicites; un modèle de langage de 2026 peut inférer un problème probable à partir d’exemples et de texte. La nouvelle méthode peut couvrir des cas difficiles à formaliser. Elle risque également de remplacer la preuve par la plausibilité à moins que la recommandation ne soit vérifiée par rapport à l’état observable du réseau.

Le trafic synthétique tente de partager des données utiles sans exposer le réseau réel

Les traces de trafic réel sont difficiles à partager. Elles peuvent révéler des communications, des utilisateurs, des appareils, la structure organisationnelle et des applications propriétaires. Les étiquettes sont coûteuses, et une trace peut devenir rapidement obsolète. Les données synthétiques promettent une alternative: générer des paquets et des flux qui préservent des propriétés utiles sans publier les enregistrements originaux.

NetDiffusion utilisait des modèles de diffusion avec des contraintes protocolaires pour générer du trafic au niveau des paquets. NetSSM ajoutait une prise en compte de l’état et de flux multiples. GATEAU, dirigé par Feamster et Francesco Bronzino, cadre le problème plus large autour de la confidentialité, du coût de collecte et de la rareté des données étiquetées. Ces projets cherchent un juste milieu entre des paquets aléatoires techniquement valides mais irréalistes et des traces réelles qui ne peuvent pas être distribuées en toute sécurité.

Une trace générée peut encore échouer de plusieurs façons. Elle peut préserver les statistiques marginales tout en perdant les corrélations nécessaires pour une tâche en aval. Elle peut mémoriser des exemples sensibles. Elle peut satisfaire la syntaxe protocolaire sans reproduire la congestion, l’état de session ou le comportement de l’utilisateur. Un classificateur entraîné dessus peut sembler réussi et échouer sur le trafic de production.

Les travaux de 2026 sur les compromis entre confidentialité et qualité traitent ces risques comme mesurables plutôt que de supposer que « synthétique » signifie anonyme. C’est la bonne norme. La confidentialité doit être testée contre des attaques plausibles, tandis que l’utilité doit être testée sur la tâche pour laquelle les données seront utilisées. Le trafic synthétique est un instrument de recherche, pas un certificat que le réseau d’origine a disparu.

NetMicroscope teste si le programme de mesure peut devenir une entreprise

NetMicroscope est la traduction commerciale la plus claire des recherches de Feamster sur le haut débit et l’apprentissage automatique. La société identifie Feamster comme président-directeur général et co-fondateur, et Francesco Bronzino comme directeur technique et co-fondateur. La documentation de commercialisation de l’université indique qu’ils l’ont fondée en 2021, avec une équipe à distance centrée à Chicago et à Lyon.

La thèse du produit est que le débit, la latence, la perte, l’état des appareils et les signaux applicatifs deviennent plus utiles lorsqu’ils sont combinés pour estimer la qualité perçue par l’utilisateur. Un opérateur peut savoir qu’une ligne est active sans savoir pourquoi une session vidéo s’est dégradée. NetMicroscope affirme utiliser l’apprentissage automatique pour déduire l’expérience applicative et identifier les problèmes avant une plainte.

Les preuves financières vérifiées sont limitées. En janvier 2024, le George Shultz Innovation Fund a attribué à l’entreprise 200 000 $ pour le développement du produit, du marché, de l’équipe et de la propriété intellectuelle. L’entreprise a également participé aux programmes I-Corps et Compass. Ce sont des signaux commerciaux précoces significatifs. Ils ne constituent pas une preuve de l’évaluation, du financement total, du chiffre d’affaires, du nombre de clients, de la rétention, de la part de marché ou de la rentabilité.

La frontière entre le monde académique et l’entreprise mérite un examen ordinaire plutôt que des insinuations. Des articles liés à la classification du trafic peuvent chevaucher un produit commercial. Les lecteurs ont besoin de la divulgation des affiliations, des financements, de l’accès aux données, des licences et de la propriété intellectuelle. Les documents fournis ne montrent pas que tout le code BISmark, nPrint ou universitaire a été transféré exclusivement à l’entreprise.

NetMicroscope soutient donc une conclusion modeste: il teste si des années de recherche en mesure peuvent devenir un service opérationnel que les clients paieront. Les preuves publiques vérifient les fondateurs, l’orientation du produit et une subvention universitaire. Elles ne permettent pas encore d’affirmer une domination commerciale.

L’enseignement a transformé l’arc de la recherche en un cursus d’infrastructure

Le parcours d’enseignement de Feamster suit la même progression que la recherche. Les cours à Georgia Tech portaient sur l’architecture de l’Internet, la sécurité et les réseaux de nouvelle génération. Des offres ultérieures incluaient les réseaux définis par logiciel. À Princeton, les sujets reliaient les réseaux à la sécurité de l’information et à la politique technologique. Les cours actuels à l’Université de Chicago comprennent l’apprentissage automatique pour les systèmes informatiques, la censure d’Internet et la liberté d’expression en ligne, et la sécurité, la vie privée et la protection des consommateurs.

Il a co-écrit la sixième édition deComputer Networksd’Andrew Tanenbaum en 2020. Sa page d’enseignement lui attribue également la création et le rôle de premier instructeur du cours de réseaux informatiques dans le programme de maîtrise en ligne en informatique de Georgia Tech. Ce cours en ligne a étendu l’enseignement des réseaux bien au-delà du campus, bien que la revendication de création doive rester liée à son dossier d’enseignement documenté, à moins qu’une archive du programme ne soit citée séparément.

Le prix Quantrell 2026 fournit une preuve institutionnelle indépendante que l’enseignement est central dans son travail. L’annonce de l’Université de Chicago a souligné les problèmes ouverts, le raisonnement collaboratif et les exercices conçus autour de travaux réels. Les commentaires des étudiants sont qualitatifs, mais le prix démontre que la carrière ne peut pas être réduite à des articles et à des startups.

La construction d’institutions a encore élargi l’audience. Feamster a dirigé le Center for Information Technology Policy de Princeton et a ensuite contribué à diriger des programmes de l’Université de Chicago reliant la mesure des réseaux, les politiques publiques et la science des données. Des ateliers sur les communications libres et ouvertes ont contribué à établir une communauté où l’éthique et la conception des mesures pouvaient être débattues ensemble.

Un compte rendu équitable doit garder les collaborateurs visibles. De nombreux systèmes ont été mis en œuvre ou dirigés par des étudiants et de jeunes chercheurs. Les projets IoT Inspector, de censure, les bancs d’essai haut débit et les systèmes d’apprentissage automatique ont des équipes de co-auteurs substantielles. Un professeur peut fixer une direction et construire des institutions sans être l’auteur unique de chaque résultat.

Le travail politique fournit des preuves sans exercer d’autorité réglementaire

Le rôle de Feamster dans les politiques publiques est ancré dans la mesure. L’Université de Chicago indique qu’il a travaillé avec des organisations telles que la Federal Communications Commission et la ville de Chicago. Les projets Internet Equity et haut débit peuvent fournir des preuves sur l’accessibilité, l’abordabilité, la fiabilité et la performance. Ils ne décident pas de l’éligibilité aux subventions, ne réglementent pas les prix ni n’ordonnent à un fournisseur de modifier son réseau.

Cette frontière est importante car les preuves techniques gagnent en autorité lorsqu’elles entrent dans le domaine gouvernemental. Un test de débit peut éclairer un processus de contestation, mais les critères juridiques sont fixés ailleurs. Un graphe d’interconnexion peut clarifier l’utilisation, mais les contrats et les décisions de routage restent en dehors du graphe. Un ensemble de données de censure peut documenter une interférence sans achever l’analyse juridique ou politique.

Les travaux actuels sur la confidentialité de l’IA étendent le même problème à un nouvel écosystème. Un Google Privacy Faculty Award soutient la recherche sur les intégrations tierces dans les systèmes de modèles de langage. Un utilisateur peut voir une interface tandis que les invites, le contexte et les attributs inférés se déplacent entre les plugins, les API et les services distants. La structure ressemble à une maison intelligente: un produit visible coordonne plusieurs relations de données cachées.

La liste des publications 2026 inclut des travaux sur l’inférence implicite par les LLM, où un modèle déduit des attributs sensibles même lorsqu’un utilisateur n’a pas fourni d’identifiant conventionnel. Cela rend la minimisation des données plus difficile. Supprimer les noms ou les numéros de compte n’empêche pas un modèle d’inférer des informations de santé, politiques ou démographiques à partir d’une interaction ordinaire.

La valeur politique de ce travail réside dans la visibilité des frontières des preuves. Un modèle, un ensemble de données ou un professeur peut éclairer une décision sans en être propriétaire. Une bonne utilisation institutionnelle nécessite des méthodes transparentes, des estimations d’erreur, des données versionnées et une séparation explicite entre ce que la mesure montre et ce qu’un organisme habilité choisit de faire.

Ce que la carrière a rendu visible — et ce qui reste caché

À travers le routage, le spam, le haut débit, la censure, les maisons intelligentes et l’apprentissage automatique, les projets de Feamster ont converti à plusieurs reprises un problème opérationnel diffus en un système de preuves. rcc a confronté les configurations à des invariants. RCP a donné à la sélection de route une vue plus large. Les systèmes de réputation ont inféré la coordination à partir des métadonnées. Les passerelles ont isolé des parties de la performance du haut débit. Les systèmes de censure ont comparé des signaux à distance. IoT Inspector a relié le trafic des appareils à des étiquettes utilisateurs.

Les projets netml ont joint la représentation au coût de déploiement et à la dérive.

Ces systèmes n’ont pas rendu l’Internet entièrement connaissable. Un contrôle de configuration propre n’élimine pas les pannes physiques. Un score de réputation n’établit pas la culpabilité. Une mesure de vitesse n’explique pas l’abordabilité. Une anomalie DNS n’identifie pas une agence gouvernementale. Les métadonnées chiffrées ne révèlent pas toutes les actions des appareils. Une trace synthétique ne garantit pas la vie privée. Un modèle de langage ne devient pas correct parce qu’il produit un diagnostic cohérent.

Ces limites ne sont pas des raisons de rejeter la mesure. Ce sont des raisons de concevoir le système d’exploitation qui l’entoure avec soin. Une preuve utile doit montrer sa source, son âge, sa portée et son incertitude. Les actions à fort impact doivent avoir une révision, un appel ou une récupération. Les chercheurs doivent indiquer quand un résultat est rapporté dans un article, rapporté par une institution ou reproduit indépendamment. Les affirmations commerciales ne doivent pas hériter de l’autorité d’une publication académique sans preuve distincte.

La contribution durable de Feamster est la construction répétée de cette couche intermédiaire entre une infrastructure opaque et des décisions conséquentes. Son travail a aidé les opérateurs, les chercheurs, les utilisateurs et les institutions publiques à poser de meilleures questions à des systèmes qui n’ont pas été construits pour s’expliquer eux-mêmes. Le résultat n’est pas la certitude. C’est un compte rendu plus discipliné de ce qui peut être observé, de ce qui peut être inféré et de ce qui nécessite encore un jugement.