Résumé
- Nick Feamster est professeur à l'Université de Chicago, chercheur en mesure des réseaux, bâtisseur institutionnel et co-fondateur de NetMicroscope. Il cherche à transformer les comportements cachés d'Internet en fondements décisionnels responsables.
- Son travail sur rcc a permis de découvrir plus de 1 000 défaillances auparavant non détectées dans 17 systèmes autonomes; la Routing Control Platform a aidé à établir un modèle de contrôle à l'échelle du réseau qui sera plus tard lié au SDN.
- Les projets sur le spam, le haut débit, la censure et les objets connectés révèlent aussi les limites de la mesure: les jugements de réputation peuvent nuire, les sondages à distance peuvent créer des risques, et les métadonnées du trafic chiffré peuvent toujours exposer le comportement.
- Ses recherches actuelles en apprentissage automatique questionnent la possibilité de conclusions à la fois efficaces, auditables et sécurisées en production; sa contribution fondamentale réside dans des systèmes collaboratifs qui préservent l'incertitude plutôt que de l'effacer lorsqu'ils utilisent des preuves.
Rcc: vérifier les configurations combinées avant le déploiement
L'article de 2005Detecting BGP Configuration Faults with Static Analysis, co-écrit par Feamster et Hari Balakrishnan, présente le vérificateur de configuration de routeur rcc. L'article classe les défaillances persistantes en deux catégories. Les défaillances de validité de route surviennent lorsque le plan de contrôle choisit une route qui ne correspond pas à un chemin disponible dans le plan de données; les défaillances de visibilité de chemin surviennent lorsqu'un chemin disponible existe, mais que le routeur qui en a besoin ne l'a pas appris. Cette classification relie les commandes de configuration aux résultats que les opérateurs peuvent identifier.
rcc analyse les configurations de plusieurs routeurs et vérifie les contraintes à l'échelle du réseau. L'article rapporte l'analyse de 17 systèmes autonomes, ayant trouvé plus de 1 000 défaillances jusque-là non détectées, et ayant été téléchargé plus de 65 fois par des opérateurs. Ces chiffres sont historiques, rapportés par les auteurs; ils ne prouvent pas que rcc soit devenu un produit industriel courant, ni combien de réseaux ont continué à l'utiliser. Ils montrent néanmoins que le projet a été confronté à des configurations réelles et a atteint des opérateurs au-delà du laboratoire des auteurs.
Sa valeur opérationnelle réside dans le type de preuve apporté. Le vérificateur peut indiquer, avant une panne, quel ensemble de relations de configuration viole un invariant. Cela diffère des tableaux de bord qui signalent une perte de paquets seulement après une dégradation de service. L'ingénieur reçoit une chaîne de raisonnement, de la règle à la catégorie de panne, utilisable pour la revue, les tests et les discussions entre équipes.
Ses limites sont tout aussi importantes. rcc ne peut vérifier que les propriétés que les concepteurs ont codées et que l'analyseur syntaxique prend en charge. Il ne peut pas deviner les intentions commerciales non documentées, ne peut pas garantir l'absence de défauts du fabricant ou de pannes physiques, et ne peut pas transformer « configuration propre » en preuve qu'aucun problème transitoire ne surviendra. Un réseau peut réussir tous les contrôles écrits tout en violant une exigence jamais formulée.
rcc établit ainsi une ambition et une retenue qui traversent tout l'article: l'ambition de rendre le comportement de l'infrastructure calculable avant qu'il ne cause des dégâts; la retenue de reconnaître que la correction est toujours relative aux entrées observées et aux propriétés déclarées. Les agents d'IA modernes pour l'exploitation des réseaux sont confrontés aux mêmes défis, mais la frontière est plus difficile à voir lorsque le modèle fournit des explications fluides au lieu d'invariants explicites.
Internet sait ce qu'il fait, mais ne peut pas expliquer pourquoi
Un paquet arrive à destination, ou non. Un appel vidéo saccade. Un nom de domaine renvoie une adresse inattendue. Un serveur de messagerie refuse une connexion. Une enceinte connectée contacte un service à distance à un moment suggestif. Chaque événement laisse des traces, mais il n'existe pas de grand livre central qui fournisse une explication unique et définitive. Le comportement d'Internet résulte de l'interaction de réseaux exploités indépendamment, de configurations propriétaires, d'accords d'interconnexion privés, d'équipements domestiques, de conceptions applicatives et d'une demande utilisateur en constante évolution.
Cette architecture a une valeur importante, car elle empêche tout opérateur de contrôler l'ensemble du système; mais elle rend aussi le diagnostic difficile. Un routeur peut montrer ses propres routes, mais pas les conséquences globales des politiques de routage combinées. Un test de débit mesure un transfert, mais ne peut pas distinguer automatiquement les facteurs Wi-Fi, la capacité d'accès, la latence, l'interconnexion et l'application. Une sonde de censure peut observer un échec de requête, mais ne peut pas nécessairement identifier le responsable ni l'institution.
Un classificateur de trafic peut attribuer une étiquette, mais ne peut pas garantir que cette étiquette restera correcte après un changement de réseau.
Les travaux de Feamster peuvent être compris comme un effort continu pour réduire ces lacunes de connaissance. Les technologies changent, mais la méthode reste stable: choisir d'abord un comportement important mais caché; identifier ensuite un point d'observation où il laisse des signaux mesurables; élaborer une représentation qui traduise ces signaux en questions que les opérateurs, les décideurs politiques ou les utilisateurs peuvent poser; et enfin tester les limites de cette représentation.
La dernière étape est indispensable, car un système qui ne donne que des réponses assurées sans exposer ses limites peut rendre l'infrastructure moins responsable, et non plus transparente.
Ainsi, même si Feamster ne possède pas de fibre, n'exploite pas de système autonome public et ne gère pas de cloud hyperscale, il demeure un objet d'étude important pour les infrastructures numériques. Son travail se situe dans la couche informationnelle qui entoure ces actifs: il influence la manière dont le routage est vérifié, dont les abus sont identifiés, dont la qualité du haut débit est décrite, dont la censure est documentée et dont les modèles statistiques entrent dans l'exploitation des réseaux. Les routeurs et les câbles acheminent le trafic; la mesure et l'analyse déterminent si les gens peuvent expliquer ce qu'ils font.
Par conséquent, le récit le plus puissant de cette carrière n'est pas une liste de prix ni l'affirmation qu'un chercheur a inventé plusieurs domaines, mais plutôt un programme d'observabilité qui change constamment d'objet d'étude tout en maintenant la même discipline: distinguer l'observation directe de l'inférence, les résultats d'expérimentation de la garantie opérationnelle.
Une carrière, des identités institutionnelles multiples
Au 3 août 2026, l'Université de Chicago liste Feamster comme Neubauer Professor of Computer Science et Faculty Director of Research au Data Science Institute. Sa propre page personnelle mentionne également les titres de directeur du Network Operations and Internet Security Lab, co-directeur de l'Internet Innovation Initiative, co-responsable de netml.io et co-directeur du AI and Policy Pillar. Le Data Science Institute, dans un article de septembre 2024, utilise l'appellation Director of Technology Policy.
Ces descriptions peuvent coexister, car les fonctions universitaires se chevauchent et évoluent dans le temps, mais elles ne peuvent pas être fusionnées en un titre unique et immuable.
Les frontières institutionnelles comptent. En tant que professeur, il fait de la recherche et enseigne; à travers le NOISE Lab et netml.io, il étudie le routage, la mesure, la vie privée et l'apprentissage automatique avec des étudiants et des collaborateurs; à travers les projets Internet Innovation et Internet Equity, il produit des preuves pour les décisions de politique publique et d'infrastructure; en tant que co-fondateur et CEO de NetMicroscope, il participe à une entreprise privée qui cherche à commercialiser l'analyse de la qualité des réseaux.
Sa biographie personnelle indique également qu'il intervient comme témoin expert dans des litiges technologiques. Aucun de ces rôles n'octroie automatiquement l'autorité d'un autre: un professeur n'est pas un régulateur; le CEO d'une start-up ne transforme pas automatiquement la recherche universitaire en garantie commerciale; une opinion d'expert n'est pas une décision de justice.
Cette distinction est cohérente avec la recherche elle-même. Les meilleurs travaux de Feamster demandent: quel système détient quel élément de preuve, et que peut-on raisonnablement conclure avec cet élément? La même prudence doit s'appliquer à sa description. La biographie actuelle indique qu'il a écrit le premier crawler Web de LookSmart et participé à la conception du premier algorithme de détection de botnets de Damballa.
Ce sont des faits précoces attribuables dans l'industrie, mais ils ne permettent pas de préciser les dates exactes d'emploi, l'attribution unique de la paternité, les parts de capital ou l'historique complet des produits.
Les sources publiques sont beaucoup plus riches sur son travail professionnel que sur sa vie privée. Les preuves disponibles ne permettent pas de confirmer de manière fiable sa date ou son lieu de naissance, sa nationalité, sa citoyenneté, son milieu familial, sa rémunération, ses parts dans NetMicroscope, ses investissements personnels ou sa fortune. Un article fondé sur des preuves ne devrait pas transformer ces lacunes en spéculations. Sa trajectoire professionnelle est suffisamment importante sans lui ajouter une biographie de type célébrité que les sources ne soutiennent pas.
MIT, un crawler Web et une thèse de doctorat sur ce qui se passe « avant la panne »
Feamster a suivi tout son cursus, du premier cycle au doctorat, au Massachusetts Institute of Technology. Il a obtenu un SB en génie électrique et informatique en 2000, un MEng dans le même domaine en 2001, et un doctorat en informatique en 2005 sous la direction de Hari Balakrishnan. Sa thèse, intituléeProactive Techniques for Correct and Predictable Internet Routing, résume clairement son programme de recherche initial: ne pas attendre que les erreurs de routage provoquent des pannes pour en reconstituer les causes, mais plutôt amener le réseau à exposer suffisamment de structure pour que des propriétés clés puissent être vérifiées avant le déploiement.
Le travail précoce chez LookSmart peut être vu comme un prélude limité mais significatif. Un crawler Web doit explorer un vaste graphe qui change pendant l'observation, en faisant face à des liens morts, des pages dupliquées, des réponses incohérentes et des zones inaccessibles. Le crawler n'a pas directement évolué vers les systèmes de routage ultérieurs, et les sources ne soutiennent pas cette affirmation. La continuité réelle est méthodologique: un système distribué ne peut pas être compris depuis un unique point de vue local, une connaissance utile exige une collecte systématique et une représentation explicite des entités découvertes.
Chez Damballa, le même problème prend une dimension antagoniste. Les botnets tentent intrinsèquement de cacher leurs membres et leur structure de contrôle. La biographie officielle de Feamster indique qu'il a participé à la conception du premier algorithme de détection de botnets de l'entreprise.
Les matériaux publics ne permettent pas de reconstituer l'équipe complète ni de démontrer comment les produits ultérieurs ont utilisé ce travail; mais cela montre que sa carrière précoce a oscillé entre la recherche universitaire sur les systèmes et une entreprise de sécurité opérationnelle qui avait besoin d'inférer une coordination malveillante à partir de traces réseau.
La recherche doctorale s'est développée dans un environnement typique: les politiques de routage interdomaine sont dispersées entre les équipements et les organisations. Les opérateurs expriment les préférences de peering, de client, de sortie, les chemins de secours et l'ingénierie de trafic au moyen de commandes. La configuration de chaque appareil, prise isolément, peut sembler raisonnable, mais leur combinaison peut cacher des boucles, des trous noirs ou des chemins inattendus.
Le problème n'est pas simplement une implémentation défectueuse des protocoles, mais le raisonnement sur un programme distribué assemblé à partir de nombreuses politiques locales.
Ce cadre est devenu une caractéristique durable. Feamster considère souvent le système complet, avec ses algorithmes, ses fichiers de configuration, ses points d'observation, ses pipelines de données, ses interfaces, ses incitations opérationnelles et ses contraintes institutionnelles, comme la véritable unité de recherche. La recherche dépasse ainsi le théorème ou le classificateur unique et assume une responsabilité plus grande: dès qu'un système interagit avec de vrais opérateurs, des foyers ou des personnes vivant sous un régime de censure, le déploiement et l'éthique deviennent partie intégrante de la qualité technique.
Traiter la configuration BGP comme un programme distribué
Le Border Gateway Protocol permet aux systèmes autonomes d'échanger des informations d'accessibilité tout en gardant le contrôle sur leurs politiques commerciales et de routage. Cette autonomie permet à des réseaux de propriétaires et d'objectifs différents de composer Internet, mais elle signifie aussi que le résultat global n'est pas conçu par un seul ingénieur. Les politiques se combinent indirectement à travers les annonces de routes, les préférences, le filtrage et la distribution interne des routes.
Même à l'intérieur d'un seul système autonome, l'ampleur du problème peut être considérable. Un réseau peut compter des centaines de routeurs et plusieurs façons de propager les routes externes en interne. Une route apprise à la périphérie doit être visible là où elle est nécessaire, mais pas forcément partout. Les politiques de sortie doivent empêcher la fuite des routes de clients ou de pairs vers de mauvais voisins. Les chemins de secours doivent apparaître après une défaillance du chemin principal, mais sans créer de boucles ni d'oscillations persistantes.
Les opérateurs détiennent l'intention commerciale, tandis que les équipements conservent des fragments exécutables.
Les premiers travaux de routage de Feamster ont traité ces fragments comme un programme analysable. Il s'agit d'un changement de perspective concret: la configuration du routeur n'est plus un texte à examiner ligne par ligne, mais une entrée pour un calcul à l'échelle du réseau. La correction peut s'exprimer en invariants: la route choisie doit correspondre à un chemin de transfert disponible; un chemin disponible doit être visible par le routeur qui en a besoin; les politiques de sortie doivent préserver les relations prévues; la distribution interne des routes ne doit pas créer d'incohérences persistantes.
L'intérêt de l'analogie avec l'analyse de logiciel est qu'elle modifie le moment de l'intervention. Le diagnostic traditionnel commence après l'apparition des symptômes; l'analyse statique demande si un type de panne connu est déjà encodé dans la configuration. Elle ne nécessite pas d'injecter du trafic ni d'attendre les signalements des clients. Pour les réseaux qui transportent des services critiques, il peut être plus précieux de déplacer les défauts de la file d'attente des incidents vers celle des revues que de réduire le temps de diagnostic a posteriori.
L'analogie a cependant des limites. L'état d'un réseau n'est pas seulement sa configuration, mais aussi les routes en temps réel, la topologie, les comportements des équipementiers, la convergence transitoire, les tables matérielles, les liaisons défaillantes et des connaissances commerciales qui n'ont peut-être jamais été écrites. Un vérificateur statique peut être parfait par rapport à son propre modèle tout en manquant les défaillances extérieures à ce modèle. Les travaux ultérieurs de Feamster ne cessent de revenir sur cette distinction: une représentation utile n'équivaut pas à l'ensemble de la réalité opérationnelle.
La Routing Control Platform déplace les décisions hors du routeur individuel
rcc demandait si une configuration distribuée satisfait des contraintes connues. La Routing Control Platform pose une autre question: pourquoi chaque routeur devrait-il reconstruire individuellement l'information nécessaire au choix de route? Le protocole iBGP traditionnel propage les routes externes via un maillage complet ou des réflecteurs de routes. Le maillage complet devient difficile à maintenir à mesure que le réseau grandit; les réflecteurs de routes améliorent le passage à l'échelle mais peuvent cacher des routes, produire des choix inattendus et rendre le comportement global plus difficile à raisonner.
L'article sur RCP propose un service logiquement centralisé: collecter les routes BGP externes et la topologie interne, choisir un chemin pour chaque routeur, puis communiquer ces choix via des sessions iBGP ordinaires. Les équipements de transfert ne disparaissent pas; ils acheminent toujours les paquets et utilisent des protocoles familiers à leurs interfaces. Ce qui change, c'est l'endroit où réside la logique de choix de route, et l'étendue de ce qu'elle peut observer.
« Logiquement centralisé » ne signifie pas une machine physique unique et fragile. Le service de contrôle peut être répliqué et distribué tout en offrant une fonction de décision cohérente. Cette distinction est par la suite devenue essentielle pour le SDN. Un contrôleur peut agir sur la base d'une vue globale sans que tous les processus de contrôle s'exécutent sur la même machine. Le défi technique se déplace alors vers la cohérence des états, la reprise sur défaillance et les interfaces sécurisées, plutôt que vers un choix binaire entre centralisation et distribution.
RCP respecte également l'infrastructure existante. Elle n'exige pas un nouveau plan de transfert ni le remplacement immédiat de tous les routeurs. C'est important pour les réseaux dont les équipements, les contrats et les processus opérationnels ne peuvent pas être changés simultanément. Une architecture de recherche qui peut entrer dans un environnement réel par des interfaces que les opérateurs connaissent déjà voit sa valeur pratique nettement augmenter.
L'évaluation a utilisé des informations provenant de véritables réseaux fédérateurs, mais les documents disponibles n'établissent pas un recensement exhaustif des déploiements en production. La conclusion défendable est que RCP a démontré une architecture réalisable et a exercé une influence durable, et non qu'elle a remplacé iBGP dans toute l'industrie. Le prix NSDI Test of Time 2015 atteste de la valeur de l'idée, mais ne prouve pas une adoption commerciale et ne permet pas d'attribuer à un seul article tous les modèles de contrôleur ultérieurs.
Une contribution majeure au SDN, pas le récit du « seul inventeur »
On raconte souvent le Software-Defined Networking comme une rupture nette: le contrôle passe dans le logiciel, le transfert devient programmable, une nouvelle ère commence. L'histoire réelle est moins nette. Les réseaux actifs, la virtualisation de réseau, l'architecture 4D, Ethane, RCP, OpenFlow, NOX et d'autres projets ont chacun traité une partie différente de la programmabilité, de la séparation du contrôle et de la gestion globale du réseau. Feamster est un contributeur important dans cette généalogie d'idées, mais rien ne permet de le présenter comme l'unique inventeur du SDN.
RCP apporte une idée architecturale claire: un service de contrôle doté d'une vue plus large peut calculer des décisions de routage et les confier aux équipements de transfert existants. rcc apporte une autre idée: les politiques réseau peuvent être vérifiées par rapport à des invariants. Ensemble, ces deux idées font passer le problème d'exploitation de « quelles sont les commandes sur ce routeur? » à « quel comportement le système de contrôle complet met-il en œuvre? ». C'est une fondation conceptuelle importante pour les réseaux programmables.
Feamster a par la suite participé à la rédaction deThe Road to SDN, qui décrit ce domaine comme une accumulation d'idées sur la durée plutôt que comme une invention instantanée. Cette position historique aide à résister aux mythes du fondateur qui entourent souvent les technologies d'infrastructure. Un domaine naît généralement de plusieurs équipes de recherche, d'opérateurs, d'équipementiers et de communautés de normalisation qui résolvent des problèmes voisins et les rendent déployables.
L'article de 2017 avec Jennifer Rexford,Why (and How) Networks Should Run Themselves, étend l'argument des contrôleurs à l'exploitation continue. Il décrit une boucle fermée où une intention de haut niveau guide les décisions, la télémétrie montre les résultats et le système s'ajuste en conséquence. Le titre est délibérément provocateur, mais il ne faut pas l'interpréter comme la disparition du besoin d'ingénieurs. Un réseau adaptatif a toujours besoin d'objectifs corrects, d'une télémétrie fiable, d'une exécution sécurisée, de privilèges limités et de mécanismes pour s'arrêter quand les preuves ne sont pas claires.
Aujourd'hui, cet agenda ressemble davantage à un problème de conception pour l'exploitation assistée par IA. Les modèles de langage peuvent suggérer des configurations, résumer des événements, choisir des outils, mais ils peuvent aussi inventer des causes, mal interpréter les politiques ou détenir des privilèges excessifs. Les premières recherches sur le routage fixaient un standard élevé pour les nouveaux systèmes: les suggestions apprises doivent être entourées de contrôles explicites et de conséquences observables, et ne pas être acceptées uniquement parce que l'explication semble plausible.
Le spam: l'importance du « réseau autour du message » plutôt que du message lui-même
À Georgia Tech, l'objet d'observation est passé des erreurs de configuration aux adversaires actifs. Les campagnes de spam et les botnets se déplacent par nature: les machines infectées apparaissent et disparaissent, les adresses changent, les noms de domaine sont remplacés, l'infrastructure de contrôle se disperse. Les signatures de contenu peuvent attraper les messages connus, mais le système de distribution révèle souvent des motifs plus persistants.
L'article SIGCOMM 2006Understanding the Network-Level Behavior of Spammersa analysé, selon l'article, plus de 10 millions de spams. Il étudie où les expéditeurs apparaissent, combien de temps ils persistent, et comment le spam est lié à l'espace d'adressage et au comportement de routage. L'importance de l'article ne tient pas à un pourcentage permanent, mais au fait qu'il démontre que l'abus peut être étudié comme une infrastructure: les populations d'expéditeurs, les chemins, la durée et la concentration des sources peuvent révéler une coordination invisible dans le corps du message.
Les caractéristiques de la couche réseau peuvent être disponibles tôt dans la connexion, avant que le message complet ne soit reçu ou examiné. Cela peut réduire le traitement et permettre une défense à grande échelle, tout en protégeant partiellement la vie privée du contenu grâce à l'utilisation des métadonnées. Mais la même abstraction peut créer des risques. Un préfixe d'adresse résidentiel peut contenir à la fois des utilisateurs innocents et des machines infectées; un hébergement partagé peut servir à la fois des domaines légitimes et malveillants; les adresses changent de propriétaire.
La réputation d'une infrastructure n'est utile que si l'incertitude, la péremption des preuves et les mécanismes de recours font partie du système.
Le travail de contre-espionnage sur les DNSBL a utilisé le comportement défensif des attaquants comme signal. Les opérateurs de botnets interrogent les listes noires DNS pour vérifier si une machine a déjà été identifiée; des motifs de requête particuliers peuvent ainsi exposer l'appartenance d'une machine. La reconnaissance de l'attaquant devenait une preuve, mais il s'agit toujours d'une heuristique: une requête peut avoir une cause légitime, et une liste suspecte demande une corroboration supplémentaire avant toute action perturbatrice.
SNARE utilisait des caractéristiques spatio-temporelles et réseau disponibles tôt dans la session SMTP pour attribuer un score aux expéditeurs. L'évaluation rapporte une précision d'environ 93 % à un taux de faux positifs relativement bas. Ce chiffre appartient au jeu de données, à l'environnement de menaces et aux seuils de l'époque; il n'est pas resté stable pendant 17 ans. Les attaquants s'adaptent, l'infrastructure de messagerie se concentre, les distributions de caractéristiques dérivent. Cela prouve qu'un signal précoce peut soutenir un classificateur utile, sans fournir une référence permanente.
Le système de réputation DNS dynamique a étendu la même logique des expéditeurs aux noms de domaine. Les motifs d'enregistrement, les serveurs de noms, les changements d'adresse et le comportement de résolution peuvent distinguer une infrastructure malveillante d'un service légitime stable. Un classificateur peut attribuer un niveau de risque avant de connaître l'intégralité de la charge utile. Cela préfigure l'apprentissage automatique réseau ultérieur: construire des représentations à partir des métadonnées, entraîner des règles de décision, puis gérer les conséquences opérationnelles lorsque la représentation est incomplète.
La réputation est une décision opérationnelle, pas une étiquette objective
Le regroupement comportemental des logiciels malveillants fondé sur HTTP a poussé l'approche plus loin. Au lieu d'exiger une signature exacte pour chaque binaire, le système regroupait les échantillons selon leur comportement de communication et générait des signatures réseau. Lorsque le code change mais que le protocole de contrôle, les motifs de destination ou le comportement temporel persistent, cette approche peut rester efficace; si la représentation est trop grossière, elle peut aussi regrouper du trafic sans rapport.
La distinction entre le signal et la décision détermine la manière dont le système doit être utilisé. Un modèle peut signaler qu'une adresse, un nom de domaine ou un flux est similaire à un abus connu, mais l'opérateur doit encore décider de la suite: un résultat de faible confiance peut ne déclencher qu'une observation, un résultat plus fort peut déclencher une limitation de débit. Bloquer tout un préfixe ou un nom de domaine imposerait un coût à des utilisateurs innocents. La conception technique inclut donc les seuils, l'âge des preuves, l'étendue de l'action et les chemins de correction.
Les travaux précoces de Feamster chez Damballa, ainsi qu'un brevet cédé à la Georgia Tech Research Corporation, indiquent que cette recherche a un contexte commercial et de propriété intellectuelle. Le brevet cite Feamster, David Dagon, Wenke Lee et d'autres comme inventeurs d'une méthode de détection et de réponse aux réseaux d'attaque. Un brevet établit un enregistrement formel d'invention et de cession, mais ne prouve pas une création indépendante, une utilisation en production, des revenus de licence ni la validité de chaque revendication dans toutes les juridictions.
La contribution plus large est d'avoir considéré la réputation comme un problème d'infrastructure, et non comme un simple taux de précision abstrait. Les défenseurs ont besoin de classificateurs qui fonctionnent dans la fenêtre de décision, au débit de la ligne, en utilisant des données légalement collectables, et qui sachent gérer les erreurs. Un article peut optimiser un maillon de la chaîne; le système de production doit assumer toute la chaîne pendant des années, face à un adversaire qui évolue.
Cela rejoint aussi les travaux actuels de Feamster en apprentissage automatique, qui traitent plus explicitement du coût des caractéristiques, de la dérive, de la vie privée et du déploiement. La question de fond n'a pas changé: lorsque des signaux réseau sont convertis en décisions, quelles preuves les rendent assez fiables pour affecter le trafic réel?
Mesurer le haut débit depuis la passerelle domestique a changé le point d'observation
Les plaintes sur le haut débit sont faciles à exprimer, mais difficiles à diagnostiquer. « Internet est lent » peut signifier que le lien d'accès est saturé, que le Wi-Fi est mauvais, que des appareils domestiques occupent la bande passante, qu'il y a de la congestion à l'interconnexion, que le serveur distant est lent, que la latence applicative est élevée, ou que le test lui-même ne génère pas assez vite de trafic. Une mesure sur un ordinateur portable hérite des logiciels de la machine et des conditions du réseau local; une mesure dans le cœur de réseau de l'opérateur ne voit pas l'expérience réelle au domicile.
L'approche par la passerelle place une mesure contrôlée à la frontière entre le domicile et le fournisseur d'accès. L'étude SIGCOMM 2011 a utilisé les données longitudinales de près de 4 000 passerelles réparties sur huit FAI, au sein d'un déploiement plus large de plus de 4 200 appareils. L'étude analyse le débit, la latence, la technologie d'accès et les comportements de mise en forme du trafic. L'intérêt analytique de la passerelle est qu'elle peut observer le service d'accès tout en évitant une partie de la variabilité incontrôlée des terminaux classiques.
Ce point d'observation ne donne pas automatiquement des réponses. La passerelle partage l'environnement local avec les appareils et le Wi-Fi; le serveur de mesure possède ses propres chemins et capacités; le test peut perturber le trafic domestique ou s'exécuter à des moments non représentatifs. La méthode améliore l'attribution, mais ne crée pas une vue parfaite de l'expérience utilisateur.
BISmark a transformé l'approche par passerelle en une plateforme expérimentale réutilisable. L'article USENIX ATC 2014 décrit un routeur personnalisé et un backend capable de déployer des mesures et des applications. Au moment de la publication, la plateforme fonctionnait dans des centaines de foyers répartis dans une trentaine de pays et était utilisée par des chercheurs de neuf institutions. Ces chiffres appartiennent à un moment donné, mais ils montrent que le projet a dépassé le stade du jeu de données ponctuel.
Maintenir une plateforme expérimentale à domicile est un travail d'infrastructure en soi: il faut expédier et assister le matériel, les utilisateurs débranchent les appareils, le micrologiciel vieillit, les horloges dérivent, le consentement éclairé doit rester compréhensible, et les structures de données comme les pipelines de collecte doivent résister aux changements du réseau et des applications. Les systèmes ouverts démontrent ainsi à la fois des capacités de conception de mesure et de construction institutionnelle.
Les travaux sur le haut débit montrent aussi pourquoi la méthode influence la politique. Les résultats d'une passerelle contrôlée ne sont pas interchangeables avec un test de débit dans le navigateur, les compteurs du FAI ou une offre commerciale; ils mesurent des parties différentes du chemin. Ce n'est que lorsque le point d'observation et ses limites sont visibles publiquement que la décision publique devient plus défendable que lorsqu'elle est cachée derrière un simple chiffre de « vitesse maximale ».
Quand le lien d'accès devient plus rapide, la vitesse ne suffit plus à expliquer l'expérience
Les premières politiques de haut débit se concentraient souvent sur la question de savoir si les opérateurs fournissaient bien la vitesse annoncée. Cela reste important là où la capacité d'accès est rare; mais lorsque la connexion est déjà assez rapide, la latence, le Wi-Fi, la distribution de contenu et la conception des applications commencent à dominer l'expérience, ce qui réduit le pouvoir explicatif d'une mesure unique de vitesse.
Une étude portant sur plus de 5 000 réseaux à haut débit a examiné les goulets d'étranglement de performance des pages web et a constaté qu'au-delà d'une certaine plage de débit d'accès, le débit brut n'est souvent plus le seul facteur limitant. Si le temps d'aller-retour, les dépendances entre objets d'une page ou le comportement du serveur déterminent le temps total, un abonnement plus rapide ne rend pas nécessairement la page plus rapide. Les seuils précis ne peuvent pas être généralisés; la conclusion durable est que, à mesure que l'accès s'améliore, la qualité devient un problème multidimensionnel.
La fiabilité ajoute une dimension supplémentaire. Un service peut avoir une excellente vitesse médiane tout en étant rendu inutilisable par de brèves interruptions. Un appel vidéo, un examen ou une consultation de télémédecine peuvent être interrompus par une courte perte de paquets qui disparaît dans la moyenne mensuelle. Un test unique ne peut pas décrire la fréquence, la durée et le moment des pannes; cela exige des mesures longitudinales.
L'étude du DNS chiffré illustre un compromis similaire. Le choix du résolveur et du protocole modifie la latence, la vie privée et l'accessibilité. Dans le panel mesuré, aucune configuration ne convenait à tous les utilisateurs et à tous les réseaux. Un gain de sécurité ou de vie privée peut entraîner un coût de performance dans un environnement, mais pas dans un autre. Par conséquent, un résultat de référence unique ne doit pas devenir une prescription universelle.
Les mesures de la période COVID ont montré à quel point l'environnement opérationnel peut changer soudainement. Les FAI entités ont connu une variation brutale du trafic et des besoins d'interconnexion, puis ont ajouté de la capacité et se sont adaptés à de nouveaux modes d'usage. Les conclusions ne valent que pour les réseaux mesurés, mais elles montrent qu'une planification fondée uniquement sur des moyennes historiques stables échoue en cas de choc sociétal.
À ce stade, la mesure du haut débit évolue vers l'ingénierie de la qualité d'expérience. Les opérateurs doivent relier des signaux de bas niveau comme le débit, la latence, la perte de paquets, les interruptions et l'interconnexion à des résultats applicatifs comme les saccades vidéo ou la qualité des conférences. Cette logique fait partie, plus tard, de la proposition de valeur de NetMicroscope. Les résultats académiques ne valident pas chaque affirmation commerciale, mais la filiation technique est claire.
La mesure de l'interconnexion transforme un différend commercial en un problème de données partagées
Le chemin du domicile à l'application peut traverser plusieurs frontières commerciales. Le fournisseur d'accès peut échanger directement avec le réseau de contenu, ou passer par un point d'échange Internet ou un opérateur de transit. La congestion peut n'apparaître que sur un seul lien, dans un seul sens et à un moment donné. Ce qui est présenté dans le débat public comme un « problème d'interconnexion » peut donc mélanger plusieurs états techniques.
L'Interconnection Measurement Project demandait aux FAI entités de déployer un outillage commun sur les liens d'interconnexion. Le projet a rapporté environ 2 900 liens, avec un taux d'utilisation d'environ 31 % au pic de juin 2021, et a documenté des ajouts de capacité. Les résultats agrégés ne prouvent pas que chaque chemin utilisateur soit exempt de congestion; une moyenne sur un lien peut cacher des pics de courte durée, des itinéraires particuliers ou des pannes locales. La valeur du projet est d'avoir tenté de fournir une méthode et un langage communs à plusieurs parties.
Un système de mesure commun réduit un type de désaccord, mais en crée un autre. Les entités doivent s'entendre sur les liens à inclure, le mode d'échantillonnage du taux d'utilisation, la protection des données privées et les résumés pouvant être rendus publics. Les fournisseurs peuvent avoir des raisons commerciales de limiter la divulgation; les chercheurs ont besoin de suffisamment de détails pour vérifier les affirmations sans exposer les relations clients ni les topologies sensibles.
Le rôle plus précis de Feamster dans ce projet est d'avoir construit une capacité de mesure et une coopération institutionnelle. Il n'a ni régulé les contrats d'interconnexion, ni contraint les entreprises à participer. Le projet illustre comment sa recherche a pu passer d'instruments installés sur des passerelles domestiques à des systèmes de preuve partagés avec des opérateurs. La tâche technique et la gouvernance sont inséparables: des données utiles dépendent de la coopération des institutions qui contrôlent les liens.
L'équité numérique étend la performance à l'accès, au coût et à la fiabilité
Une communauté peut être couverte par le haut débit sans que les foyers puissent se le permettre; un foyer peut être abonné tout en subissant une connexion chroniquement peu fiable; un opérateur peut atteindre la vitesse annoncée alors que le Wi-Fi, le câblage du bâtiment ou la qualité du terminal empêchent les applications de fonctionner. Réduire la fracture numérique à une simple carte de couverture masque ces différences.
L'Internet Equity Initiative de l'Université de Chicago combine l'accessibilité, l'infrastructure, l'abordabilité, le taux d'adoption, la performance et la fiabilité. Son portail et ses projets associent des mesures réseau à des données démographiques et de politiques publiques. Les appareils installés dans des foyers de Chicago fournissent des preuves directes de la performance du service, tandis que les jeux de données publics permettent des comparaisons entre lieux et populations.
Ces méthodes peuvent montrer des motifs, mais pas expliquer automatiquement toutes les causes. Les différences entre communautés peuvent être liées au revenu, au type de bâtiment, à la concurrence entre opérateurs, aux abonnements, aux équipements ou à l'investissement historique. La superposition de données démographiques peut orienter l'enquête, mais elle ne peut pas prouver à elle seule pourquoi une différence est apparue. La recherche sur les politiques publiques demande la même discipline que la recherche sur le routage: une représentation rend le problème testable, mais ne remplace pas les variables manquantes.
En 2025, l'Université de Chicago a rapporté que la collaboration Internet Innovation a contribué, par ses mesures et analyses, au plan haut débit de l'État de l'Illinois, qui concerne 175 000 foyers, entreprises et points d'ancrage communautaires mal desservis. Il s'agit d'une déclaration institutionnelle importante, qui associe l'Illinois Broadband Lab, des membres de l'administration de l'État et d'autres partenaires. On ne peut pas la reformuler comme si un seul professeur avait connecté 175 000 lieux, ni en déduire que toutes les constructions prévues ont été achevées.
Le passage des tests sur passerelle à l'équité numérique modifie aussi le public attendu de la mesure. Les opérateurs peuvent utiliser les résultats des passerelles pour diagnostiquer une ligne; les municipalités peuvent employer les motifs communautaires pour décider des priorités d'aide; un État peut exploiter des données vérifiées dans le cadre d'une procédure de contestation des financements. Plus la mesure entre dans la décision publique, plus son impact est grand, et plus elle exige des définitions transparentes, des données versionnées et une description claire de l'incertitude résiduelle.
La recherche sur la censure transforme l'observabilité en question de sécurité personnelle
La censure est difficile à mesurer pour la même raison structurelle que le routage est difficile à expliquer: l'observateur voit le résultat de l'interaction de plusieurs systèmes. L'échec de la résolution d'un nom de domaine peut provenir d'un filtrage national, d'un pare-feu local, d'une erreur DNS ordinaire, d'une panne de serveur ou d'une instabilité de routage. La réinitialisation d'une connexion peut être injectée, mais elle peut aussi provenir du terminal ou d'un équipement intermédiaire sans rapport avec un contrôle politique. Les signaux portent rarement une déclaration de responsabilité signée.
La différence de risque tient au fait que la mesure peut exposer une personne. Les chercheurs ont besoin de points d'observation situés à l'intérieur des réseaux censurés, mais les volontaires peuvent subir des représailles. Les techniques à distance peuvent réduire le besoin de recruter des entités locaux, mais elles peuvent aussi impliquer des utilisateurs, des sites web ou des systèmes qui n'ont jamais consenti à l'expérience. Dans ce domaine, le modèle de sécurité fait partie de l'architecture de mesure.
Les travaux de Feamster sur le sujet commencent avec Infranet en 2002. Le système considérait la censure comme un problème de contournement: des serveurs web coopératifs encodaient une requête montante cachée dans une activité HTTP apparemment normale, et dissimulaient l'information descendante dans des images. Les hypothèses Web appartiennent à une époque technique antérieure, mais le système a établi un thème durable: la censure est en partie une confrontation sur les motifs de trafic qui peuvent être distingués d'une communication normale.
Les recherches ultérieures sont passées de l'aide au contournement à la mesure du blocage lui-même. Des mesures à grande échelle, répétables, peuvent documenter un filtrage que les gouvernements ou les opérateurs réseau ne divulguent pas, ce qui présente une valeur d'intérêt public; mais elles posent aussi des problèmes éthiques plus difficiles: un système qui produit des preuves pour le public peut faire porter le risque sur les appareils précis qui génèrent le signal.
Il ne s'agit pas d'une controverse secondaire dans la carrière, mais de l'exemple le plus clair où « faire parler Internet » peut nuire à des personnes qui n'ont jamais posé la question. La qualité éthique de la mesure de la censure dépend donc du choix des cibles, du consentement, de la limitation du débit, de la conservation des données, de la divulgation et de la probabilité de représailles, et pas seulement de la précision statistique.
Encore montre comment le passage à l'échelle peut contourner le consentement éclairé
Encore utilisait des requêtes inter-origines depuis le navigateur pour tester l'accessibilité de ressources web sélectionnées depuis différents réseaux. Les sites entités pouvaient faire en sorte que le navigateur de leurs visiteurs lance des requêtes, ce qui permettait aux chercheurs de déduire si une ressource était bloquée. La conception promettait de passer à l'échelle sans avoir besoin d'installer un logiciel dédié dans chaque pays.
Le même mécanisme a aussi soulevé de graves préoccupations éthiques. Des personnes consultant des pages sans rapport avec l'étude pouvaient devenir des points de mesure sans connaître l'expérience; les requêtes vers des noms de domaine sensibles pouvaient être vues par le censeur; des sites tiers pouvaient sembler sonder des contenus qu'ils n'avaient pas choisis. Les personnes qui supportaient le risque n'étaient pas nécessairement les mêmes que les chercheurs qui obtenaient les données.
Un article indépendant,No Encore for Encore?, a souligné les problèmes de consentement éclairé, de transparence, de sécurité des utilisateurs et de préjudice pour les sites tiers, et a documenté les échanges avec Feamster ainsi que les modifications apportées au système. Ces critiques ne doivent être ni exagérées au point de devenir une condamnation formelle pour faute académique, ni réduites à une note de bas de page effacée par les travaux ultérieurs. Elles identifient des risques de conception réels dans un système qui poursuivait un objectif public légitime.
Feamster et Ben Jones ont ensuite publiéCan Censorship Measurements Be Safe(r)?. Le titre présente à juste titre la sécurité comme une échelle continue, et non comme une certification binaire. La couverture, la répétabilité et la précision sont en tension avec l'exposition des volontaires, des cibles et des tiers. Un système qui couvre de nombreux réseaux n'est pas nécessairement plus acceptable s'il ne peut pas limiter le risque supporté par chaque entité.
Cet épisode a modifié le contenu intellectuel de la recherche. L'éthique n'est plus un audit externe plaqué sur la méthode technique, mais doit entrer dans le modèle de menace: les personnes qui génèrent le trafic, les institutions qui hébergent les tests et les autorités qui peuvent observer le trafic font toutes partie de l'architecture. C'est une leçon durable pour toute mesure d'infrastructure qui utilise des navigateurs, des équipements domestiques et des agents d'IA comme capteurs distribués.
Augur, Iris et les systèmes ultérieurs élargissent la couverture sans cacher le risque
Augur a tenté d'inférer la connectivité entre des sites distants par des canaux auxiliaires TCP/IP, sans contrôler un point de mesure traditionnel à aucune des deux extrémités. L'article rapporte une validation dans près de 180 pays sur 17 jours, et inclut des choix de conception visant à ne pas impliquer des utilisateurs individuels. La méthode élargit la couverture géographique, mais l'inférence repose sur le comportement du système d'exploitation, la sélection d'adresses, les asymétries de filtrage et des hypothèses statistiques.
Iris se concentre sur la manipulation DNS. En répétant des requêtes vers des résolveurs situés à différents endroits et en comparant les résultats, il est possible d'identifier des réponses anormales. Le DNS fournit des preuves structurées, mais les systèmes légitimes peuvent aussi mettre en cache, rediriger, localiser et filtrer. Les différences de réponse ne sont qu'un point de départ pour l'attribution, et ne suffisent pas à prouver qu'une agence gouvernementale précise a édicté une règle.
La construction de la liste de test est également une source de biais. Un projet qui ne sonde que des sites politiques connus au niveau mondial peut manquer des enjeux locaux, linguistiques ou culturels. En 2018, un projet a utilisé le traitement du langage naturel et la recherche pour identifier 1 125 sites absents de la plus grande liste de blocage chinoise de l'époque. L'extension de la liste a amélioré la couverture de cette étude, mais il s'agit toujours d'un artefact temporel, soumis au vieillissement à mesure que les noms de domaine, les contenus et les politiques évoluent.
GFWeb, publié à USENIX Security 2024, a étudié pendant 20 mois consécutifs le filtrage HTTP et HTTPS du Great Firewall chinois. L'article rapporte le test de 1,02 milliard de noms de domaine et l'identification de centaines de milliers de domaines de niveau paiement affectés par différents mécanismes. Ce sont des comptages de mesure, pas un recensement des personnes affectées. La valeur est de montrer que différents tests de protocole révèlent différentes parties du système de filtrage, et qu'une technique unique peut sous-estimer l'ampleur du blocage.
L'étude sur le Turkménistan rapporte le test de 15,5 millions de noms de domaine, identifie 122 000 domaines censurés et infère des règles de surblocage qui pourraient affecter des millions d'autres domaines, tout en étudiant les méthodes de contournement. La divulgation des techniques de contournement peut aider les utilisateurs, mais aussi apprendre au censeur ce qu'il doit bloquer ensuite. Le moment et la connaissance locale sont donc des décisions d'ingénierie qui ont des conséquences humaines réelles.
Le bilan de Feamster dans ce domaine est important et collaboratif. Il a co-écrit des systèmes, aidé à construire une communauté de recherche et continue d'enseigner un cours intitulé Internet Censorship and Online Speech. On ne peut pas, du simple fait de la proximité thématique ou des co-auteurs, le qualifier de fondateur unique de chaque projet d'observation, ni lui attribuer Geneva. Cartographier les articles et les rôles est plus précis que d'utiliser une étiquette générique d'inventeur.
L'éthique de la mesure devient une composante de la correction technique
La recherche sur la censure met en lumière un principe d'observabilité plus général. Un système peut être statistiquement très puissant tout en échouant techniquement parce qu'il ne peut pas fonctionner de manière responsable. Le consentement éclairé, le choix des cibles, la fréquence des requêtes, la minimisation des données et la stratégie de publication déterminent ensemble si une méthode peut être répétée sans causer de préjudice inacceptable.
Cela ne demande pas aux chercheurs d'éliminer tout risque. Face à des États ou des opérateurs réseau hostiles, la sécurité absolue peut ne pas exister. L'exigence est que les risques soient explicites, répartis et comparés aux bénéfices publics attendus. Les personnes qui supportent le plus grand risque ne doivent pas disparaître derrière un total mondial de noms de domaine.
Le même principe s'applique au-delà de la censure. Les sondes de haut débit peuvent exposer les motifs d'activité d'un foyer; les outils IoT peuvent collecter des métadonnées d'appareils; les scores de réputation en sécurité peuvent refuser un service; les jeux de données synthétiques peuvent mémoriser des traces réelles qui devraient être protégées. Chaque système de mesure crée une nouvelle infrastructure, avec ses propres utilisateurs, privilèges et modes de défaillance.
L'histoire professionnelle de Feamster est précisément intéressante parce qu'elle contient une controverse documentée, et non une suite sans accroc de succès. La controverse Encore montre qu'une méthode peut être critiquée, modifiée et conduire à des travaux plus explicites sur la sécurité; elle montre aussi qu'on ne peut pas réécrire les risques initiaux à la lumière des protections ultérieures. Un article sérieux peut reconnaître cet apprentissage tout en conservant le désaccord qui l'a rendu possible.
Les objets connectés montrent ce que le chiffrement ne peut pas cacher
Le chiffrement protège le contenu de la charge utile, mais le réseau doit toujours s'appuyer sur la durée, la taille des paquets, la direction et la destination pour acheminer le trafic. Une prise connectée, une caméra, une télévision ou un assistant vocal peuvent contacter des services prévisibles selon des motifs identifiables. Un observateur incapable de lire les messages peut néanmoins déduire qu'un appareil s'est allumé, a commencé à diffuser une vidéo ou a signalé un événement.
A Smart Home Is No Castlea mis en évidence ce canal auxiliaire, etSpying on the Smart Homea évalué plus avant les défenses par mise en forme du trafic. Ce dernier article rapporte que, dans son environnement de test, une défense à débit constant pouvait masquer l'activité avec un surcroît de trafic d'environ 40 ko/s. Ce chiffre n'est pas un coût universel de la vie privée; la combinaison d'appareils, le modèle de menace, la capacité du lien et le degré de masquage nécessaire modifient le compromis.
Cette recherche corrige une simplification courante en matière de vie privée du consommateur. « Chiffré en transit » peut être vrai, alors que le comportement est néanmoins exposé par les métadonnées. Une politique de confidentialité qui ne parle que du contenu peut donc manquer des risques importants. La mise en forme du trafic et le bourrage consomment de la bande passante, de l'énergie ou de la latence, et le coût peut être supporté par le foyer plutôt que par le fabricant.
La vraie question n'est pas de savoir si l'analyse de trafic est possible en laboratoire, mais qui peut observer le domicile, quel type d'inférence est assez fiable pour justifier une action, et quelle partie peut modifier la conception. Les FAI, les attaquants locaux, les fabricants d'appareils et les fournisseurs de cloud disposent de perspectives différentes. La mesure révèle des fuites; la protection du consommateur exige en plus des décisions sur les réglages par défaut, la divulgation, la correction et la responsabilité.
IoT Inspector, un outil pour le consommateur devenu infrastructure de recherche
IoT Inspector a fait passer la recherche sur les objets connectés de l'expérience contrôlée à un outil open source que les utilisateurs peuvent exécuter sur leur propre réseau. Les entités peuvent choisir les appareils à surveiller, voir les destinations qu'ils contactent et, après consentement, contribuer des métadonnées étiquetées à la recherche. L'article de 2020 fait état de milliers d'utilisateurs et de dizaines de milliers d'appareils de multiples fabricants et catégories.
Des rapports ultérieurs ont mentionné différents totaux — 44 956, 54 094, plus de 55 000 ou environ 63 000 appareils — en raison de fenêtres de collecte et de définitions statistiques différentes. Ne retenir que le chiffre le plus élevé sans préciser la date transforme un ensemble de données en évolution en une fausse précision. Ce qui importe vraiment, c'est que le projet a atteint une échelle telle que le support utilisateur, la qualité des étiquettes, la vie privée et la maintenance logicielle sont devenus des questions de recherche de premier plan.
L'outil d'inspection destiné aux utilisateurs expose aussi des ambiguïtés. Un nom de domaine peut être partagé par plusieurs clients cloud, l'étiquette d'un appareil peut être erronée, et la connexion à un traqueur ne dit rien, à elle seule, des données transmises ni du préjudice éventuel. Montrer les destinations peut améliorer la visibilité, mais ne donne pas nécessairement aux utilisateurs un moyen concret d'agir.
Le bilan réflexif de l'équipe du projet a abordé les questions d'incitation, de consentement, de minimisation des données et de maintenance opérationnelle. Ce retour d'expérience est important, car les plateformes de recherche ouvertes peuvent assumer des obligations proches de celles d'un fournisseur de services: conserver des preuves sensibles, dépendre de la compréhension des entités, et expliquer en permanence ce que les résultats de recherche peuvent et ne peuvent pas prouver.
Les travaux connexes sur un échantillon d'appareils médicaux connectés, sur les jouets connectés et sur la perception de la vie privée par les utilisateurs étendent l'approche à la protection du consommateur. Les conclusions doivent être rattachées aux produits, versions et dates précises. Les mises à jour du micrologiciel, les corrections des fabricants et la diversité des déploiements peuvent modifier les résultats.
L'apprentissage automatique pour les réseaux est un pipeline, pas un classificateur isolé
L'apprentissage automatique est entré dans les travaux de Feamster bien avant le cycle actuel de l'IA générative, à travers les recherches sur le spam et la réputation. Le programme ultérieur netml.io rend plus explicite le pipeline complet qui entoure le classificateur: comment les paquets sont représentés, comment les étiquettes sont obtenues, où les caractéristiques sont extraites, à quelle vitesse le modèle s'exécute, comment la dérive est détectée et quelle action est entreprise ensuite.
nPrint représente les paquets dans un format standardisé au niveau binaire, et nPrintML combine cette représentation avec une modélisation automatique. L'objectif n'est pas de prouver qu'une représentation convient à toutes les tâches, mais de réduire la variation cachée dans l'ingénierie des caractéristiques afin de rendre les comparaisons plus reproductibles.
Traffic Refinery étudie le coût système de la production de caractéristiques à haut débit. Si l'extraction de caractéristiques entraîne des pertes de paquets, épuise le processeur ou renvoie un résultat après la fermeture de la fenêtre de décision, un modèle statistiquement précis reste opérationnellement mauvais. LEAF étudie la dérive conceptuelle, c'est-à-dire le changement des relations statistiques lorsque les applications, les appareils et les réseaux évoluent. Les modèles de production ont besoin de critères de ré-entraînement, de mécanismes de retour en arrière et d'un suivi de l'erreur par environnement.
CATO optimise simultanément les objectifs de prédiction et de système. Son évaluation à NSDI 2025 rapporte, dans des conditions expérimentales spécifiques, une réduction de la latence d'inférence jusqu'à 3 600 fois et une amélioration du débit sans perte de paquets d'un facteur 3,7. Ce ne sont pas des garanties générales de production. L'intérêt conceptuel est que la précision statistique doit être optimisée conjointement avec le coût de traitement des paquets.
Les travaux actuels étendent cette logique à la classification à bas coût, aux files d'attente, au choix des sondes, à la mesure en temps réel de L4S et à l'analyse des erreurs de configuration par des modèles de langage. L'article de 2005 s'appuyait sur des invariants explicites; en 2026, un modèle de langage peut inférer un problème « probable » à partir d'exemples et de textes. La nouvelle approche peut couvrir des situations difficiles à formaliser, mais si les suggestions ne sont pas vérifiées par rapport à l'état observable du réseau, elles risquent de remplacer la preuve par un sentiment de plausibilité.
Le trafic synthétique tente de partager des données utiles sans exposer le réseau réel
Les traces de trafic réel sont difficiles à partager. Elles peuvent divulguer des communications, des utilisateurs, des appareils, des structures organisationnelles et des applications propriétaires; les étiquettes sont coûteuses et les traces deviennent rapidement obsolètes. Les données synthétiques proposent une autre voie: générer des paquets et des flux qui conservent des propriétés utiles sans divulguer les enregistrements originaux.
NetDiffusion utilise un modèle de diffusion avec des contraintes protocolaires pour générer du trafic au niveau paquet; NetSSM y ajoute une conscience de l'état et des flux multiples. GATEAU, dirigé par Feamster et Francesco Bronzino, formule le problème plus large comme une relation entre la vie privée, le coût de collecte et la rareté des données étiquetées. Ces projets cherchent une voie intermédiaire entre des paquets aléatoires techniquement valides mais irréalistes et des traces de trafic authentiques mais impossibles à partager en toute sécurité.
Les traces générées peuvent encore échouer de multiples façons. Elles peuvent conserver les statistiques marginales tout en perdant les corrélations nécessaires aux tâches aval; elles peuvent mémoriser des exemples sensibles; elles peuvent respecter la syntaxe du protocole sans reproduire la congestion, l'état des sessions ou le comportement des utilisateurs. Un classificateur entraîné sur ces données peut réussir en test tout en échouant face au trafic de production.
Les travaux de 2026 sur le compromis entre vie privée et qualité traitent ces risques comme des objets mesurables, sans postuler que « synthétique » signifie « anonyme ». C'est la norme correcte. La vie privée doit être testée contre des attaques raisonnables, et l'utilité doit être vérifiée sur les tâches prévues. Le trafic synthétique est un outil de recherche, pas la preuve que le réseau original a disparu.
NetMicroscope teste si un programme de mesure peut devenir une entreprise
NetMicroscope est la traduction commerciale la plus claire des recherches de Feamster sur le haut débit et l'apprentissage automatique. L'entreprise le présente comme CEO et co-fondateur, et Francesco Bronzino comme CTO et co-fondateur. Les supports de valorisation universitaire indiquent qu'ils ont fondé l'entreprise en 2021, avec une équipe à distance centrée sur Chicago et Lyon.
La proposition de valeur est que la fusion du débit, de la latence, de la perte de paquets, de l'état des appareils et des signaux applicatifs en une estimation de la qualité d'expérience utilisateur est plus utile que des indicateurs isolés. Un opérateur peut savoir qu'une ligne est active sans comprendre pourquoi la vidéo se dégrade. NetMicroscope affirme utiliser l'apprentissage automatique pour inférer l'expérience applicative et détecter les problèmes avant les plaintes des utilisateurs.
Les preuves financières vérifiables sont limitées. En janvier 2024, le George Shultz Innovation Fund a accordé 200 000 dollars à l'entreprise pour le développement du produit, du marché, de l'équipe et de la propriété intellectuelle. L'entreprise a également participé aux programmes I-Corps et Compass. Ce sont des signaux commerciaux précoces significatifs, mais ils ne permettent pas d'établir une valorisation, un financement total, un chiffre d'affaires, un nombre de clients, une rétention, une part de marché ou une rentabilité.
La frontière entre l'université et l'entreprise doit être examinée avec une curiosité normale, et non par insinuation. Des articles liés à la classification du trafic peuvent chevaucher le produit commercial, et les lecteurs doivent connaître les relations industrielles du chercheur, ses financements, son accès aux données, ses licences et l'attribution de la propriété intellectuelle. Les documents disponibles ne permettent pas d'affirmer que tout le code de BISmark, de nPrint ou de l'université a été cédé exclusivement à l'entreprise.
NetMicroscope soutient donc une conclusion prudente: l'entreprise teste si des années de recherche sur la mesure peuvent devenir un service opérationnel pour lequel des clients sont prêts à payer. Les preuves publiques confirment les fondateurs, l'orientation du produit et l'obtention d'un financement universitaire, mais ne permettent pas de revendiquer une position commerciale dominante.
L'enseignement transforme la trajectoire de recherche en un cursus sur l'infrastructure
Le parcours d'enseignant de Feamster suit la même évolution que sa recherche. À Georgia Tech, ses cours couvraient l'architecture de l'Internet, la sécurité et les réseaux de nouvelle génération, puis les réseaux définis par logiciel. À Princeton, ils associaient les réseaux à la sécurité de l'information et à la politique technologique. À l'Université de Chicago, ses cours actuels incluent Machine Learning for Computer Systems, Internet Censorship and Online Speech, et Security, Privacy, and Consumer Protection.
Il a co-écrit en 2020 la sixième édition deComputer Networksavec Andrew Tanenbaum. Sa page d'enseignement indique également qu'il a créé et assuré le cours fondateur de réseaux informatiques pour le programme Online Master of Science in Computer Science de Georgia Tech. Les cours en ligne étendent l'enseignement des réseaux bien au-delà d'une seule promotion sur un campus, mais en l'absence d'archives séparées du programme, cette indication fondatrice doit rester liée à son dossier public d'enseignement.
Le prix Quantrell 2026 constitue une preuve institutionnelle indépendante que l'enseignement est une composante importante de sa carrière. L'annonce de l'Université de Chicago met l'accent sur les questions ouvertes, le raisonnement collaboratif et les exercices conçus autour du travail réel. Les évaluations des étudiants sont des données qualitatives, mais la distinction montre que cette carrière ne se réduit pas aux publications et aux start-ups.
La construction institutionnelle élargit encore le public. Feamster a dirigé le Princeton Center for Information Technology Policy, puis a contribué à créer à l'Université de Chicago des programmes qui relient la mesure des réseaux, les politiques publiques et la science des données. Les événements autour de la liberté et de l'ouverture des communications ont aussi favorisé une communauté capable de discuter ensemble d'éthique et de conception de la mesure.
Un récit équitable doit laisser les collaborateurs visibles. De nombreux systèmes ont été mis en œuvre ou dirigés par des étudiants et de jeunes chercheurs. IoT Inspector, les projets sur la censure, les plateformes de test du haut débit et les systèmes d'apprentissage automatique reposent sur de grandes équipes aux nombreux auteurs. Un professeur peut fixer une direction et construire des institutions, mais cela ne fait pas de lui l'auteur unique de chaque résultat.
Le travail sur les politiques fournit des preuves, mais n'exerce pas de pouvoir réglementaire
Le rôle de Feamster dans les politiques publiques s'appuie sur la mesure. L'Université de Chicago indique qu'il a collaboré avec des organismes tels que la Federal Communications Commission et la ville de Chicago. Les projets Internet Equity et haut débit peuvent fournir des preuves sur l'accessibilité, l'abordabilité, la fiabilité et la performance, mais ils ne décident pas de l'éligibilité aux subventions, ne réglementent pas les prix et n'ordonnent pas aux opérateurs de modifier leur réseau.
Cette frontière est importante parce que les preuves techniques acquièrent une autorité lorsqu'elles entrent dans une décision gouvernementale. Un test de débit peut étayer une procédure de contestation, mais les normes juridiques sont fixées par d'autres institutions; une carte d'interconnexion peut montrer un taux d'utilisation, mais elle ne contrôle ni les contrats ni les décisions de routage; un jeu de données sur la censure peut documenter une interférence, mais il ne constitue pas une analyse juridique ou politique complète.
Les travaux actuels sur la vie privée et l'IA transportent la même question dans un nouvel écosystème. Le Google Privacy Faculty Award soutient l'étude de l'intégration de tiers dans les systèmes de modèles de langage. L'utilisateur peut ne voir qu'une seule interface, tandis que les invites, le contexte et les attributs inférés circulent entre des modules d'extension, des API et des services distants. La structure est analogue à celle des objets connectés: un produit visible coordonne de multiples relations cachées sur les données.
La liste des publications de 2026 inclut également des travaux sur l'« inférence implicite par les LLM »: même sans fournir d'identifiants traditionnels, le modèle peut inférer des attributs sensibles. Cela rend la minimisation des données plus difficile. Supprimer un nom ou un numéro de compte n'empêche pas le modèle d'inférer des informations de santé, politiques ou démographiques à partir d'interactions ordinaires.
La valeur politique de ces travaux est de rendre visibles les frontières de la preuve. Un modèle, un jeu de données ou un professeur peut éclairer une décision sans détenir le pouvoir de décision. Une utilisation institutionnelle rigoureuse exige des méthodes transparentes, des estimations d'erreur, des données versionnées et une distinction claire entre « ce que la mesure dit » et « ce que l'autorité compétente décide de faire ».
Ce que cette carrière rend visible, et ce qui reste caché
Au fil de ses travaux sur le routage, le spam, le haut débit, la censure, les objets connectés et l'apprentissage automatique, les projets de Feamster ont transformé à plusieurs reprises des problèmes opérationnels dispersés en systèmes de preuve.
rcc a mis en correspondance des configurations avec des invariants; RCP a donné au choix de route une vue plus large; les systèmes de réputation ont inféré une coordination à partir de métadonnées; la passerelle a isolé certains facteurs du haut débit; les systèmes de censure ont comparé des signaux distants; IoT Inspector a relié le trafic des appareils à des étiquettes utilisateur; les projets NetML placent la représentation, le coût de déploiement et la dérive dans un même cadre.
Ces systèmes n'ont pas rendu Internet totalement connaissable. Passer un contrôle de configuration n'élimine pas les pannes physiques; un score de réputation ne prouve pas la « culpabilité »; un test de débit n'explique pas le prix; une anomalie DNS n'identifie pas une agence gouvernementale particulière; les métadonnées chiffrées ne révèlent pas chaque action de l'appareil; les traces synthétiques ne garantissent pas la vie privée; et un modèle de langage n'est pas automatiquement correct parce que son diagnostic est cohérent.
Ces limites ne sont pas une raison de renoncer à la mesure, mais une exigence de concevoir prudemment les systèmes opérationnels qui l'entourent. Une preuve utile doit indiquer sa source, son âge, sa portée et son incertitude. Une action à fort impact devrait disposer de mécanismes de revue, de recours ou de retour en arrière. Les chercheurs devraient préciser si un résultat provient d'un article publié, d'un rapport institutionnel ou d'une reproduction indépendante. Les affirmations commerciales ne peuvent pas hériter automatiquement de l'autorité des publications académiques en l'absence de preuves indépendantes.
La contribution durable de Feamster est d'avoir construit, de façon répétée, cette couche intermédiaire entre des infrastructures opaques et des décisions majeures. Son travail aide les opérateurs, les chercheurs, les utilisateurs et les institutions publiques à poser de meilleures questions à des systèmes qui n'ont pas été conçus pour « s'expliquer eux-mêmes ». Le résultat n'est pas une certitude absolue, mais une spécification plus rigoureuse de ce qui relève de l'observation, de ce qui relève de l'inférence et de ce qui nécessite encore un jugement.

