Resumen

  • Las categorías cliente-proveedor y par-a-par de un conjunto CAIDA resultan de rutas observadas, limpieza, supuestos estructurales y validación; no son copias de los acuerdos privados.
  • Antes de tomar una decisión, hay que conservar instantánea, colectores, método y alcance de validación, y buscar pruebas separadas de precio, tráfico, ubicación, diversidad y resultado operativo.

Una flecha que viaja sin su método

El atractivo del mapa está en su economía. Miles de trayectorias BGP quedan reducidas a pares de sistemas autónomos y una dirección. La reducción permite calcular jerarquías, estudiar evolución y localizar preguntas. También facilita un error: la etiqueta se copia en otra base, se convierte en “contrato de tránsito” y termina alimentando una decisión que exige mucha más evidencia.

Una relación inferida responde cuál modelo de política explica mejor lo que se vio. No informa del precio, la capacidad contratada, los puertos, el ámbito geográfico, los prefijos cubiertos, las rutas de respaldo ni la vigencia legal. Tampoco dice cuántos bytes circularon o qué ocurriría durante una avería.

La materia prima es una vista exportada

La RFC 4271 obliga a que una ruta BGP lleve AS_PATH, la secuencia de sistemas autónomos por la que pasó la información. La secuencia describe propagación. La selección de rutas y lo anunciado a cada vecino dependen de la política local. Un AS puede exportar a un colector sólo sus rutas de clientes y reservar otras vistas para sesiones distintas.

RIPE RIS recibe datos mediante sesiones con sus pares. Hay colectores conectados a redes de intercambio y colectores multihop. Su archivo no es menos valioso por ser parcial; al contrario, su utilidad aumenta cuando conocemos el punto de observación y el vecino que habló.

El estudio CAIDA de 2013 construyó su entrada con tablas de Route Views y RIS, una por día durante los primeros cinco días de cada mes. Después unió los caminos encontrados. En la población histórica descrita, aproximadamente un tercio de los contribuyentes ofrecía una vista completa y 64% mostraba rutas a menos de 2,5% de todos los AS. No son cifras actuales. Son una demostración de que “no observado” y “no existente” nunca fueron equivalentes.

Clasificar exige añadir supuestos

Las rutas no contienen un campo que diga “este vecino me paga”. Los primeros métodos aprovecharon una regularidad económica: un camino típico asciende desde clientes a proveedores, cruza como máximo un enlace de peering y desciende hacia clientes. La forma sin valle permite proponer direcciones, pero puede aceptar muchos caminos válidos incluso con aristas equivocadas.

El trabajo colectivo de 2005 y 2007, con kc claffy entre sus autores, introdujo objetivos adicionales y validación. Señaló que ciertos desempates generaban clasificaciones absurdas y que los pares laterales eran difíciles de ver. Un gran operador podía terminar etiquetado como cliente de uno pequeño si la topología aparente dominaba al contexto.

En 2013, el equipo presentó otro algoritmo. Limpió caminos, formó una clique de tránsito superior, ordenó los AS por grado de tránsito y evaluó tripletas adyacentes. Supuso que la conectividad global suele requerir un proveedor, que existe una clique superior y que las relaciones proveedor-a-cliente no forman ciclos. Primero infirió enlaces cliente-proveedor y luego asignó ciertos enlaces restantes como pares.

El mapa contiene por tanto observación y teoría. Si cambia el conjunto de rutas, la limpieza, la clique o la versión del procedimiento, una etiqueta puede cambiar sin que las partes hayan renegociado nada.

Los porcentajes no certifican una arista

La validación de 2007 consultó a administradores y negociadores. Respondieron 38 de 78 AS contactados y describieron 3.724 relaciones. En ese conjunto, el método acertó 96,5% de las relaciones cliente-proveedor, 82,8% de las de peering y 90,3% de las relaciones entre sistemas hermanos, 94,2% en total.

Los autores registraron dos límites. La participación fue voluntaria y las relaciones verificadas representaron 9,7% de los enlaces del grafo público. Además, las tablas BGP omitían hasta 86,2% de las adyacencias declaradas por esos participantes, sobre todo pares. Una clasificación precisa de lo visible podía coexistir con un mapa muy incompleto.

En 2013 se amplió la evidencia con informes directos, políticas RPSL coherentes y comunidades BGP documentadas. Se validaron 43.613 de 126.082 inferencias cliente-proveedor y par-a-par, 34,6%. Para esa muestra, las tasas fueron 99,6% y 98,7%. Las propias fuentes de validación discrepaban alrededor de 1%.

Aplicar 99,6% a una pareja concreta sería alterar el denominador. Una arista puede estar respaldada por información de operador o depender de un rincón poco visible de la topología. El porcentaje caracteriza una población probada con un método y una fecha; no adjunta una garantía a cada línea descargada hoy.

El problema de una sola etiqueta

La documentación actual de CAIDA reconoce que dos AS pueden tener relaciones diferentes según ubicación o prefijo. El modelo asigna una sola relación a la pareja. Una empresa puede comprar tránsito en una región y mantener peering en otra; un acuerdo puede ser parcial, híbrido o comercialmente distinto de la categoría usada para modelar la propagación.

El cono de clientes amplifica esa simplificación. Se obtiene siguiendo enlaces de clientes y ayuda a comparar alcance o posición. Pero el artículo de 2013 advierte que no es una construcción metodológicamente limpia cuando existen relaciones híbridas. No es una lista de clientes auditada, una cifra de ingresos ni una predicción universal de trayectorias.

Serial-1 y serial-2 tampoco significan lo mismo. El primero usa caminos BGP limpiados de Route Views y RIS. El segundo añade comunidades, looking glasses, traceroute e inferencias sobre propiedad de routers. Una arista añadida por serial-2 puede reflejar mejor cobertura, pero su procedencia sigue siendo una cadena de observación e inferencia.

kc claffy y la infraestructura de conocimiento

CAIDA identifica a kc claffy—también Kimberly Claffy—como investigadora principal y responsable de actividades científicas y de infraestructura. La UC San Diego, al relatar el Premio Postel de 2017, destacó la construcción de medios para recolectar, conservar y compartir datos de Internet.

Ese compromiso de largo plazo explica el perfil. No convierte una obra de equipo en invención individual. Los artículos citan, en distintas etapas, a Xenofontas Dimitropoulos, Dmitri Krioukov, Marina Fomenkov, Bradley Huffaker, Young Hyun, George Riley, Matthew Luckie, Amogh Dhamdhere y Vasileios Giotsas. La historia importante es la de una institución que publica no sólo respuestas, sino métodos revisables y límites.

Un rol negociado es otra capa, no toda la verdad

La RFC 9234 permite que dos hablantes eBGP confirmen roles para una sesión y define el atributo Only to Customer para prevenir fugas. Esa negociación constituye evidencia más directa de la semántica de propagación configurada que una inferencia externa desde caminos.

Aun así, no abre el contrato ni mide el tráfico. La RFC contempla relaciones complejas y su despliegue no es universal. Conviene mantener una escala de estados: anuncio observado, adyacencia inferida, categoría inferida, rol confirmado por los vecinos, contrato y resultado medido. Ninguno sustituye automáticamente al siguiente.

Un recibo mínimo para usar el mapa

Cada arista debería conservar familia de datos, fecha, familia de direcciones, colectores, pares de entrada, versión del algoritmo, fuentes auxiliares y alcance de validación. Cuando cambie, hay que conservar ambos estados y preguntar si cambió la red, la visibilidad, el insumo o el modelo.

Las decisiones de mayor coste requieren pruebas del dominio correspondiente. Una confirmación de operador sirve para política de rutas; un contrato, para obligaciones; telemetría, para tráfico; puertos y sedes, para diversidad; registros de incidentes, para impacto. Así el mapa conserva su fuerza: hace investigable una estructura privada sin fingir que la ha sustituido.

Fuentes