总结

  • RPKI 可用性是一个端到端属性。服务器健康检查可能是绿色的,而外部验证器却获取到陈旧、不完整、不一致或密码学上不可用的材料。
  • 短暂的中断不一定改变路由验证,因为依赖方会缓存先前已验证的对象。但当中断导致清单或证书吊销列表超过下一次更新时间、证书过期或所需的变更从未对外可见时,则会产生后果。
  • 公开事件展示了不同的故障类型:2019 年,APNIC 报告 rsync 不一致而 RRDP 保持有效;2020 年,RIPE NCC 在静默发布失败后报告 CRL 过期,以及 2021 年父子证书发布不一致;2022 年,JPNIC 报告在发布停止足够长时间后 ROA 变为 NotFound。
  • 可靠的服务承诺应衡量来自独立网络的成功获取、协议完整性、密码学有效性、新鲜度余量、已验证的有效载荷变化、恢复收敛以及任何相关的路由验证变化。
  • 归因需要从授权变更到证书生成、发布、外部检索、验证、路由器交付和路由策略的有序时间记录。没有这一链条,注册机构、仓库、软件供应商和网络运营商可能会相互推诿。
  • 路由影响不能仅从仓库故障推断。运营商制定本地策略,使用不同的软件和刷新间隔,并看到不同的 BGP 路径。报告应说明观察到的群体,并保留未知因素,而不是声称通用的中断率。
  • NRS 可以通过赞助中立探测、通用事件字段和外部可复制的保证标准来加强注册机构的合法性。其积极作用是使有限的机构声明可验证,而不是宣布每一次仓库中断都造成了客户损失。

中断始于依赖方,而非服务器机房

决定性的 RPKI 事件并非仓库运营商控制台上的红灯,而是外部依赖方未能获取并验证网络期望用于路由起源决策的材料。这两个事件可能同时发生,但并不相同。

仓库运营商可能观察到健康的处理器、开放的套接字和成功的本地请求,而其他地方的用户却遭遇 DNS 故障、内容分发节点损坏、TLS 不匹配、rsync 树不完整、RRDP 会话不一致或签名集不再形成有效路径的对象集。反之,仓库可能数小时不可达,但只要缓存材料仍可用且未错过紧急更新,运营商的已验证视图就可能保持不变。

这种区别不仅仅是技术上的标点。政策文件常将可用性视为机器的属性:月内分钟数除以分钟数。RPKI 是一种嵌入在分布式安全决策中的发布服务。其有用输出是一组经过验证的断言,而非一个响应的网页。因此,停在仓库边缘的测量衡量的是运营商服务自身的能力,而非依赖方依赖的能力。

适当的问题应从外部可观察到:在给定的时间、给定的网络、使用给定的协议和验证器版本,依赖方能否获取所述认证路径所需的完整材料、根据适用标准验证它,并在新鲜度耗尽前产生预期的已验证有效载荷?

这个问题比“服务器是否运行?”更长,因为服务更长。它也更能公平分配责任。它可以显示仓库端失败、路径特定可达性问题、验证器缺陷、过期的本地缓存或路由器交付延迟,而不假装这五种情况是同一种事件。

RPKI 发布是一个时间依赖链条

RPKI 使运营商能够评估一个自治系统是否被授权发起一个前缀。资源持有者创建路由来源授权。证书将相关的号码资源绑定到认证路径。仓库发布证书、ROA、清单和证书吊销列表。依赖方软件获取并验证这些对象,产生已验证的有效载荷,并通过 RPKI 到路由器协议提供给路由系统。路由器根据本地策略对分类为 Valid、Invalid 或 NotFound 的 BGP 公告应用策略。

该序列中的每个动词都有其自身的故障边界。持有者可能提交错误的起源或最大长度。认证服务可能颁发不一致的证书。发布服务可能未能暴露完成的变更。一种访问协议可能正常工作而另一种失败。依赖方可能拒绝过多、保留太少或刷新太慢。RTR 会话可能停止携带当前集合。路由器可能接收到该集合并应用意外策略。一条路由可能被一个网络过滤而被另一个接受。

仓库是核心,因为所有依赖方都需要一个可检索的发布视图,但它不是路由器,也不指挥通用响应。RFC 7115 使路由策略本地化。这限制了仓库报告可能诚实声称的内容。它可以确定对象不可用或无效,某些已验证的有效载荷在特定软件下消失,以及所选观察点处观察到的路由状态发生变化。但它无法仅凭这些事实推断每个运营商的策略或每个客户的可达性。

时间连接各层级。在充足新鲜度余量期间的十分钟中断不同于跨越清单 nextUpdate 的十分钟中断。延迟的新 ROA 不同于先前有效 ROA 的消失。为一个验证器提供连续性的缓存可能在另一个验证器中缺失或接近过期。因此,服务质量必须表示为一系列有时间标记的证据,而非单一持续时间。

内部正常运行时间是必要且远远不够的

传统的可用性监控询问主机或应用是否响应。这仍然有用。运营商应知道源服务器、存储、签名服务、发布工作者、DNS、TLS 终止和分发节点是否健康。但内部检查有三个结构性盲点。

首先,它通常始于提供商自身网络内部或附近。它可能绕过外部验证器遇到的 DNS 解析器、对等路径、地址族、内容分发节点或访问控制。从同一设施发出的成功请求对于从非洲、亚洲、欧洲或美洲的可达性几乎没有意义。

其次,它往往测试传输而非含义。HTTP 状态 200 可能交付旧的 RRDP 通知文件。rsync 守护进程可能回应但暴露了部分更新的树。文件可能存在但不在当前清单中、列出的哈希错误、在无效链下签名或与过期的 CRL 配对。服务器存活,但断言不可用。

第三,内部监控通常知道发布了某个操作,但不知道独立用户是否收到了它。队列可能在数据到达源目录时标记任务完成,即使分发层保留了之前的视图。尝试发布与外部可见发布之间的差异正是保证服务必须审视的地方。

一个外部可复制的标准并不丢弃提供商遥测。它将其放在正确的位置。内部证据解释原因并加速修复。外部证据建立用户可见的状况。服务承诺应两者兼得,并指定分歧如何解决。如果内部检查显示健康,而多样化的外部验证器语义上失败,则在差异被解释之前,服务处于降级状态。

缓存将简单中断变成与密码学时间的赛跑

RPKI 设计时考虑了本地缓存,因为仓库和网络路径不能假设持续可达。RFC 8182 建议依赖方保留旧对象,RFC 9286 建议在获取失败时继续使用缓存对象,直到它们过期或可成功替换。这是一个重要的连续性特性。这也是原始宕机时间作为风险描述不好的原因。

在中断开始时,两个依赖方可能持有不同但有效的缓存状态。一个刚刚刷新;另一个接近其下一个预定检索。它们剩余的新鲜度余量不同。如果仓库快速恢复,两者可能继续产生相同的已验证有效载荷。如果恢复在相关时间边界之后到达,一个可能比另一个更早丢失对象。第三个实现可能对过期材料采用不同的本地策略。

因此,事件至少有三个时钟。第一个测量外部获取失败。第二个测量每个受影响认证分支的新鲜度余量。第三个测量已验证输出实际变化的时间。政策报告通常只发布第一个(如果有的话)。然而,第二个确定紧迫性,第三个确定安全服务后果。

缓存也可能掩盖失败的更新。现有对象仍然有效,因此整体验证看似稳定,但持有者新创建的修正却缺失。如果缺失的变更是为了授权迁移或修复意外的 Invalid 状态,旧材料的连续性并不意味着服务对受影响持有者可用。读取可用性和变更发布可用性需要分开衡量。

一个合理的报告会将这些时钟绘制在一起。它说明独立获取何时首次失败、观察到相关过期或过时的最短时间、预期变化何时停止出现、验证器何时改变输出,以及多少比例的探测收敛于恢复。这样的描述显示缓存弹性是否奏效,以及系统离更严重后果有多近。

清单和吊销列表使语义可用性可测试

一个 RPKI 仓库不仅仅是一个签名文件的目录。清单枚举与认证权威相关的签名对象并包含哈希。它们帮助依赖方检测删除、替换和不完整的视图。证书吊销列表识别被吊销的证书。它们的时间字段创建了关于新鲜度的外部可见期望。

RFC 9286 为服务测量提供了一个异常有用的基础。依赖方必须获取证书标识的清单,检查当前时间是否在清单间隔内,获取每个列出的文件并验证每个哈希。无效或过期的清单、缺失的列出文件或哈希不匹配是一次获取失败。依赖方应继续使用适当的缓存版本,直到它们过期或成功获取替换它们。

这意味着外部观察者无需信任运营商关于发布完整的声明。观察者可以测试签名清单与检索到的文件。它可以记录验证停止的确切认证权威、原因、协议和剩余缓存余量。从独立网络重复该测试创建了可验证的可用性历史。

相同的方法避免夸大。一个分支失败不会自动使无关分支失效。一个委派的发布点不可用不应报告为证明区域信任锚下的每个对象都消失了。结果应限定在受影响的权威、对象和验证器。过于宽泛的标签既模糊工程也模糊问责。

语义测量也防止反向错误:将可达端点视为健康仓库,而时间字段或对象一致性已失败。在 RPKI 中,完整性控制是可用性的一部分,因为不能安全依赖的文件不是承诺的服务。

2020 年 JPNIC 中断表明为何宕机时间不等于影响

JPNIC 报告其 ROAWeb 和 RPKI 仓库于日本时间 2020 年 5 月 15 日 23:29 至 5 月 16 日 10:01 因硬件相关电源故障不可用。用户无法创建或删除 ROA,外部方无法下载证书、ROA 和其他文件。这显然是服务中断。

然而,JPNIC 也报告基于先前下载的 ROA 的验证结果未改变,因为证书过期以及 CRL 和清单的 nextUpdate 值未被超过。这是一个外部服务承诺应保留的区别。发布端点故障约 10.5 小时,但通知中描述的缓存验证功能在所述条件内继续为对象和用户服务。

该事件仍然重要。持有者暂时失去了进行变更的能力。新需要的授权或撤销无法完成。没有相关先前缓存或具有不同本地条件的验证器可能未享受相同连续性。公开通知并未确定每个依赖方的状态或每条路由的可达性。它确立了关于未更改发布内容和未耗尽新鲜度时间的有边界、技术上有效的声明。

这比称事件为无害或灾难性更好。一个设计良好的指标会报告管理操作和发布获取的单独不可用性,然后报告测试缓存状态中观察到的零已验证输出变化。它会披露用于得出该结论的探测、对象分支和验证器。

教训是积极的。密码学时间和缓存可以按设计吸收仓库故障。政策应奖励这种弹性,同时仍记录被拒绝的变更服务。提供商不应因路由连续性而获得可用性信誉,也不应在持有者无法发布必要更新时获得全额信誉。

2019 年 APNIC 事件表明为何每个访问协议需要自身的结果

APNIC 关于 2019 年 12 月 13 日的服务公告描述了一次 20 分钟的部分 RPKI 中断。rsync 仓库状态不完整,发布了一个过期的、被撤销的清单,导致许多证书和 ROA 无效。使用 RRDP 的验证器未受影响,继续看到完全有效。

因此,一个事件产生了两种实质性不同的外部现实。仅测试 RRDP 的监控会宣布成功。仅测试 rsync 的监控会发现语义失败。服务器级别的平均值可能将两者平均成令人放心的百分比,同时隐藏了一个标准支持方法的用户收到了不可用的视图。

协议多样性可以提供弹性,但前提是测量保留区别。相关指标包括 RRDP 通知检索、快照和增量完整性、会话和序列进展、rsync 可达性、树完整性,以及在首选方法失败时是否发生回退。提供商还应披露两种方法是否共享一个源、存储系统、网络路径或更新过程,因为名义上独立的访问方法可能具有共同的故障模式。

依赖方行为应包含在描述中。RFC 8182 允许在 RRDP 出现问题时使用替代访问机制,但配置或实现的回退并不能保证在每个部署中工作。2020 年对依赖方的研究发现,在其实验条件下存在不一致的获取行为。这些结果来自一组有限的被观察认证权威和测试;它们不是所有当前验证器的分母。它们确实表明发布运营商应测试实际客户端行为,而非从协议设计推断。

外部承诺绝不应发布一个没有协议细分的 RPKI 可用性数字。如果一种方法提供完整有效的视图而另一种不提供,则服务对某些用户有弹性而对其他用户降级。两个事实都应包含在标题中。

2020 年 RIPE NCC 失效显示了静默发布间隙的危险

2020 年 2 月,RIPE NCC 报告一个磁盘问题阻止了新创建、修改或删除的 ROA 到达其发布服务器。通知识别了 176 个这样的变更。受影响的信息保留在其他地方,但发布未发生,且磁盘未报告问题以提醒工程师。

在任何密码学对象过期之前,这已经是一次中断。面向持有者的操作和外部可见状态已经分歧。用户可能合理认为变更已被接受,而依赖方继续检索旧状态。服务在发布确认时失败,即使文件仍在提供。

然后事件跨越了第二个边界。RIPE NCC 报告 CRL 过期,之后底层对象也过期。异常状况根据依赖方软件呈现不同。修复需要的不仅仅是清除磁盘问题;该组织在解决前执行了完整的认证权威密钥轮换。

传统正常运行时间既错过了静默阶段也错过了语义悬崖。一个外部可复制的测试本应将签名或其他可验证的已接受变更参考与观察到的发布进行比较,跟踪 CRL 新鲜度余量,并在仓库视图未能前进时发出警报。独立验证器随后会显示过期的分支如何在命名版本下影响输出。

该事件也展示了为何状态发现是服务质量的一部分。故障始于星期六,CRL 在星期日过时,该组织表示在星期一才收到通知。一个仓库可以持续监控,但如果其检查未验证新的权威状态在外部存在,则操作上仍然是盲目的。

政策不仅应询问工程师修复已知事件有多快,还应询问服务在有人知道之前错误了多久。平均外部检测时间是 RPKI 的一级指标。

2021 年 RIPE NCC 事件表明完整性可能仅对某些验证器失败

2021 年 1 月 7 日,一次外发资源转移导致 RIPE NCC 的系统发布了更新的父证书,先于相关的子证书。在不一致的间隔期间,子证书声称了父证书中不再存在的资源。该组织报告使用严格清单解释的旧版依赖方实现拒绝清单中列出的所有证书(当一个条目无效时)。

因此,相同的发布状态根据软件版本产生了不同的结果。RIPE NCC 根据访问日志估计有 327 个依赖方实例受影响,并警告该事件可能导致中断。它并未声称 327 个网络丢失了可达性,更不用说信任锚下的每条路由都失败了。这种克制很重要:实例计数不是网络计数,被拒绝的证书也不是通用客户影响分母。

该事件暴露了使用单一参考验证器的政策报告的弱点。一致性在演变。实现以不同方式处理困难案例,错误被修复,运营商以不同速度更新。仓库可以通过最新实现,而对已部署的旧版人群造成严重后果。

外部保证应维护一个由支持和实际部署的验证器组成的公开兼容性面板。它应记录认证分支和已验证有效载荷级别的输出差异。该面板不是对标准合规性的投票;不合规的实现应被识别为如此。它是更新传播期间可预见的操作暴露的度量。

RIPE NCC 提出的补救措施也指向正确的指标。它寻求原子发布和更短的不一致窗口。服务目标应测量外部观察到的原子性:没有探测应检索到无法共同验证的父状态和子状态。这比测量两个内部更新作业完成的速度更有意义。

2022 年 JPNIC 事件显示了从 Valid 到 NotFound 的延迟转换

JPNIC 2022 年 2 月的通知报告称,不断增长的访问日志在 1 月 26 日至 2 月 2 日期间填满了仓库服务器磁盘。发布过程无法更新 CRL 或清单中的 nextUpdate 字段。一旦这些字段过期,相关 ROA 无法再被客户端验证,它们覆盖的路由被检测为 NotFound。

这个序列很重要。服务不一定直接将路由从 Valid 移动到 Invalid。它移除了可用的授权证据,为受影响的验证视图产生 NotFound。许多操作策略接受 NotFound,通常与 Valid 具有不同偏好。安全后果可能是保护丧失而非立即的可达性丧失。一个将每个消失的 ROA 称为路由中断的报告混淆了这些结果。

事件持续时间足够长,以至于缓存连续性耗尽。一个仅基于成功 TCP 连接的可用性度量将特别具有误导性,如果服务器在发布新鲜度停止时仍在应答。有用的警报是距离 nextUpdate 的时间减少,同时未能观察到新清单和 CRL。

JPNIC 还说一位知识渊博的用户报告了问题。这一事实支持机构改革:独立监控应具有定义明确、已验证且持续在岗的通往仓库操作的路径。外部发现不应依赖于专家是否恰好注意到异常并找到合适的联系人。

对于此类事件的报告应量化,在测量集内,每个受影响的 ROA 何时停止产生已验证有效载荷,哪些路由在选定的 BGP 观察点从 Valid 变为 NotFound,以及是否有任何运营商报告了策略或客户后果。如果客户数据不可用,则应保持不可用,而非从 ROA 数量推断。

2022 年 ARIN 降级显示了传输冗余的价值和局限

ARIN 报告了 2022 年 8 月 11 日 90 分钟的 RRDP 服务降级,原因是配置更改导致某些服务节点上安装了不匹配的证书材料。该组织从 DNS 轮换中移除了受影响的节点,恢复了匹配的材料并重启了仓库生成。其 rsync 服务在整个过程中保持正常运行,而六个 ROA 的发布被延迟。

这是一个部分弹性的有用案例。替代发布方法仍然可用,提供商给出了有限数量的延迟变更。但这并不意味着每个依赖方都通过回退获得了这些变更。运营商可能偏好 RRDP、应用重试计划、缺乏有效的回退,或者其网络路径以不同方式到达一种服务。

正确的计分卡应显示按协议和观察点的成功检索、回退尝试和结果、六个受影响 ROA 的发布延迟以及修复后的已验证输出收敛。它还应区分公共仓库的现有状态与生成新状态的临时暂停。对于拥有当前缓存的运营商,可用性与等待其中一个延迟 ROA 的持有者不同。

冗余只有独立演练时才值得信赖。由相同错误配置节点池服务的两个 URL 不是两个控制。具有不同故障模式的 RRDP 和 rsync 可以改善连续性,但提供商应证明验证器能在新鲜度耗尽前使用幸存路径。定期演练(例如有控制地撤回一种方法)可以揭示回退是否有效,而无需等待紧急情况。

这正是外部测试胜过架构图的地方。它们显示客户端实际采取的路径、实际验证的视图以及延迟断言变得有用时的时间。

仓库服务承诺需要四个单独的服务目标

第一个目标是检索可用性。从独立观察点,依赖方能否解析仓库名称、通过支持的地址族连接、协商所需传输并检索 RRDP 或 rsync 材料?结果应按协议、IP 版本、区域和网络提供商划分。月平均不应隐藏某一组合的完全失败。

第二个是语义可用性。检索到的视图是否包含当前有效的清单、具有匹配哈希的列出对象、可用的 CRL 和有效的认证路径?验证器能否产生预期的有效载荷集而不丢弃无关分支?该目标将密码学正确性转化为服务指标。

第三个是发布及时性。在授权操作被接受后,独立探测观察到新对象并产生相应有效载荷变化需要多长时间?该目标涵盖创建、修改、撤销、转移和紧急更正。它需要一个隐私保护的参考,允许审计员将操作与发布匹配而不暴露账户机密。

第四个是恢复收敛。修复后,定义的一组独立验证器达到相同的当前视图且路由系统接收到它需要多长时间?在源端修复但在分发节点仍过时的仓库尚未完全恢复。同样,文件当前但 RTR 会话仍提供旧有效载荷集的仓库也未完全恢复。

每个目标需要明确的分母。检索可使用计划的探测尝试。语义可用性可使用预期当前的认证分支。发布及时性可使用符合立即发布条件的已接受操作。恢复可使用具有已知事件前状态的活跃探针。混合这些群体将产生有吸引力但无意义的百分比。

四目标模型也支持公平归因。仓库可能满足检索但语义完整性失败,或两者都满足但持有者请求的变更仍错误。运营商和监督机构可以精确看到哪个承诺失败。

独立探针必须足够多样以挑战提供商的假设

一个中立测量网络应包括位于多个区域和自治系统的探针,在提供的情况下同时使用 IPv4 和 IPv6。它应避免将所有探针集中在一个路径或解析器可能作为整体故障的云中。数量和位置无需假装代表每个互联网用户;它们必须公开披露,以便读者理解观察到的群体。

每个探针应使用受控时钟,记录 DNS 答案、目标地址、传输时序、协议响应、对象哈希、验证器名称和版本、信任锚材料、缓存状态和最终已验证有效载荷摘要。敏感操作细节可以保护,但应发布足够证据供另一合格方重复测试。

新鲜和热缓存模式都是必要的。新鲜验证器显示新依赖方能否构建视图。热验证器显示已建立的运营商能否在故障中继续。仅测试新鲜实例夸大了即时损失;仅测试热实例隐藏了入职和缓存耗尽风险。

探针应以实际间隔检索,同时尊重仓库容量。一个压垮服务的测量系统创造了它声称观察的条件。提供商和研究者可以同意速率限制和专用标识,而不给提供商绕过常规分发的路径。

误报需要自律处理。单个探针故障可能源于其解析器、本地时钟、磁盘、验证器或上游路径。事件声明应使用预公布的规则,例如跨最小数量独立网络的语义失败或提供商确认。局部故障仍应包含在数据中,但并非每个都成为全局通知。

标准应发布探针代码、测试向量和结果定义。可复现性来自共享方法和签名观察,而非机构声望。

新鲜度余量是绿色仪表板无法提供的风险指标

在任何时刻,一个仓库分支在相关清单或 CRL 过期或证书过期之前都有剩余间隔。该间隔就是其新鲜度余量。它将普通的获取问题转化为操作风险度量。

假设外部探针获取一个分支失败,而其当前清单还有 18 小时。该事件值得关注,但缓存验证器有继续的空间。如果余量降至一小时而未恢复,相同的传输条件变得紧急。如果新需要的撤销也在等待,安全风险可能已经很高,尽管旧对象未过期。

提供商应报告受影响分支余量的最小值、中位数和分布,而不仅仅是仓库范围的最小值。一个具有异常短间隔的委派权威不应被用来暗示每个分支都接近失败。同样,长期有效的父证书不应掩盖接近过期的子清单。

余量支持消耗率警报。如果事件消耗新鲜度余量的速度快于恢复信心的上升,应在过期前升级。这类似于管理储备:服务尚未语义失败,但其吸收延迟的能力正在缩小。

对象时序并非全部风险。等待新授权的持有者可能没有实际余量,因为网络迁移正在进行中。事件记录应允许受影响持有者标记紧急的预期变更,并附有证据和审查,而无需公开暴露机密的商业计划。

一个发布余量的政策报告解释了为何一次十小时的中断没有验证变化,而另一次多日发布失败却有。它给予董事会和运营商一个原始正常运行时间无法提供的关于紧迫性的共同语言。

归因需要从授权操作到路由效果的共享序列

当 RPKI 事件变得有争议时,每个参与者只看到序列的一部分。持有者知道其请求。认证服务知道其接受和签署的内容。仓库知道其提供的内容。依赖方知道其获取和拒绝的内容。路由器知道其使用的有效载荷集和策略。客户知道服务变得不可达。没有相关的时间,责任就成了断言。

一个通用事件记录应为每个实质性操作分配一个稳定参考,并记录六个里程碑:授权被接受、对象产生、对象外部发布、对象被获取和验证、有效载荷交付给路由器、以及观察到相关路由决策。每个里程碑应识别负责机构和时钟源。公开报告可以哈希或聚合敏感参考,同时保留序列供独立审查。

该方法区分了错误对象与不可用对象。如果持有者请求了错误的最大长度且服务忠实发布了它,责任不同于产生与注册状态不一致的证书的代码缺陷。如果仓库发布了正确的对象但过时的验证器拒绝了更广泛的分支,提供商仍负有兼容性和通信职责,但直接技术原因不同。

归因还需要反事实测试。调查者可以通过命名验证器重放观察到的对象集并比较产生的有效载荷,然后将运营商声明的路由策略应用于捕获的 BGP 公告。这不会重建每个数据包或丢失的事务。它测试声称的链条是否技术上可能以及状态在何处首先分歧。

没有机构应控制该证据的唯一副本。提供商可以签署里程碑记录;中立监控可以签署外部观察;运营商可以保留 RTR 和路由策略历史。共享证据使狭义责任成为可能,这比全面指责和全面豁免都更公平。

路由影响必须衡量,而非从对象数量推断

仓库事件可以在不改变可达性的情况下改变路由安全。当有效 ROA 从可用视图消失时,公告可能变为 NotFound 并仍被接受。对未授权起源的保护可能减弱,但合法路由可能仍工作。当不一致的证书导致有效授权消失而另一个覆盖 ROA 保留时,路由的状态可能根本不改变。当错误 ROA 使合法公告变为 Invalid 时,拒绝 Invalid 路由的运营商可能撤回可达性,而其他运营商继续接受它。

因此,影响研究从已验证有效载荷差异开始。在每个验证器下,哪些前缀、最大长度和起源元组被添加或移除?下一步将这些差异与命名收集器或运营商馈送处观察到的 BGP 公告结合起来。最终技术步骤应用已公开的策略假设,或者在实际可用时应用实际运营商策略。

客户影响需要单独的证据:警报、流量损失、会话失败、支持报告或服务级别违规。路由收集器看不到每个私有对等路径,且改变的验证状态并不揭示使用了多少流量。报告应避免在没有受影响网络提供的数据时将前缀转化为用户或收入。

同样的纪律保护提供商免受夸大索赔。一个使一个分支暂时 NotFound 的事件不应被描述为证明区域互联网离线。它也保护运营商免受最小化。如果几个独立网络记录了 Invalid 路由被拒绝且流量同时下降,那么声明仓库主机保持可达是无关的。

正确的输出是一个分层的影 响表:受影响的发布对象、受影响的验证有效载荷、受影响的观察公告、有证据表明策略响应的网络以及有文件证明后果的客户或服务。未知的单元格保持未知。

分母应是局部的、公开的且抵抗促销性复用

RPKI 测量吸引令人印象深刻的数字,因为该系统在目的上是全球性的。但没有任何公共观察者拥有依赖方实例、软件版本、缓存历史、路由策略、私有 BGP 路径或最终客户效果的完整普查。一个可信的服务承诺不会制造那个分母。

每个比率应携带其观察到的群体。探测可用性是成功检查除以指定探测集的计划检查。验证器兼容性是成功输出除以面板中的版本和测试用例。发布及时性是目标内观察到的操作除以报告期内符合条件的已接受操作。路由效果是变化的公告除以命名收集器可见的公告。没有一个是“互联网受影响的比例”。

IMC 2020 依赖方研究在有边界时才有价值。它观察到客户到达三个认证权威,并使用受控条件揭示不一致的获取。其报告的比例描述了那个实验,而不是每个当前运营商或每个未来版本。政策报告在引用研究时应保留此类边界。

事件特定计数需要类似的克制。RIPE NCC 估计 2021 年 1 月有 327 个受影响的依赖方实例,来自访问日志和定义的软件行为。实例可以共享一个网络、服务多个网络或是测试系统。该数字是操作暴露的证据,而非断连组织的计数。

好的测量仍然可以有力。可以说出五个独立网络中的每个探针都拒绝了同一分支,所有三个测试的当前验证器丢失了相同的有效载荷,或命名路由在两个收集器处消失。精度增强了问责性,因为该声明可以被复现和挑战。

事件报告应分离原因、条件、后果和置信度

原因是启动失败:磁盘满、顺序错误发布、证书材料不匹配、电源丢失或软件缺陷。条件是外部用户遇到的:获取失败、清单过期、rsync 树不完整、认证路径不一致或变更延迟。后果是观察到的输出:有效载荷移除、状态变化、路由被拒绝或客户中断。置信度说明证据如何强烈地连接它们。

许多通知将这些层次压缩成一个句子。当后来的证据改变时,这会造成混淆。提供商可能在知道原因之前知道条件。运营商可能在提供商复现外部路径之前证明路由后果。分别报告各层使公共记录能在不抹去原始观察的情况下改进。

通知应包括精确的开始和结束定义。开始可能是首次失败的外部语义检查,而非工程师打开事件的时间。结束可能需要来自探测法定人数的成功验证和延迟变更的发布,而不仅仅是进程重启。检测、确认、缓解和完全收敛时间都应可见。

置信度可通过证据分级:由签名对象回放确认、由多个独立验证器观察、由受影响运营商报告或从时间推断。这不是事实的替代。它告诉读者哪里需要进一步调查。

提供商还应发布未测量的内容。如果未收集客户损失数据,请说明。如果 rsync 被测试但 RRDP 日志不可用,陈述差距。如果 BGP 收集器未看到受影响路由,不要将缺失视为无效果的证明。

一份诚实的报告可以简洁且仍然包含这些字段。目的不是官僚长度。而是防止狭窄的正常运行时间声明排挤运营商所需证据。

仅服务信誉对路由安全中断是不良补救

RPKI 发布通常作为会员或注册服务的一部分包含,而非作为单独定价的公用事业出售。因此,传统的费用信誉可能微不足道、难以计算或对依赖方和下游客户不可用。最有价值的补救是操作性的。

首先是快速纠正。提供商需要一条持续在岗的路径来报告错误、缺失或过期的对象,且身份验证不完全依赖于可能受影响的门户。响应目标应根据新鲜度余量和已证明的路由风险而变化。

其次是证据保留。对象版本、发布时间、访问方法状态、验证结果和变更授权应保留足够长时间供调查和合法索赔。覆盖证据的修复使机构只能凭记忆争论。

第三是可移植通信。签名的通知应识别受影响的认证分支和对象摘要,以便验证器和运营商无需信任截图或传言即可确定暴露。更新应说明现有缓存是否仍可用,以及请求的变更是否延迟。

第四是对严重或重复事件的独立审查。审查者应测试外部目标、检查提供商控制并在安全限制内发布结果。提供商撰写的说明是必要的,但不能是唯一的保证,当提供商自身的监控未发现故障时。

财务补救可能仍然重要,在实际损失和法律责任已确定的情况下。其设计涉及责任、因果关系和适用法律。服务承诺不应承诺不可能的赔偿,但也不应使用低或零费用来否认准确发布和及时修复的责任。

运营商也有可衡量的持续性义务

外部问责并不是将所有 RPKI 风险转移到仓库的设备。网络运营商选择验证器、刷新间隔、冗余、监控和路由策略。资源持有者选择 ROA 内容和时机。这些决策实质性地影响后果。

运营商应运行支持的依赖方软件、监控成功的仓库同步、至少保留适用标准推荐的缓存行为,并测试 RTR 冗余。它应知道当有效载荷消失或验证器不可用时其路由器如何行为。共享相同解析器、电源和软件缺陷的第二个验证器并非稳健冗余。

资源持有者应在网络变更前将 ROA 与预期公告比较,避免不必要的宽松最大长度,并在创建或转移后验证外部发布。他们应维护紧急联系人,并理解在托管和委派安排中哪一方控制密钥。

这些义务应出现在事件分析中,而不成为仓库失败的全面借口。如果运营商运行了拒绝超出标准要求的过时软件,那是相关的。如果仓库发布了不一致状态,那也是相关的。多个原因可能促成一个损失。

共享演习可以改善双方。提供商可以宣布一个测试窗口,在此期间撤回一种访问方法,同时运营商验证回退。合成认证分支可以测试过期报警和原子更新而不使生产路由处于风险。运营商可以报告匿名收敛结果。

目标是互证。提供商展示外部发布质量;运营商展示审慎依赖。当两者都被衡量时,剩余不确定性变得可见,而非仅由合同或修辞分配。

NRS 可以将外部保证转化为合法性服务

NRS 认为号码注册机构应维护准确记录、尊重网络的操作角色并保持受限于簿记功能。RPKI 使这一哲学复杂化,因为证书和仓库操作可以影响运营商接受哪些路由公告。适当的回应不是拒绝 RPKI,而是使增加的力量可观察和可问责。

NRS 可以召集持有者、运营商、注册工程师、依赖方维护者和研究人员,围绕一个通用的仓库保证框架。该框架将定义本文描述的四项服务目标、最低事件字段、协议特定测试、新鲜度报告和归因里程碑。参与可从自愿开始,结果按服务和地区发布。

它还可以运营或委托中立探测。独立性要求公开披露资金、开放的测量代码、冲突规则和多个托管网络。NRS 不应通过断言证明自己的倡导。它应发布任何运营商、注册机构或研究人员可以复制的证据。

一个有用的年度审查会将每个参与仓库与其自身发布的目标比较,而非通过粗糙的通用分数对地区排名。它可以识别重复的部分故障、未经测试的回退、缓慢的外部检测或弱的恢复证据。提供商有权纠正事实错误并附上解释,而底层观察仍可获取。

这是一个积极的机构角色,因为它奖励良好表现。例如,JPNIC 2020 事件可能因缓存验证连续性获得信誉,同时记录管理和获取不可用性。APNIC 2019 事件可能分别显示 RRDP 弹性和 rsync 故障。细微差别将取代危言耸听和自我祝贺。

因此,NRS 可以将对注册机构问责的广泛需求转化为实际的公共产品:关于关键路由安全断言在外部是否可用的可比证据。

采购和公共政策应要求能够在分歧中存活的证据

政府、关键基础设施运营商和大型网络越来越依赖 RPKI,但不一定操作他们信任的认证和发布层。他们的采购问题应超越提供商是否声称高可用性。

他们应询问 RRDP 和 rsync 托管在哪里、它们的故障域是否不同、外部完整验证运行频率、何种新鲜度余量触发升级、接受的变更如何与发布匹配、哪些验证器版本经过测试、事件如何公布以及证据如何保留。他们应请求近期演习结果和恢复收敛示例。

公共政策应抵制强制对所有仓库事件使用通用路由响应。运营商有不同的风险状况,而故障开放行为既有连续性好处也有安全成本。更具建设性的要求是透明度:公开验证视图、本地策略和中断会影响公共服务的系统的回退计划。

监督还应区分区域注册机构仓库与其下方的委派发布点。信任锚可能可达而委派权威失败。将每个委派中断归因于父级的政策会阻碍委派而不改进测量。认证路径识别故障发生的位置;治理应遵循该证据。

保险和董事会风险审查可以使用相同模型。他们可以检查组织是否知道其缓存余量、是否有独立验证器、保留路由策略历史并且能联系到适当的仓库联系人。这将 RPKI 从抽象的网络安全管理转化为可审计的持续性依赖。

标准不需要保证不间断路由。它应保证对一个更狭窄问题的自律回答:什么是外部可用的,它何时变得不可用,谁控制了失败步骤,以及实际观察到的路由后果是什么?

政策报告遗漏的仓库中断是隐藏在发布和依赖之间的那个

RPKI 仓库已经证明故障不适合单一的正常运行时间计数器。硬件可能停止访问而不耗尽缓存有效性。过期的清单可能损害 rsync 而 RRDP 保持连贯。磁盘可能静默阻止变更直到 CRL 过期。父和子证书可能单独真实但暂时不一致。分发节点可能提供不匹配的传输凭证而替代方法仍然可用。

这些不是反对路由起源验证的论据。它们是路由安全已成熟为需要成熟服务保证的基础设施的证据。密码学使篡改可检测;它不会使发布完美。缓存提供连续性;它不证明新状态已到达。本地路由策略保留运营商自主权;它不消除仓库责任。

因此,最好的可用性声明是适度且精确的。提供商可以说命名的独立探针通过陈述的方法获取了完整的当前材料,所有测试的认证分支验证通过,已接受的操作在目标内变得可见,受支持的验证器在修复后收敛,并且在定义人群中观察到的路由效果被发现或未被发现。另一方可以重复测试。

任何更广泛的声明都需要更多证据。内部仪表板不能证明外部可获取性。缺失的 ROA 不能证明客户损失。稳定的 BGP 收集器不能证明没有私有网络受影响。全球百分比不能从未公开的样本构建。

注册机构合法性在机构不要求公众凭信仰接受其正常运行时间时增长。NRS 和更广泛的运营商社区可以帮助建立该规范。仓库应在断言变得可用的那一点被判断,在它们的时钟过期之前以及在其后果可见之后。

那是政策报告通常遗漏的中断:不是机器停止的那一刻,而是互联网的依赖方不再能获得相同及时、连贯和可路由权威声明的间隔。

来源