概览
- ARTEMIS 是由运营商自行部署的开源系统。它把当前 BGP 观测与本地定义的路由意图进行比对,并加入仅凭公共收集器无法获得的上下文。
- FORTH 与 CAIDA 在 2018 年的研究中报告称,在受测条件下,系统可在数秒内发现事件,并在不到一分钟内完成缓解;这并不是对生产环境的普遍保证。
- ARTEMIS 可以通过宣告更具体路由或触发自定义流程进行缓解,但过滤规则、过时策略、不完整可见性和过宽权限也可能让快速响应演变成第二起事故。
- 项目如今能否持续发展,取决于发布纪律、可信的部署证据,以及与 Code BGP 之间清晰透明的边界:商业维护可以支持开源代码,但不应取代研究项目本身的历史。
一次真实路由变化表明,数秒发现只是起点
CAIDA 2019 年年度报告称,ARTEMIS 在数秒内发现了一起影响 Internet2 /30 前缀的真实路由劫持事件。这个案例的重要之处在于,它使证据超出了研究人员自行准备的合成宣告。在参与部署的网络中,路由确实发生了变化,系统也足够快地识别出偏差,从而为调查提供支持。
报告并未给出普遍适用的发现时间分布。/30 是特定路由环境中的具体前缀,观测来自该部署能够访问的特定数据源。其他事件可能以不同方式传播、持续时间更短,甚至完全无法被已连接的收集器看到。报告本身也不能证明存在恶意意图,更没有描述数据平面的全部后果。准确的结论应限定为:在 CAIDA 的部署项目中,ARTEMIS 在数秒内发现了一起有记录的真实事件。
实践案例只有在保留其边界时才有价值。它们可以说明程序在真实变化下如何运行、运营商如何收到警报,以及事件结束后留下了哪些证据。要评估生产成熟度,包含误报、漏报和缓解结果的更多事故记录,会比又一个醒目的时间指标更有帮助。
BGP 警报可能在数秒内到达,却仍无法回答最重要的问题。路由收集器可以显示,一个陌生自治系统宣告了某个前缀,或者出现了更具体的路由并开始传播。这说明控制平面已经偏离预期状态,但不能单独证明是谁进行了更改、是否属于错误、流量是否走上新路径、用户是否受影响,以及什么操作能在不制造新问题的情况下恢复服务。
ARTEMIS 正是为发现与行动之间的空档而设计。其名称是 Automatic and Real-Time dEtection and MItigation System 的缩写,但特殊的大小写不应掩盖其运行模式。它不是一个看见整个互联网、从远处修复其他网络的中央服务。组织需要在受控基础设施中部署程序,定义其认为合法的路由状态,接入公共和私有观测,并决定当事实与策略不符时系统可以采取多大程度的行动。项目承诺的是结合上下文的速度;其限制则在于,上下文和权限都留在本地。
因此,ARTEMIS 更像运营商控制室中的仪器,而不是“互联网警察”。它可以整理证据、缩短在路由更新中检索信息的时间,并准备事先讨论过的响应,但不能取代运营商的判断。最终决策可能影响全球路由、与上游网络的关系及客户流量,所以响应质量不仅取决于检测器,也取决于人员、配置和经过演练的权限。
BGP 先传播可达性,后验证授权能力却不足
Border Gateway Protocol 使独立管理的网络能够交换可达性信息并实施各自的策略。自治系统宣告自己可以把流量送往特定 IP 前缀;相邻网络决定是否接受、优先选择并继续传播这些路由。这种模式使互联网得以在没有单一控制器的情况下跨组织扩展,但原始协议并未为每项源或路径声明附加密码学证明。因此,错误导出、过时配置或蓄意宣告都可能引入本不应存在的路由。
路由选择机制可能让错误宣告变得更有吸引力。若两条路由覆盖长度相同的前缀,网络会按照自身策略和路径选择规则作出决定。若攻击者或配置错误的网络宣告更具体的子前缀,最长前缀匹配规则通常会在接受该路由的网络中,把流量导向更窄的路由。这不是专为攻击设计的功能,而是选择最精确目的地的正常规则。因此,即使合法聚合路由仍然可见,一个看似很小的宣告也可能迅速吸走流量。
“劫持”是方便的简称,但它可能暗示路由消息本身无法揭示的意图。未经授权的源可能是恶意的、意外的,也可能来自合法商业变更,只是该变更尚未写入监测策略。伪造路径可以用于截获流量,但单条控制平面更新不能证明截获实际发生。ARTEMIS 最有价值的用法,是把警报视为观测路由与预期路由之间的偏差,并将归因和影响评估交给更广泛的事故响应流程。
精确前缀事件会与相同长度的合法路由竞争。传播范围取决于同时收到两项宣告的网络所采用的策略和路径选择。互联网的一部分可能偏好异常路由,另一部分则继续使用合法源,结果可能是部分可达、区域差异,以及成功与失败交织的复杂状态,而不是单一、清晰的中断。因此,检测不仅要判断路由是否存在,还要了解它在何处、以何种方式传播。
子前缀事件通常更容易吸引流量,因为最长前缀规则优先选择更窄的路由。如果网络通常宣告 /20,而另一来源宣告其中的 /24,接受 /24 的路由器通常会把目标流量导向该子前缀。去聚合也是一种常见防御:合法运营商宣告相同或更具体的路由,以重新获得优先级。但这种方法有明确上限:许多网络会过滤长于 /24 的 IPv4 路由和长于 /48 的 IPv6 路由。如果运营商已经宣告这种长度的前缀,可能就没有能被全球普遍接受的更窄路由。
ARTEMIS 还考虑“地址抢占”和特定策略违规,包括项目材料描述的 no-export 场景。这些类别很重要,因为路由事件并不总是表现为外部网络宣告受害者的前缀。路由可能拥有获准的源,却通过意外关系向外传播。监测系统需要足够的策略上下文来区分这些情况,同时不能假装 BGP 数据能够揭示网络之间所有私人协议。
ARTEMIS 把运营商自身的路由意图放入检测器
外部监测服务具有明显优势:它们可以从互联网多个位置收集数据,而不要求每个网络部署完整系统。其不足也同样明显。第三方可以看到已宣告前缀和路径,却未必知道运营商允许哪些源切换、备用供应商、流量工程方案或紧急宣告。通用规则因此可能漏掉细微的策略违规,也可能把计划内变更误判为异常。
ARTEMIS 改变了观测位置。检测器由地址空间面临风险的组织运行,基准也由该组织定义。公共收集器仍提供广泛的外部视野,但其观测会结合有关受保护前缀、获准源 AS、可接受邻居和允许路径关系的私有知识进行解释。来自路由器的本地数据流还能补充公共收集器看不到的事件。这是项目的核心理念:把不完整的全球数据与明确的本地意图比对,可以提高数据的实际价值。
把检测器放进受保护网络,也把责任带入网络内部。运营 ARTEMIS 的组织必须决定谁拥有策略文件、变更如何核验、哪些警报送达网络运营中心、安全团队可以作出哪些结论,以及谁能批准新的路由宣告。程序可以让这些责任更加清晰,却无法迫使机构妥善履行责任。
ARTEMIS 要求运营商定义受保护前缀、合法源自治系统、可接受的邻接关系和选定的路由规则。凭借这一基准,检测器提出的问题比通用外部服务更精确:它不是判断某条路由相对于全球历史是否异常,而是检查它是否违反某个具体网络声明的意图。
这种优势的可靠程度不可能超过基准本身。网络会更换供应商、增加 anycast 站点、迁移源 AS、建立临时备用路径,并在故障期间发布紧急宣告。1 月准确的策略到 6 月可能已经过时。如果变更已经进入路由器,却没有同步到 ARTEMIS,检测器可能产生高严重度误报;如果为了压低噪声而把规则放得过宽,真正的违规也可能在文档上被视为“允许”。
系统由此把技术配置转变为机构协议。路由工程、安全团队和变更管理人员必须就文件含义、编辑权限及其跟随生产网络的速度达成一致。本地上下文不会消除误报和漏报,只是把主要成因转移到运营商能够管理的位置。
路由安全规则应获得与可能影响客户流量的软件代码相同的管理纪律。变更应有指定所有者、审核、版本历史、测试,以及与已批准网络变更关联的理由。运营商需要能够回答:某个前缀、源或邻居何时加入,谁批准了它,以及哪起事故或哪个项目构成依据。普通配置文件可以支持这一流程,前提是组织不把它视为一次性的安装材料。
测试应同时包含正向和反向场景。计划内的合法路由应在不触发警报的情况下通过;未经授权的源宣告精确前缀时,应得到预期分类;子前缀事件应触发正确的严重度;no-export 违规也不应被误认为源劫持。历史回放可以检验这些情况,测试环境则用于确认通知和缓解流程是否收到预期数据。
这种纪律还能限制组织层面的漂移。最初部署 ARTEMIS 的人员离职后,策略仍应能被下一位运营人员理解。即使代码开放、数据源延迟很低,一个依赖未记录个人记忆的检测器也不能算可靠基础设施。
FORTH 与 CAIDA 把研究问题转化为运营商工作流程
该项目源于 Foundation for Research and Technology-Hellas、克里特大学生态中的研究人员,以及加州大学圣迭戈分校 CAIDA 之间的合作。FORTH 提供路由保护和系统工程知识,CAIDA 则加入互联网测量基础设施、BGPStream 经验,以及帮助项目进入科研教育网络的联系。因此,ARTEMIS 从一开始就不只是检测算法,而是协议知识、测量系统和运营商接入的结合。
资金来源也体现了这种混合机构模式。项目历史涉及欧洲和美国研究计划、RIPE NCC Community Projects Fund、NSF EAGER 部署项目、美国国土安全部和 Comcast Innovation Fund。RIPE 在 2017 年的支持帮助把原型转化为运营商工具,2019 年一笔 5 万欧元资助则用于通过 RIPE Atlas 验证数据平面。这些资金说明公共价值研究如何成为可部署软件,但不能说明当前生产安装的维护成本。
机构历史对于准确归属十分重要。ARTEMIS 不是单独设立的基金会,不是 CAIDA 的服务,也不是 FORTH 拥有的全球检测器。它是采用 BSD 3-Clause 许可证的开源软件,具有研究项目传承,目前由商业机构维护。其发展更适合描述为一系列合作,而不是某一家组织的所有权。
第一个公开里程碑是 2016 年 ACM SIGCOMM 演示。关键进展是把监测和缓解接入同一闭环。许多系统能在积累数据后识别可疑路由,ARTEMIS 提出的不同问题是:运营商能否足够快地看到事件,并预先准备实际对策,使事故不必在面板、电子邮件和人工路由器会话之间流转数小时。
演示并不等同于成熟生产部署。它表明各组件可以在给定配置下协同工作,也说明研究问题已具体到可以公开验证。但 2016 年的工作确定了后续方向:实时观测、合法路由的内部定义、分类和预先准备的宣告。这一顺序把响应时间从组织流程的附带结果转变为系统属性。
运营商曾报告,响应路由劫持可能需要数小时,这些经验也影响了项目。延迟并不仅来自缓慢的收集器。团队还必须确认前缀归属、研究传播范围、判断变更是否计划内、找到供应商的正确联系人,并准备安全的反向宣告。ARTEMIS 通过把策略和流程放在监测附近缩短其中若干步骤,但路由周围的人际关系和商业关系仍在代码之外。
2018 年发表于 IEEE/ACM Transactions on Networking 的论文提出了 ARTEMIS 最令人印象深刻的主张:在一分钟内化解 BGP 劫持。研究人员在真实实验中测试该方法,并报告在受测条件下数秒发现、不到一分钟完成缓解。该结果的重要性在于,它说明受害网络未必必须等待外部服务、电话联络链和人工制作的反向宣告。
如果脱离实验条件,这句话就可能产生误导。发现时间取决于事件是否到达已连接观测点、数据源传递更新的速度、检测规则是否匹配,以及系统本身是否健康。缓解时间则取决于受害者前缀长度、路由权限、供应商过滤、传播情况和审批流程。要求人工确认的网络可能作出更安全但更慢的决定;立即自动执行的网络响应更快,却会承担额外风险。
负责任的结论必须保持限定:ARTEMIS 表明,一个紧密集成、由运营商运行的系统能够显著压缩以往经常耗时更长的流程。它没有证明每次劫持都可见、每条反向路由都会被接受,也没有证明所有生产团队都应允许自动去聚合。该结果应视为经过实验支持的设计目标,而不是普遍保证。
多个不完整视角共同构成可用的事故图景
ARTEMIS 可以使用多个公共数据源,因为没有任何收集器能看见所有路由。RIPE RIS 和俄勒冈大学 RouteViews 项目从分布式收集点的特定对等方接收 BGP 更新。CAIDA BGPStream 提供访问并规范化多个来源路由数据的统一机制。每项服务都扩大运营商视野,但也只反映选择连接其收集器的网络、这些会话的地理分布及数据流的时间特征。
局部可见性会产生实际后果。事件可能只在一个地区传播,未到达具体部署连接的任何收集器;极短的宣告可能在数据流送达前就被撤回;路由也可能通过开放数据中没有体现的私人关系影响受害者客户。组合多个收集器可以减少部分盲区,但只是扩大样本,并不是复制一个无所不知的全球控制平面。
因此,正确的工作问题不是“ARTEMIS 是否看见了互联网”,而是“哪些观测点看见了这项宣告、速度多快,以及事件的哪些部分可能仍在样本之外”。这种表述有助于保存每项警报的来源,也避免把某个数据流中没有出现路由当作该路由不存在的证明。
RIPE NCC 于 2019 年 2 月推出 RIS Live 公共原型,以远低于定期处理档案的延迟传送 BGP 消息。ARTEMIS 是说明这种实时数据流价值的案例之一。如果主要观测要在数分钟后才到达,安全系统就不可能在数秒内响应;实时流则允许检测器在收集器收到更新时立即评估。
较低延迟不会消除观测边界。RIS Live 仍只反映连接到 RIPE Routing Information Service 的对等方及其导出的路由。若劫持保持局部范围、在到达收集器前被过滤,或影响隐藏在其他关系中的路径,数据流中可能没有决定性证据。可靠性同样重要:如果监测无法区分“没有可疑路由”和“没有数据”,数据流故障或格式变化就会表现为沉默。
因此,数据源状态也是安全模型的一部分。运营商需要知道每个监测源是否及时运行、是否延迟、断开或产生异常数量的更新。一个在输入已经降级时仍自信显示正常的检测器,可能比明确故障制造更危险的无知。
实时监测回答当前正在出现什么;路由信息库和更新档案则提供上下文。RIPE RIS 与 RouteViews 发布历史数据,可用于查看事故前的源和路径、变化开始时间及持续时长。CAIDA BGPStream 通过统一机制简化记录处理,使 ARTEMIS 能够回放事件,并根据历史路由行为测试规则。
回放有助于工程验证和分析。团队可以检查新规则能否发现已知事件、重建触发警报的更新顺序,或者在不改变实时生产路由的情况下培训响应人员。历史数据也能揭示某些反复出现、单独看似异常但实际属于长期备用设计的宣告。限制仍然存在:档案记录的是收集器视角,而不是完整事件,过去的拓扑也不能复现当前所有关系。
成熟部署可以把回放纳入变更管理。新的源、供应商或导出规则上线前,运营商应在具有代表性的历史记录上测试更新后的基准,确认正常路由不会变成持续警报。这样,检测器配置就成为可验证的安全材料,而不只是出现噪声后才被修改的文件。
公共数据只是架构的一部分。ARTEMIS 还可以通过 ExaBGP 或私有 BGP Monitoring Protocol 会话接收本地更新。ExaBGP 作为可编程 BGP 发言者,把事件传递给其他应用;BMP 使路由器能够向监测系统导出路由信息,而不让监测系统参与数据包转发决策。这些来源能够展示受保护网络自身的邻接关系和路由状态,且往往早于信息到达公共收集器。
本地数据流改善及时性和上下文,但也把敏感基础设施信息带入平台。BMP 数据可能体量很大,并暴露内部路由关系。ExaBGP 集成需要严格控制,因为同一可编程接口不仅可以观测,也能宣告路由。凭据、网络访问、消息验证,以及监测与缓解的隔离,都会成为安全边界。
设计良好的部署会让公共和私有数据流承担不同任务。公共收集器展示宣告如何传播到运营商近邻之外;本地来源展示网络及其路由器实际看见了什么。二者不一致未必是错误,也可能是传播在何处停止或策略在何处生效的证据。
应用将观测、检测和证据分离
现代平台是多容器微服务应用,而不是读取单一数据流的脚本。监测服务连接公共和私有来源,规范化收到的 BGP 信息并发布事件;检测服务接收事件并应用运营商规则;核心周围还有存储、API、网页界面、通知和监控。组件分离后可以独立扩展或故障,也更容易加入新数据源而不必重写整个系统。
模块化同时增加了依赖关系。监测器可能正常,而检测器已经停止;消息总线可能在数据库不可用时继续接收事件;实时处理链路损坏时,网页界面仍可能显示旧事故;编排器也可能通过不断重启容器掩盖重复崩溃。因此,运行检查应覆盖从数据源到警报的完整路径,而不能只报告各容器仍在运行。
Docker Compose 降低了受控部署门槛,Kubernetes 支持则适合已经运行容器平台的组织。但两种方式都不会把系统变成全球托管服务。部署网络仍需负责容量、更新、密钥、存储、备份和紧急访问。
消息总线使监测、检测和通知服务能够交换事件,而不必让所有流程直接依赖单一组件。它可以吸收更新峰值,并允许消费者以不同速度处理,但也引出顺序、重复消息和背压问题。一起路由事故可能产生数千条更新、撤回和路径变化,因此系统必须保存足够的顺序和来源信息,使运营商能够重建事件经过。
持久化存储使 ARTEMIS 超越一次性警报。更新、警报、配置状态和事故决策都可以保留供后续分析。架构曾采用 PostgreSQL、Timescale 风格存储和 Hasura API 生态组件。它们支持查询与集成,但也会形成包含敏感路由和运营证据的档案,需要保留期限、访问控制和可靠备份。
可审计不等于确定无疑。完整保存系统收到的信息,可以证明 ARTEMIS 如何得出警报,却不能证明系统看见了所有重要路由,也不能证明运营商规则正确。因此,数据库应保存来源和置信程度,而不只是最终事故标签。
网页界面以适合网络运营中心或安全运营中心的方式展示事故、系统状态和路由观测。通知可以通过电子邮件、移动渠道或自定义集成发送警报,Grafana 面板则展示服务健康状况和事件趋势。这些功能把研究机制变成工作产品:响应团队需要优先级、历史记录和统一视图,而不是原始 BGP 更新。
界面也可能制造虚假信心。红色事故卡片只是依据观测和规则作出的分类,不是对恶意行为的独立证明。地图或路径图看起来可能完整,实际只代表选定收集器。如果计划内变更没有进入策略,通知就会变成噪声,警报疲劳也会提高漏掉真正重要事件的风险。
良好实践会把界面与核验过程连接起来。响应人员应能打开原始更新、比较公共与本地数据流、检查当前 RPKI 状态、执行数据平面测试,并记录事故为何被升级、忽略或关闭。面板应缩短这一过程,而不是取代它。
路由模式既不能证明动机,也不能证明后果
ARTEMIS 研究建立了一套分类,按前缀关系、AS 路径操纵、策略和潜在数据平面影响区分事件。实现系统根据控制平面证据支持其中部分模式,包括错误源发出的精确前缀和子前缀、地址抢占及特定导出违规。分类为运营商提供共同语言,也允许针对不同事件采用不同规则。
类别必须与数据实际显示的内容保持一致。以异常邻居开始的路径,可能表示伪造路径段、路由泄漏,或策略文件尚未记录的获准变更。未经授权的源可能是错误而不是攻击。即使宣告是故意的,也可能用于黑洞流量、服务冒充或观察转发过程,仅凭 BGP 更新无法区分这些结果。
谨慎用词既保护准确性,也改善响应质量。在警报阶段,“疑似劫持”或“策略违规”通常比“攻击”更安全。只有在核验路由归属、联系运营商并取得数据平面证据后,才应使用更强表述。这种克制不会削弱防御,而是防止分类器把不确定性转化为其他团队会当作事实重复的结论。
BGP 消息描述网络交换的可达性和路径声明,但不会显示沿所选路径传输的每个数据包。可疑宣告出现后,流量可能进入黑洞、被截获后继续转发、收到冒充服务的响应,或者因相关用户网络没有接受路由而完全不变。互联网不同部分还可能同时经历不同后果。
这一边界对 ARTEMIS 至关重要。检测器可以显示某条路由违反运营商策略,并出现在特定观测点,却不能从 AS 路径推断动机,也不能保证 traceroute 与应用流量沿相同方向行进。加密、DNS 行为、缓存、anycast 和应用切换还会进一步改变用户体验。因此,控制平面警报是事故证据,但不是事故的全部。
有效响应需要结合多类记录。BGP 数据确定宣告及其传播;数据平面测试检查选定位置的可达性和路径;服务遥测显示错误、延迟和客户影响;与供应商联系则确认宣告是否获准或属于错误。没有单一来源是完美的,但它们共同支持单一数据流无法提供的决策。
RIPE Community Projects Fund 2019 年资助 ARTEMIS 加入 RIPE Atlas traceroute 测量,用于评估已发现事件的影响。这项工作承认最初控制平面闭环的局限。路由在 BGP 中可能看起来危险,却几乎没有影响用户;传播范围很小的事件也可能击中高价值客户群。数据平面探测可以补充有关预期流量路径和端点可达性的信息。
RIPE Atlas 拥有分布式探针网络,但部署并不均匀,目标的响应方式也可能无法揭示路径。traceroute 会受到过滤、负载均衡、隧道和非对称路由影响。从探针到目标的正向路径不必等同于客户流量的返回路径。失败的测量可能意味着服务故障、节点未响应,也可能只是具体测试的限制。
实际收益不是完全确定,而是更好的事件分流。如果 BGP 收集器显示未经授权的子前缀,而多个地区的探针同时失去可达性或转向异常源,升级处置的依据就更充分。若控制平面事件只被一个收集器看见,测试仍保持稳定,团队可以在修改全球宣告前继续调查。决策仍依赖上下文,但不再同样盲目。
只有路由系统允许时,去聚合才能夺回流量
ARTEMIS 最知名的响应方式是去聚合。宣告宽前缀的受害者可以开始宣告更具体的路由,利用最长前缀选择把流量重新吸引到合法网络。这种方法使用 BGP 的正常行为,传播可能很快,因此适合“一分钟内”的实验目标。它也让行动掌握在受害者手中,无需在服务恢复开始前获得异常源的合作。
去聚合存在明确上限。许多网络会过滤长于 /24 的 IPv4 路由和长于 /48 的 IPv6 路由,以限制路由表增长和滥用。已经宣告 /24 或 /48 的受害者,可能无法发布被广泛互联网接受的更具体路由。供应商也会限制客户获准宣告的前缀,路由对象、前缀过滤器或 RPKI 数据必须允许紧急状态。传播既非即时也不统一,因此旧路径与新路径可能同时存在。
有准备的运营商会提前了解这些边界:哪些前缀可以去聚合?哪些供应商会接受?哪些路由过滤器和 Route Origin Authorisations 已覆盖紧急状态?恢复后如何撤回路由?ARTEMIS 可以触发外部流程,但流程能否成功取决于应用之外的安排。
项目材料提到自动缓解,研究也包括由检测触发反向宣告的闭环;详细运行说明同时展示人工确认和用户定义流程。这两种说法并不矛盾,因为不同部署会选择不同自治程度。安全而准确的表述是:ARTEMIS 通过可配置工作流程支持自动执行或经运营商批准的缓解。
风险并不对称。延迟可能延长中断或劫持,而错误的自动响应可能宣告不必要的更具体路由、违反供应商策略、暴露内部假设,或在原事件仍在调查时制造不稳定。过时基准可能把计划内变更转化为虚假紧急情况。如果外部流程拥有过宽的路由器权限,ARTEMIS 本身遭到入侵就会成为路由攻击。
更安全的自动化应分阶段进行。系统先丰富警报,核验多个数据流、RPKI 状态和数据平面,再准备精确的路由变更。高影响操作由人员批准,风险较低的情况可按策略自动执行。速率限制、最小权限、模拟、变更日志和经过测试的回滚,比是否标为“自动”更重要。目标不是保留人工工作本身,而是避免速度摧毁问责能力。
RPKI 只加强证据链中的一个环节
Resource Public Key Infrastructure 允许地址持有者创建 Route Origin Authorisations,指定哪些自治系统可以宣告特定前缀及其最大长度。路由器或策略系统执行 Route Origin Validation,把路由分类为有效、无效或未找到记录。这为原本依赖分布式信任的 BGP 源声明增加了密码学证据。控制具有主动性:其他网络可以在流量进入未经授权的源之前拒绝该路由或降低其优先级。
ARTEMIS 工作在事故的另一个层面。它可以把 RPKI 验证状态作为证据,也会将路由与运营商私有规则比对、记录事件、组合公共与本地数据流,并把检测与响应连接起来。RPKI 不验证完整 AS 路径,其部署策略也并不普遍。路由可能在 RPKI 中有效,却仍违反预期邻接关系或沿不希望的路径泄漏;反过来,如果合法变更未写入 ROA,也会被判为无效。
因此,两种机制相互补充。RPKI 减少广泛互联网接受的未经授权源;ARTEMIS 向受害者展示实际观测,发现超出简单源有效性范围的部分模式,并组织响应。ASPA 等未来路径授权机制可能加强关系证据,但不会消除观察网络实际宣告及事件如何影响服务的必要性。
试点让 ARTEMIS 走出实验室,但未证明市场规模
CAIDA 报告称,2018 至 2019 年在 NSF 支持下,与 Internet2、Great Plains Network 和 Merit 共同开展了 ARTEMIS 实验部署。这些试点很重要,因为科研教育网络拥有真实前缀、供应商、变更流程和服务义务。运营商可以检查程序能否融入既有监测、规则是否体现其路由意图,以及警报如何进入响应流程。
这些证据具有说服力,但边界明确。试点能够证明安装、工程反馈和特定运行应用,不能证明持续生产覆盖、当前版本状态,或系统在所有网络类型中效果相同。项目网站还发布了与 AMS-IX、Internet2 和 ESnet 有关工程师的评价,并展示组织标识。这表明存在测试或使用,却不足以把每家组织称为当前付费客户,也不能据此声称项目拥有已知的全球市场份额。
这种区别很重要,因为路由保护软件的部署往往不可见。运营商可能使用内部派生版本、只启用监测而不缓解,或在试验后停止使用。缺少完整名录不代表项目不重要,但意味着无法精确衡量普及程度。具名案例比缺乏核验的大数字更有力。
运营商控制意味着集成负担和软件供应链保护责任
ARTEMIS 采用 BSD 3-Clause 许可证。运营商可以检查代码、在受控基础设施中运行、修改集成方式,并避免把敏感策略交给唯一的强制中央供应商。这与项目的核心优势一致:最有价值的基准信息应留在网络内部。许可证也允许商业使用和派生开发,因此 Code BGP 和其他参与者可以在开放基础上建立服务。
控制需要付出劳动。平台包括容器、消息总线、数据库、API、网页应用、通知系统和数据流连接。每个组件都需要更新、凭据、网络分段、备份和监测。系统保存敏感路由策略,也可能拥有影响宣告的权限,因此生产部署的攻击面远大于最初的检测算法。
开放许可证为运营商提供摆脱单一维护方依赖的路径,却不会自动产生支持服务。仍需有人检查更新、分析依赖关系,并在数据流或路由器接口变化时理解代码。对于小型网络,更简单的警报工具或托管商业服务可能更便利,即使本地控制程度较低。
生产级 ARTEMIS 服务必须在促使运营商需要它的网络不稳定期间保持运行。数据流连接、消息总线、数据库、API、界面、通知渠道和身份验证层构成完整服务链。只有状态、存储和外部依赖也按故障场景设计时,容器级冗余才真正有用。重启监测器无法恢复未保存的更新;如果检测流程未能处理事件,复制多个界面也不会显示事故。
运行架构因此应明确设计降级模式。如果一个公共数据流消失,系统应报告覆盖范围缩小,而不是继续显示无法区分的“健康”状态。数据库不可用时,检测器可能需要在本地保存事件,或停止缓解,因为无法写入审计证据。身份供应商故障时,紧急访问必须保持可用,但不能依赖永久且不受控制的账号。这些决策不属于劫持分类,却决定研究理念能否成为可靠基础设施。
平台还需要自身的性能预算。大型路由变更引发的合法更新峰值,可能比一次劫持给监测器和存储带来更高负载。内部队列不能在没有提示的情况下,把近实时数据流变成迟到的事故报告。容量测试、数据库保留期和消息总线背压应进入规划,因为它们与路由过滤和前缀长度一样,限制系统能够诚实承诺的响应速度。
ARTEMIS 组合网页组件、容器镜像、数据库、消息系统、API、身份验证和网络库。架构便于扩展,但每项依赖都可能成为漏洞或故障点。用户界面错误可能泄露路由策略;受感染镜像可能篡改警报;权限过宽的 API 令牌可能读取事故信息;缓解程序中的凭据则可能允许改变路由。因此,检测器安全无法与承载它的软件安全分离。
开源有所帮助:运营商可以检查组件、固定版本并自行构建镜像。但开放并不保证有人审查过每项传递依赖,也不保证公开漏洞会在特定网络所需时间内修复。生产团队需要镜像和软件库清单、重新构建流程、只读监测与可写缓解之间的隔离,以及在不丢失事故历史的前提下测试安全更新的方法。
这也改变了项目维护的评价标准。新的检测功能比数据库升级或身份验证修复更显眼,但后两者对服务完整性可能更加重要。安全公告、可复现构建、依赖更新和受支持的发布分支,都是运行成熟度的证据,即使面板上没有增加任何按钮。
发布节奏与 Code BGP 构成当前维护能力的检验
研究材料列出的最近一个正式标记版本,是 2022 年 11 月 24 日发布的 2.3.0 Cadmus。截至 2026 年 8 月 5 日,实时演示使用了更新提交版本,项目网站也仍在运行。这说明正式版本之后开发仍在继续,同时提出了合理的生产问题:哪个版本经过验证、仍获支持并适合升级?
提交活动和可用演示能够证明开发仍在进行。语义化发布则提供另一种确定性:有名称的基准版本、发布说明、预期依赖,以及运营商可以据此测试的参考点。项目可能仍然活跃但发布流程落后,当前演示也可能运行生产网络不应在未经自行核验时采用的代码。
对于路由保护基础设施,发布纪律属于安全模型的一部分。运营商需要知道哪些分支会获得修复、迁移如何执行,以及旧依赖是否仍存在漏洞。新标签不能证明普遍可靠,但公开支持和安全政策可以比单纯保持网站在线更有效地降低不确定性。
项目网站把 Code BGP 列为 ARTEMIS 当前维护方,并称该公司是从项目发展而来的初创企业。商业化可以解决开源软件的真实问题。路由保护工具需要有人维护集成、响应漏洞、协助部署,并在初始资助结束后把研究功能转化为可持续运行能力。
但 Code BGP 是独立商业公司,具有更广泛的产品和客户环境,不能作为 FORTH、CAIDA 或任何开放部署的另一个名称。公开材料没有披露公司收入、估值、客户名单,也没有准确说明公共功能与商业能力的边界。这不是批评,而是本文能够作出主张的证据边界。
这种联系形成两组可能一致、也可能分化的激励。商业人员提交经过检验的代码和文档时,开放项目会受益;开放项目建立信任、普及度和付费服务的技术基础时,公司会受益。长期检验在于:面向非商业客户的运营商,是否仍能充分看见发布、安全修复和路线图决策。
宽松许可证保证复制、修改和商业化源代码的权利,却不保证另一支团队能够理解架构、复现发布版本,或在现有专家离开后接手维护。项目连续性取决于文档、测试、问题历史、依赖知识,以及一条超越原研究系统创建者的新参与者加入路径。
Code BGP 的维护可以通过让有经验的工程师留在平台周围来加强连续性,也可能使实践知识集中于商业组织内部,即使代码仓库仍然公开。差异可以从发布说明、公开设计讨论、对社区报告的响应,以及非客户部署是否获得足够安全运行信息中看出。
目标不是阻止商业价值。健康的开放核心模式可以让付费支持与公共维护相互促进。风险出现在开放项目变成历史演示,而实际运行路径转移到缺乏文档的私有组件时。因此,应通过实践检验可移植性:独立运营商能否仅凭当前公开材料安装、升级、验证并恢复系统?
ARTEMIS 位于路由保护领域要求较高的中间位置
路由保护领域包括公共收集器、研究推断系统、开放警报工具、RPKI 验证器和商业监测平台。RIPE RIS、RouteViews 和 BGPStream 提供数据,而不是为具体运营商配置的事故工作流程。BGPalerter 提供另一种开放监测模式。MANRS 规定运行规范,但不实时检测事件。商业服务可以提供广泛观测和分析支持,但如果缺少客户集成,往往没有私有本地上下文。
ARTEMIS 的独特位置来自运营商控制、明确基准、多个公共与本地数据流、开放代码和可选缓解。这种位置也意味着较高要求。网络需要路由专家、持续维护的策略,以及运行多组件平台的能力。因此,项目可能更适合把路由保护视为内部专业能力的组织,而不是只想再订阅一个面板的网络。
比较不能简化为功能表。不同模式会以不同方式分配信任和劳动。托管服务集中知识和观测;运营商侧系统则让策略和行动更靠近网络。实际问题是:在证据不完整时,哪一方看得足够多、行动足够安全,并且仍可被问责。
ARTEMIS Lite 于 2023 年出现在 RIPE 社区材料中,是一种相关的轻量化方案,旨在降低部分部署负担。Lite 版本的存在本身说明,完整平台的广度对小团队可能过重。拥有持久存储、多种数据流和自有缓解机制的多容器系统适合大型运营商,却可能超出只需要清晰可见性和可靠警报的网络需求。
轻量系统不能仅因名称和目标相近就被视为等同。研究材料把 ARTEMIS Lite 描述为功能缩减的变体,演示中的主张还需要独立核验。关键取舍在于较低运行成本,与可能缺少的上下文、集成、历史或响应机制之间如何平衡。只要诚实标明边界,小型部署仍然有价值。
普及程度取决于工具需要多大规模的机构能力。项目可以在技术上开放,却仍让缺少容器、数据库和路由保护专家的运营商难以使用。打包方式、合理默认值,以及从监测逐步进入检测和缓解的路径,可能决定这种架构能否超越一篇研究论文而广泛部署。
真正的产品是可治理的反馈闭环
ARTEMIS 不能通过一次操作让 BGP 变得可信。它围绕一个原本缺少完整授权的协议建立闭环:运营商描述期望路由;公共与本地数据流展示部分现实;检测器找到偏差;存储和界面整理证据;人员或获准自动化选择响应;随后数据流显示传播是否改变。事件可以被解决、判定为无关紧要、在路由撤回后关闭、升级,或在记录理由后不采取行动。
这一闭环是项目最持久的贡献。它承认路由保护既不是一次性证书,也不是远处传来的警报,而是一项运行实践:策略必须明确,观测必须保留来源,响应权限必须在事故发生前准备好。系统的价值在于足够快地缩小不确定性,使网络能够行动,而不是假装不确定性已经消失。
其限制同样具有启示意义。路由收集器只能看到世界的一部分;基准可能过时;控制平面证据不能证明动机和全部流量后果;技术上可执行的缓解可能被过滤或造成损害;开放代码仍需持续维护。只有把这些限制纳入工作流程,而不是藏在“一分钟响应”的标题之后,ARTEMIS 才最有力量。
BGP 异常可能进入网络运营中心、安全运营中心,或同时进入两者。路由团队理解前缀、供应商策略和修改宣告的风险;安全团队更擅长关联身份、服务遥测和潜在恶意活动。ARTEMIS 横跨这些领域。只有警报携带足够证据,使两支团队围绕同一事件工作,而不是基于不同前提分别调查,系统才有实际价值。
事故交接应把观测、策略和影响分开。系统在明确列出的数据流中看到路由;该路由违反了具体基准规则;服务检查或 RIPE Atlas 探针显示了明确影响,或者影响尚未确定;运营商已联系上游网络或路由源,目前仍在等待回复。这种结构既防止 NOC 把安全威胁当成普通路由问题,也防止 SOC 在运行事实尚未确定前把未经授权的宣告称为攻击。
共同语言也能改善事后分析。事件可以结案为未写入策略的计划内变更、意外路由泄漏、疑似劫持、已确认恶意事件或未解决异常。这些结论应反馈到规则、操作说明和供应商安排中。如果没有这种闭环,检测器可能沦为生成工单的机器,而不是改善路由控制的系统。
最快的警报不一定最有用。检测器可能在第一条异常更新出现时触发,随后才发现数据流延迟、路由属于计划内变更,或所谓受害者已经批准新的源。另一方面,等待每个收集器和每项数据平面测试,又会失去早期响应优势。ARTEMIS 需要一个介于原始发现时间和最终结案时间之间的指标:收集足够可靠的证据,并让获授权运营商作出可辩护决定,需要多长时间。
这一指标可以拆解:首次观测多快到达?多少独立数据流确认了它?相关策略是否最新?RPKI 或本地 BMP 是否增加了重要证据?服务检查用了多久?负责人何时收到警报,响应何时获批?缓解是否产生预期传播,又是否被妥善撤回?这些问题能显示延迟真正发生在哪里,而不是把全部结果归因于检测算法。
“可辩护决策”指标也能阻止危险优化。如果更快行动建立在更少证据上,或制造了不必要的路由变化,系统就不应因此获得正向评价。更好的部署会同时降低不确定性和响应时间,并保留可供事后核验的记录。
来源
- ARTEMIS 项目网站
- RIPE Labs 上的 ARTEMIS 开源架构介绍
- ARTEMIS 源代码仓库与文档
- 《ARTEMIS: Neutralizing BGP Hijacking within a Minute》
- RIPE Labs 上的 ARTEMIS 运行说明
- ACM SIGCOMM 2016 ARTEMIS 演示论文
- ARTEMIS 发布版本
- CAIDA 2019 年年度报告
- RIPE RIS Live BGP 消息流
- 俄勒冈大学 RouteViews
- CAIDA BGPStream
- ExaBGP 代码仓库
- Route Origin Validation,RFC 6811
- RIPE Community Projects Fund 2019 年受资助项目
- Code BGP
- CAIDA ARTEMIS 实验部署
- ARTEMIS 实时演示
- BGP Monitoring Protocol,RFC 7854
- RIPE Atlas
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
