执行摘要
- ESnet 是由劳伦斯伯克利国家实验室运营的美国能源部科学用户设施,而非商业运营商或独立公司。
- ESnet6 结合了约 15,000 英里的专用光纤、光传输与分组系统、私有服务、互联、测量及可编程控制;其 57 Tbps 的容量数据是聚合值,而非用户速率。
- Science DMZ、perfSONAR、OSCARS、SENSE、High-Touch 和 EJFAT 都表明,ESnet 的独特贡献在于端到端工程能力,覆盖从仪器和园区边缘到远程计算的全链路。
- 对 ESnet7 和美国科学云(American Science Cloud)的规划,预示着网络将更深度地融入科学工作流,但其中多项要素仍处于演示、研究系统或新兴服务阶段。
科学网络进入实验本身
2024 年 4 月,来自弗吉尼亚州杰斐逊实验室(Jefferson Lab)的数据以 100 Gbps 速率横穿美国,到达加利福尼亚州的珀尔马特(Perlmutter)超级计算机,并在无需先写入磁盘的情况下完成了处理。该演示使用 ESnet 的实验性 EJFAT 系统,将广域网络融入科学工作流内部,而非置于其后。这一转变凸显了 ESnet 面临的核心问题:一个网络能否足够紧密地连接仪器、存储和远程计算,使得相隔数千英里的设施如同一个机器的组成部分那样工作?
一条典型的路径始于实验室或研究设施的探测器、望远镜、显微镜或模拟。本地采集系统收集数据,存储和传输服务器准备数据,园区网络将数据带到受控边界。接着,ESnet 可能将流量横跨美国,越过大西洋,送入能源部超级计算机,经过研究教育合作伙伴,或进入商业云。结果可能以分析后的数据集、警报、模型或关于实验下一步的决策形式返回。
没有任何单一组织能控制整条路径。仪器团队、实验室网络、区域研究网络、云提供商、国际合作伙伴和超级计算设施可能分属不同机构。ESnet 运营任务导向的广域层,并与这些运营商协作,使整条路径作为一个系统运作。缓慢的存储服务器、拥塞的园区链路或不合适的防火墙都可能浪费高速国家骨干网的容量;而 ESnet 的故障也能中断设计良好的本地设施。
从机构角度,ESnet 是一个能源部科学办公室用户设施。先进科学计算研究(ASCR)是其主管单位,劳伦斯伯克利国家实验室的科学网络部门负责运营。伯克利实验室本身由加州大学根据合同为能源部管理。ESnet 没有公开的股东、股票、公司估值或独立的商业资产负债表,因此更适合被理解为联邦科学基础设施,而非拥有公共客户群的网络公司。
研究人员通常通过仪器、超级计算机、实验室服务、大学连接或合作网络间接使用 ESnet。该设施区分机构站点用户和端点用户,并表示不会正式登记或跟踪每个独立的端点用户。2024 年年报中提到的 3 万多名组织用户因此是一种机构度量,而非用户数。
普通的运营商比较只能捕捉其角色的部分。ESnet 运行路由、光传输和互联,但也进行需求评审、开发开源工具、测试新服务并帮助现场诊断端到端性能。其公共目的不是销售连接,而是让地理上分散的科学设施以足够的速度、证据和操作清晰度协同工作,以支撑研究本身。(ESnet 治理;网络服务)
远程计算催生了对共享科学网络的需求
ESnet 的官方历史可追溯到 20 世纪 70 年代中期,当时计算和远程通信均十分稀缺。在劳伦斯利弗莫尔国家实验室的受控热核研究计算机中心,工作人员通过四个声学调制解调器连接了一台借来的 Control Data Corporation 6600。设备和速度属于另一个时代,但操作问题却感同身受:一个专门的科学界需要远程访问昂贵计算,而这种计算无法在每个参与机构复制。
20 世纪 70 年代末和 80 年代初,不同的能源部研究社区开发了自己的网络。高能物理和磁约束聚变研究拥有不同的设施、合作者和数据流,HEPnet 和 MFEnet 等前身系统反映了这些界限。当商业服务无法提供所需的覆盖范围、性能或操作关注时,专用网络是合理的。但这同时也造成了重复。每个项目都可以独立谈判电路、维护技术并积累专业知识,从而使得协作和长期升级支离破碎。
1986 年 ESnet 的正式成立将这些功能整合到一个更广泛的科学网络中。这一变化既是组织上的,也是技术上的。一个共享设施可以预测跨项目的需求,运营国家链路,协调国际连接,并留住专业员工。它还可以将容量从一个项目关注的问题转变为整个部门的设施计划。
早期模式确立了几个至今仍可见的特征。用户由科学任务而非零售市场定义。中央计算机和仪器证明了共享公共投资的合理性。网络设计遵循具有长期时间表的研究项目。运营需要既懂通信系统又了解故障科学后果的人员。需求不均衡地到来,因为一个实验可能产生远超常规基线的流量。
伯克利实验室拥有自己的网络谱系。它于 1974 年将一台 CDC 6600 连接到 ARPANET,其研究人员后来贡献了基础的 TCP 拥塞控制工作。Van Jacobson 和 Mike Karels 的工作属于更广泛的伯克利实验室环境,不应仅归功于 ESnet。但这种机构重叠仍然很重要。它将生产性科学网络置于那些将协议行为、测量和性能视为可研究而非接受固定条件的工程问题的研究人员附近。
运营于 1996 年移师伯克利实验室。此举确立了当前毗邻国家能源研究科学计算中心的驻地,周边有网络研究人员、软件工程师和其他能源部项目。这也强化了一种文化,即生产设施和应用研究组织共享人员、实验室和技术问题。(ESnet 历史)
公共资金使 ESnet 能在需求到来之前建设
科学用户设施之所以存在,是因为某些功能过于昂贵、专业或关联性强,每个研究团队都无法独自建设。粒子加速器、光源或领导级超级计算机符合这一逻辑。ESnet 将其应用于通信。长途光纤使用权、光设备、路由器、国际容量、持续运营、网络安全、性能测量和工程支持被集中到一个为许多项目服务的设施中。
公共资金的合理性源于科学需求的形态。商业运营商可以出售高容量电路,但通常不会根据计划数年后开始运行的探测器、合同期内可能永远不会发生的超新星爆发,或零售量小但公共价值高的研究工作流来决定其国家架构。ESnet 可以在测量利用率之前提前建设,因为其任务是科学能力而非短期的网络收入。
设施模式还改变了需求发现的方式。ESnet 与能源部科学项目进行正式的需求评审。研究人员和设施团队描述仪器、数据量、存储位置、计算目的地、时间需求、协作模式以及五到十年范围内的本地瓶颈。这些发现成为场地链路规模、路由多样性、跨大西洋采购、编排研究和服务设计的输入。
这个过程不如新相干光链路那么光鲜,但可能更具影响。海底频谱协议、路由器采购或第二个站点入口可能需要数年才能获得资金和部署。等到实验产生数据时将可预测的基础设施需求变成紧急情况。需求评审将科学计划转化为工程前置时间。
它们也暴露了不确定性。预测可能改变。仪器进度推迟、数据缩减软件改进、云使用扩大,设施可能重新设计其工作流。ESnet 并不将案例研究视为有保障的流量订单。它利用证据构建一个需求范围,然后决定灵活性、储备容量或分阶段部署在何处是合理的。
用户设施模式避免了对单个科学家的按 GB 计费。核心运营由联邦资助,而一些站点级连接成本可根据项目赞助和站点用户成本政策分配。这种安排并非没有激励。赞助项目可能倾向于较低的连接成本;ESnet 可能倾向于服务多个项目的容量和弹性;某个站点可能延迟必要的本地升级以使用国家网络。治理任务是将这些决策围绕科学成果对齐,而非围绕谁可以将成本转移到另一个预算科目。(ESnet 站点协调员委员会和成本政策;需求评审报告)
能源部设定任务;伯克利实验室运营网络
ESnet 没有运营商那样的公司层级。其权力通过联邦项目链条分布。能源部科学办公室定义任务。先进科学计算研究提供主要管理和预算监督。伯克利实验室的科学网络部门设计、运营和开发该设施。加州大学根据合同为能源部运营伯克利实验室。连接机构通过站点协调员和 ESnet 站点协调员委员会参与。
Inder Monga 担任 ESnet 执行总监,并领导伯克利实验室的科学网络部门。当前的公开领导层还指出 Chin Guok 为首席技术官兼规划与创新负责人,Adam Slagell 为首席安全官,Jon-Paul Herron 为网络工程总监,Susan Lucas 为业务运营副总监。在这些头衔之下,还有涵盖光工程、路由、站点工程、网络运营、软件、测量、编排、安全、项目管理和科学联络等职能。
这种结构的广度纠正了国家网络只是光纤和路由器集合的常见印象。ESnet 需要能够采购频谱、运行 BGP、构建遥测系统、维护开源软件、调查数据包行为、规划设施、管理安全证据以及将科学需求转化为网络设计的人员。该组织兼具运营和开发属性。
公共记录中有一个未解决的项目管理细节。ESnet 当前的治理页面将 Benjamin Brown 列为其指定的 ASCR 项目经理,而最近的需求评审材料则指出 Carol Hawk 为 ESnet 项目经理。证据支持说公开来源尚未统一,或职责可能已变更或分割。这并不支持在没有进一步确认的情况下选择一种排他的当前安排。
ESnet 站点协调员委员会为连接机构提供了一个正式的操作渠道。每个站点指定一名协调员,该协调员可以批准影响其 ESnet 连接的请求,传达需求,并参与政策或规划讨论。这是机构用户治理,而非每个数据流经网络科学家的直接投票。
这种结构创造了一种务实的责任分配。ESnet 控制其骨干网和服务。连接站点控制其园区设备、数据传- 继续 -输入节点、本地安全和电源。ASCR 控制项目级资金。科学项目定义延迟或故障的后果。国际合作伙伴控制自己的网络。只有当这些分开的决策面保持对齐时,完整的工作流才能成功。(ESnet 领导层;治理)
ESnet4 将常规流量与特殊科学流分开
到 21 世纪中期,分布式实验正在改变流量形态。大型强子对撞机在欧洲核子研究中心产生数据,并通过全球实验室和计算中心层次进行分发。通用互联网连接依然必要,但少数科学传输可能大到足以支配普通链路。为这两种模式建立一个无差别的网络使得容量管理和服务保障变得困难。
ESnet4 通过混合架构解决了这个问题。IP 核心承载一般科学通信。一个独立的科学数据网络使用高容量光电路进行大型流量,并支持动态路径供应。城域环连接主要实验室,而与 Internet2 和国际合作伙伴的合作将系统扩展到能源部站点之外。
该架构按运营需求而非简单的“慢”与“快”之分分离流量。一般 IP 服务需要广泛的覆盖范围和弹性路由。计划内的多 TB 传输可能受益于具有已知开始时间、带宽分配和端点的预留第 2 层路径。科学数据网络认识到,少数可预测的高价值流量可以证明一种不同于普通数据包转发的控制模型是合理的。
OSCARS 由此环境诞生。按需安全电路和提前预订系统允许授权用户或应用为指定时段请求网络资源。系统必须找到路径,检查拓扑和策略约束,预留带宽和 VLAN 资源,创建设备状态,并在预订结束时删除该状态。它将以前通过手动协调执行的任务转变为软件可以请求的服务。
ESnet4 也表明,原始速度不再是唯一的瓶颈。预留电路可以保护广域网络上的容量,但应用仍可能因为存储系统读取速度不够快或本地防火墙丢包而运行缓慢。这一教训直接引导了 Science DMZ 架构和端到端测量。
这一时期建立了反复出现的 ESnet 设计模式。科学问题最初表现为流量需求。然后设施围绕其创建物理容量、控制机制和操作方法。当该方法被证明有用时,软件和架构指导便会传播到最初的实验之外。(ESnet4 和 ESnet5 历史资料;OSCARS)
Science DMZ 表明瓶颈通常位于边缘
一个国家骨干网可以正常运行,而科学家却遇到糟糕的传输性能。原因很简单:骨干网只是路径的一段。企业防火墙、共享的园区核心、老旧的路由器、动力不足的服务器、数据包丢失和存储限制可能将一个高容量路由削减到其工程速率的一小部分。
Science DMZ 是 ESnet 对这种端到端现实的回应。该架构将数据传- 继续 -输入节点置于靠近受控机构边界的高性能路径上。安全策略针对这些系统暴露的有限服务量身定制,而不是迫使持续的科学流量通过为多种企业应用设计的通用有状态防火墙。
该短语可能被误解为要求移除安全。一个 Science DMZ 仍然依赖于强化主机、路由器访问控制列表、监控、漏洞管理、有限的应用暴露和操作纪律。设计改变的是控制应用的位置和方式。它避免将具有不合适吞吐量或会话行为的设备放入主数据路径,仅仅因为该设备是机构普通安全模式的一部分。
性能测量是架构的一部分,而非可选的仪表盘。perfSONAR 节点对吞吐量、数据包丢失、延迟和路径变化进行受控测试。当两个站点对传输有争议时,测量可以帮助定位问题始于主机、本地链路、区域网络、ESnet 骨干网还是国际合作伙伴。没有这样的证据,每个运营商都可能报告自己的网段看起来健康,而研究人员仍然无法移动数据。
数据传- 继续 -输入节点需要自己的工程。网络接口卡、CPU 位置、内存、磁盘或并行文件系统、TCP 缓冲区和传输软件都决定了可达到的吞吐量。ESnet 的 Fasterdata 指导和技术咨询将这些细节转化为可重复的实践。这种方法已远远超越能源部实验室传播开来,但 ESnet 并不运营每个使用该名称的部署。
Science DMZ 之所以有影响力,是因为它将采购问题重定义为一个系统问题。购买更快的电路并不能解决其他方面受限的路径。有用的性能单位是从存储到存储或从仪器到计算的完整工作流,每个管理域都被测量并分配明确的责任。(Science DMZ 指南;网络性能工具)
ESnet5 使大陆级 100G 成为生产服务
下一个重要的容量过渡得到了先进网络倡议和美国经济刺激资金的支持。ESnet 通过《美国复苏与再投资法案》获得 6200 万美元,用于开发 100 Gbps 长途原型机并支持向 ESnet5 过渡。投资不仅包括新路由器。ESnet 获得了跨越国家光纤覆盖范围的频谱容量权利,使该项目对如何部署和升级波长有了更大的控制权。
ESnet5 于 2012 年底投入生产。当时,能源部和 ESnet 将其描述为世界上最快的科学网络。这一历史主张与首次大陆级 100G 部署有关。不应将其重复为无条件的 2026 年全球排名。研究网络现在通过不同的衡量标准报告容量,包括单个接口速度、聚合骨干容量、光频谱和实验试验。在所提供证据中,没有中立的最新比较来确定一个普遍赢家。
100G 的经济效应远超十倍接口升级。科学项目可以围绕以前需要更长时间占用链路的常规远距离传输进行规划。实验室可以集中部分计算或存储,而不是在本地复制。国际合作获得了更强大的美国骨干网。新容量也更快地暴露了本地限制,增加了 Science DMZ 和 perfSONAR 的价值。
ESnet5 保留了数据包服务和专用科学路径之间的混合关系。它也加深了自动化的重要性。在 100G 规模下,预留容量、诊断故障和在国家级覆盖范围保持服务一致性不能仅依赖临时设备配置。
该项目展示了公共基础设施投资如何在任何单个实验充分利用网络之前改变科学选项。容量为未来仪器提供了储备,但储备容量并非与闲置零售产品相同意义上的浪费。其价值包括避免延迟实验、适应故障以及允许新工作流在等待另一个建设周期之前进行测试。
投资仍需根据科学用途来衡量,并且当预测改变时,设计必须保持适应性。ESnet 后来在遥测、缓存和编排方面的工作反映了从每个已安装比特中提取更多科学价值的努力,而不是将持续的物理扩展视为唯一答案。(ESnet5 历史公告)
ESnet6 结合光容量与可编程控制
ESnet6 项目始于 2017 年,在约六年的设计和建设后于 2022 年 10 月 11 日公开发布。伯克利实验室报告称,发布时在约 15,000 英里的专用覆盖范围内聚合容量超过 46 Tbps,骨干链路从 400 Gbps 到 1 Tbps。2024 年年报后来给出的 57 Tbps 和链路范围扩展到 1.2 Tbps。这些数字指代不同日期和不断增长的系统,而非对一个固定网络的定义冲突。
物理层包括长途光纤路径、光线路系统、放大器、频谱权利、共置设施和本地入口。2024 年报告统计了 278 个光放大器站点。相干光学在光纤上承载多个高速通道,而放大器和可重构光设备维持信号水平并路由波长。地图上显示的路径可能通过暗光纤、频谱、点亮服务或合作伙伴安排进行控制。15,000 英里的描述并未确立能源部对每条电缆拥有法律所有权。
在光层之上,路由器和服务边缘提供 IP、私有路由环境、第 2 层服务、对等互联和云连接。年报统计了 78 个路由器位置。单个站点可根据需求以 10、100 或 400 Gbps 连接,而骨干链路可以将多个接口或波长聚合成更高的数字。
软件层将 ESnet6 与仅容量升级区分开来。自动化维护设备和服务状态。可编程遥测为运营商提供更详细的证据。OSCARS 供应预留路径。SENSE 尝试跨域的应用驱动协调。High-Touch 使用可编程硬件实现更丰富的数据包和流可见性。API 和测试环境钩子允许成功的研究走向运营。
建设也更加强调弹性。多样化路由、多个站点入口、独立电源、备用路由器和 HA 服务位置减少了一次故障使实验室脱离国家系统的机会。这些保护措施有不同的范围。冗余骨干网对本地双电路共享一条管道的情况无能为力,第二个路由器如果两个设备依赖同一电源系统也不产生弹性。
因此,ESnet6 应被解读为一个分层设施。光纤创建物理覆盖范围。光学创建容量。路由器创建数据包和私有服务。软件创建可重复性和可编程性。测量确定承诺的路径是否有效。组织协议使其能够跨越 ESnet 不拥有的边界。(ESnet6 启动;2024 年年报)
57 Tbps 意味着什么——以及不意味着什么
网络统计经常将不同层次折叠成一个数字。ESnet 2024 年的 57 Tbps 数字是系统范围内聚合的工程容量。它不是一个物理链路,不是每个实验室可用的吞吐量,也不是每时每刻承载的流量。同一份报告描述了 400 Gbps 至 1.2 Tbps 之间的骨干链路,七个美国站点以 400 Gbps 或以上连接,以及 2.7 Tbps 的跨大西洋容量。每个数字回答不同的问题。
同一份报告描述了在约 15,000 英里覆盖范围内的 78 个路由器位置和 278 个光放大器站点。它连接了所有 17 个能源部国家实验室,并报告了 28 个能源部用户设施、277 个研究与教育、商业和其他网络关系覆盖五个国家,超过 30,000 个组织用户,以及分布在 24 个州的 137 名员工和合同工。这些数字描述了不同的人群,不应作为客户总数相加:路由器、设施、合作伙伴网络、机构用户和劳动力是独立的度量。
站点连接是单个机构边界处的容量。骨干链路是网络位置之间的容量。光系统可以承载多个波长,而逻辑服务可能仅使用物理层的一部分。聚合容量将许多无法同时为相同源和目的地服务的资源相加。流量体积测量的是随时间移动的数据量,而非瞬时可用的最大速率。
ESnet 在 2024 日历年内承载了 1.77 EB,高于 2023 年的 1.7 EB。4% 的增长率与该设施自 1989 年以来约 55% 的年均长期平均增长率相比偏低。单一年度并不证明科学需求已经稳定。大型项目投产不均衡,软件变更可能减少传输,一次实验或国际事件可能迅速改变组合。
流量也集中。2024 年报告称,大型强子对撞机活动占总流量的大约一半。费米实验室是最大的外部发送者,达 136 PB,NERSC 是最大的能源部接收者,达 75.3 PB,橡树岭是最大的能源部发送者,达 58.3 PB。这些数字揭示了重要的工作负载,但不是科学价值的完整排名。一个较小的传输可能更具时间敏感性,或可能支持一个独特的仪器。
因此,容量规划需要同时拥有多个视角:峰值和平均流量、路由级利用率、故障储备、站点链路速率、科学截止日期和未来需求。仅围绕平均使用设计的网络在超新星爆发或电缆中断期间可能失败。仅围绕最大理论事件设计的网络可能过度建设昂贵且不灵活的资产。
ESnet 的工程问题是将容量放置在需要它的工作流可以到达的地方,然后验证终端系统能否使用它。这就是为什么容量数字应与 Science DMZ、测量、编排和需求评审并列,而非置于文章顶部作为一个不言自明的排名。(ESnet 用数字说话)
AS293 为任务而非零售市场路由
ESnet 的公开自治系统编号是 AS293。该网络与能源部站点、研究教育网络、商业网络和付费上游提供商交换路由。路由策略决定哪些路径可以承载科学流量,如何处理故障,以及哪些外部网络获得直接互联。
对等策略是选择性的。潜在对等方必须使用 BGP,维护当前的互联网路由注册表和 PeeringDB 信息,避免 RPKI 无效宣告,并遵循与 MANRS 相关的路由安全实践。ESnet 要求 IPv6 或双栈对等,不接受新的仅 IPv4 关系。直接私有互联起始于 100G 端口,400G 强烈推荐。
这些条件反映了任务和运营成本。直接互联消耗端口、工程时间和监控容量。ESnet 不需要仅仅因为存在公共路由就与每个网络对等。它寻求改善能源部科学路径、减少对转接依赖或连接主要合作者的关系。公共互联网访问由来自 Hurricane Electric 和 Lumen 的付费转接补充,用于那些通过研究或直接对等无法有效到达的目的地。
该网络发布 BGP 团体,区分 ESnet 连接站点、研究教育网络和商业网络。连接机构可以使用这些标签应用策略,尽管下游解释仍超出 ESnet 控制。一个团体是描述性元数据,而非每个网络都会做出相同路由选择的普遍保证。
路由安全也有局限性。拒绝 RPKI 无效宣告阻止了一类重要的不良路由,但它不能防止每一次泄漏、被破坏的对等方、错误的有效起源或错误的路由起源授权。路由劫持监测可以识别意外的起源变化,但检测可能发生在传播之后。黑洞路由可以通过丢弃发往目的地的流量在攻击期间保护一个站点,但保护是以牺牲该前缀的可达性为代价的。
任务导向的设计在服务边界中可见。ESnet 承载公共 IP 流量,但并非试图赢得消费者转接市场。其路由策略围绕科学可及性、弹性和可信互连进行安排。网络的价值来自它为所服务社区创建的路径质量,而非最大化连接到 AS293 的零售客户数量。(ESnet 对等策略)
私有路径扩展范围而不消除外部风险
ESnet 的服务菜单始于物理连接。符合条件的站点可以通过本地或远程入口点以 10、100 或 400 Gbps 连接。当设施远离专用覆盖范围时,服务入口(Service On-Ramp)可能使用暗光纤或点亮运营商电路。接入设计是科学路径的一部分,供应商提供的最后一段可能成为主导故障或性能约束。
第 3 层 IP 服务提供路由的 IPv4 和 IPv6 连接。第 3 层虚拟私有网络(L3VPN)为多站点项目创建一个逻辑上分离的 IP 和 BGP 环境,同时与其他服务共享物理基础设施。第 2 层虚拟私有网络(L2VPN)提供点对点或多点以太网连接,可以静态配置或通过 OSCARS 供应。这些服务允许实验连接设施,而不通过公共互联网暴露每一种关系。
私有服务并不意味着物理隔离服务。逻辑分离依赖于路由器配置、标签、路由实例、访问控制和运营实践。共享平台中的故障可能影响多个服务,而配置错误可能破坏预期的隔离。其价值在于受控分割和可预测的连接性,而非声称不存在共享依赖关系。
云连接(Cloud Connect)将 ESnet 路径扩展到主要商业云环境,包括 AWS、Microsoft Azure、Google Cloud 和 Oracle。站点可以通过专用第 2 层或第 3 层连接到达提供商入口,而非普通的公共互联网路由。这可以改善路径控制并减少对可变转接的暴露,但它并不能消除云侧安全、提供商中断、身份设计、出站费用或区域可用性。
云关系说明了 ESnet 角色在演变。能源部科学不再仅存在于实验室和联邦超级计算机中。研究人员可能使用商业对象存储、专业化服务或突发计算。ESnet 必须连接这些资源,但不应假装云是联邦网络的一部分,或一条私有电路本身就让云账户安全。
其他服务包括辅助 DNS、网络时间、路由劫持监测和黑洞路由。每一项都解决一个支持依赖关系,这种依赖即使在光容量可用时也可能中断研究。名称服务故障、不正确的时间、路由泄漏或拒绝服务攻击可以在不损坏光纤的情况下使科学系统不可用。
服务菜单相当于网络层之间的一组操作契约。物理连接建立路径。路由创建可及性。私有服务创建逻辑边界。云互联将系统扩展到商业基础设施。安全和支持服务减少已知的故障模式。用户仍然必须在每一端构建一个功能正常的端点和本地网络。(ESnet 网络服务菜单)
OSCARS 使容量可预订
大多数互联网流量在数据包到达时使用任何可用的容量。该模型对一般通信有效,但一些科学传输是计划好的、大型的且延迟代价高昂。OSCARS 为授权用户和应用提供了一种为指定时段预留网络资源的方式。
一个预订可以识别端点、开始和结束时间、带宽、VLAN 信息、路由排除和其他约束。系统检查拓扑和现有承诺,找到可接受的路径,创建所需的网络状态,并在预订到期时删除它。服务必须避免两次分配相同的稀缺资源,并且必须考虑改变可用拓扑的维护或故障。
其意义在于运营而非表面文章。手动电路供应可能需要工程师之间数天的协调。程序化预订可以在几分钟内创建,并可以成为实验工作流的一部分。网络不再是固定的背景管道,而成为软件可以像存储或计算一样请求的资源。
OSCARS 是一个开源生产系统,已被其他网络和测试环境采用或评估。一些公开的采用数字出现在包含历史资料的页面上,因此最安全的结论是该系统已超越 ESnet 传播,但不应将每个列出的部署都视为当前且完全相同的。
预订不保证应用吞吐量。它可以保护一个定义量的网络容量,但它不能让存储服务器更快地读取、修复园区网络中的数据包丢失或调整操作系统。如果应用仅达到预留速率的一小部分,诊断必须回到端到端路径。
预订也引入了分配问题。高优先级实验可以从保障容量中获益,而未使用的预订可能降低他人的灵活性。政策必须决定谁可以请求服务,冲突如何解决,以及预订是否可抢占。这些决定是设施治理的一部分,即使供应代码是自动的。
OSCARS 仍然是 ESnet 应用软件成为基础设施的最清晰例子之一。它将一种操作实践转化为可重复的服务,围绕授权保留人工策略,并给科学应用一种受控的方式来表达网络需求。(OSCARS)
SENSE 测试应用是否能够请求端到端结果
预留网络路径只解决分布式工作流的一部分。存储系统、数据传输服务和计算资源也存在可用性、容量和策略。SENSE——面向百亿亿次级端到端网络科学的软件定义网络——将编排扩展到单个网络域之外。
该项目将网络和终端系统表示为可发现资源。一个科学应用可以描述一个预期结果,比如在所需速率下在设施之间移动数据集。SENSE 从参与域收集模型,协商资源,供应网络和传输服务,观察遥测数据,并在工作流完成后释放资源。
这比配置一条电路更难。参与组织保留自己的权限和数据模型。一个域可能暴露带宽,而另一个暴露存储端点或传输服务。策略、凭证和维护窗口各不相同。SENSE 必须协调,而不假设一个中央控制器能命令每个系统。
在 2024 年大型强子对撞机数据挑战期间,启用 SENSE 的工作流在加州理工学院和加州大学圣迭戈分校之间持续 330 Gbps。这一结果显示了在特定实时工作流中,应用驱动的编排能够以可观速率运行。它并未显示 SENSE 是每个 ESnet 站点的普遍生产服务。2024 年报告仍将该项目描述为处于研究阶段。
OSCARS 和 SENSE 自动化不同的工作单元。OSCARS 在已知服务域内预留网络资源。SENSE 试图协商一条包括由不同组织拥有的系统的完整路径。前者具有更清晰的生产边界。后者提供更广泛的科学价值,但承载更多治理和集成风险。
对运营商而言,实际问题是故障归属。如果应用程序声明意图且工作流表现不佳,原因可能在于资源模型、网络、存储服务、凭证、应用或跨域时序问题。编排需要足够精确的证据,以告知每个运营商协商状态的哪一部分偏离了。
SENSE 指向一个基础设施,其中应用请求结果而非电路。其进展应通过可重复的多域生产使用、明确的支持责任以及从部分故障中恢复的能力来评判,而非仅凭最高演示传输速率。(SENSE;2024 应用研究)
EJFAT 将科学事件直接移到远程计算
传统科学数据移动通常遵循基于文件的序列。实验产生数据,本地系统处理足够的量以写出文件,文件进入存储,随后的传输将它们发送到另一设施进行分析。该模式易于理解且运营上可靠,但它延迟反馈,并需要针对峰值采集确定大小的本地存储和计算。
EJFAT——ESnet-杰斐逊实验室 FPGA 加速传输系统——支持不同的路径。它直接分配来自仪器的实时、UDP 封装的事件数据到可用计算工作节点,这些节点可能在远程超级计算中心。一个基于 FPGA 的可编程智能网卡读取事件标识符,并将属于同一事件的所有片段发送到一个工作节点。随着计算节点变为可用或繁忙,控制系统可以改变分配。
事件分组至关重要。通用负载均衡器可以将数据包分散到各服务器,但科学处理可能要求一个探测器事件的每个片段到达同一个工作节点。EJFAT 将高速转发功能与计算工作节点的调度分离,并允许每一侧独立扩展。
引言中描述的 2024 年 4 月杰斐逊实验室到珀尔马特的演示在没有中间磁盘阶段的情况下达到 100 Gbps。根据 ESnet 报告,后来的测试使用了跨多个设施的约 20,000 个核的计算资源。这些结果显示了系统的潜力,但并不意味着每个仪器都可以在没有工程变更的情况下采用它。
稀有同位素束设施(FRIB)提供了一个更近期的操作实例。ESnet 在 2026 年 7 月报告称,研究人员通过 EJFAT 以大约 5–6 Gbps 将原始实验数据流式传输到远程超级计算机。一个在 15 小时内生成 615 GB 数据的运行,在八个珀尔马特节点上使用机器学习推理在 20 分钟内完成处理。与 100G 演示相比,较低的网络速率并未使该结果的重要性降低;科学成果是在真实工作流中实现了更快的反馈。
实时流传输改变了设施的经济性。探测器可以借用共享计算,而不必为每个峰值构建足够的本地容量。研究人员在稀缺的束流时间仍然可用时检查结果。该系统也创造了新的依赖关系。网络中断、计算分配问题或事件分配错误可以实时影响实验,而不是延迟一个稍后的文件传输。
EJFAT 仍然是一个先进的原型或新兴平台,而非普遍支持的服务。生产采用将需要仪器集成、安全、FPGA 可用性、运营所有权、调度协议以及当 UDP 数据包丢失时清晰的行为。其重要性在于表明广域网络可以位于采集回路内部,而不是在其之后。(EJFAT;FRIB 科学亮点)
High-Touch、perfSONAR 和 iperf3 使路径可观察
高容量网络可能会以聚合利用率图表揭示不了的方式发生故障。短暂突发可能溢出队列。数据包可能乱序到达。丢失可能影响一个方向或一类流量。路由可以在测试之间改变。安全相关的流可能在统计采样中消失。
High-Touch 使用可编程硬件和软件收集比传统采样记录更丰富的数据包和流遥测数据。2024 年,它被用于调查大型强子对撞机吞吐量、与鲁宾天文台流量相关的数据包重新排序以及安全事件。其目的是诊断精度:识别粗放流量总计会隐藏的行为。
更丰富的证据有其代价。数据包和流细节需要存储、处理、访问控制和仔细解释。它可以揭示通信端点、协作模式和科学活动的时间安排。一个为操作可见性设计的系统因此成为一个敏感数据资产。
perfSONAR 处理不同的层面。它是一个分布式测量系统,由一个多组织合作伙伴关系支持,ESnet 是其创始核心参与者之一。据报道,2024 年全球有超过 2,000 个位置,ESnet 运营超过 30 个站点。受控测试测量参与节点之间的吞吐量、延迟、丢失和路径行为。
分布式设计至关重要。研究人员可以报告传输缓慢,但在良好设计的 perfSONAR 节点之间进行的测试可以显示底层路径是否支持预期速率。定向测试可以隔离不对称性。重复测量可以显示退化何时开始。Traceroute 数据可以识别路径变更,尽管观察到的路由与应用的实际转发行为可能不同。
iperf3 提供基于 TCP、UDP 或 SCTP 的主动吞吐量测试,并支持 IPv4 和 IPv6。ESnet 维护该开源工具,并报告在特定条件下在 200G 路径上测试超过 150 Gbps。综合测试不是应用基准测试。它有助于确定在受控设置下主机和网络是否可以移动流量,之后可以分别检查存储和应用行为。
合起来,High-Touch、perfSONAR 和 iperf3 创建了不同的真相视图。High-Touch 以更高保真度观察生产流量。perfSONAR 跨域提供计划或按需路径测量。iperf3 直接测试端点和网络吞吐量。没有单一视图是完整的,但该组合减少了仅从一个操作员的本地仪表板诊断分布式故障的诱惑。(网络性能工具;2024 运营创新)
缓存可以移走流量而非加快传输
增加容量并非改进科学网络的唯一途径。一些数据集被同一地区的研究人员重复请求。即使骨干网能承受负载,将每个副本通过广域网络移动也浪费带宽并增加延迟。
ESnet 2024 年应用研究报告描述了与科学数据社区一起使用的五个区域缓存节点。在整个研究中,缓存平均每天减少 33 TB 的广域流量。三分之二的请求在本地完成,平均缓存命中率为 94%。效果因地点而异:报告的广域流量减少在南加州达到 69.3%,在芝加哥为 48.4%,在波士顿为 6.6%。
这些差异是信息丰富的。缓存价值取决于数据集流行度、本地用户、存储大小、清除策略和服务配置。放置在反复分析相同数据的社区附近的缓存可以消除大量传输。服务于多样化或很少重复数据集的缓存可能消耗存储而不提供相同的收益。
缓存也改变了控制。网络运营商开始参与数据放置,而科学社区必须决定哪些数据集可以复制,如何保持新鲜度,以及谁被授权访问它们。存储故障和过时内容成为与网络相关的运营关注点。
这项研究表明,最有效率的比特可能是从未进入骨干网的比特。光升级增加供应。缓存改变需求。工作流调度可以将传输移离繁忙时段。压缩或本地过滤可以在传输前减少数据。成熟的基础设施计划评估所有这些机制,而不是仅通过已安装的 Terabit 来衡量进展。
这一结果应局限于所研究的部署。它不能证明每个科学数据集将达到 94% 的命中率,或缓存可以取代独特实时流的新容量。它提供的证据是数据架构和网络架构可以一起设计。(2024 应用研究活动)
跨大西洋科学需要物理多样性和容量
ESnet 的国内覆盖范围不能与其国际义务分开。高能物理围绕大西洋两岸的设施和计算中心组织,2024 年年报将 ESnet 大约一半的流量归于大型强子对撞机活动。因此,即使每个国内路由器都健康,欧洲和北美之间的电缆故障也可能影响核心科学工作负载。
在 2024 年和 2025 年初,ESnet 将报告的跨大西洋容量从约 700 Gbps 扩展到 2.7 Tbps。该项目的一个主要部分是与 Aqua Comms 签订的为期 15 年的协议,获得连接纽约、都柏林和伦敦的光纤对四分之一的容量。ESnet 还通过多个电缆系统与 GÉANT 共享容量和成本。工程目标是至少 3.2 Tbps 跨越四条物理多样路径,底层设计提供超过 10 Tbps 的增长潜力。
容量和多样性解决不同的问题。两个逻辑服务可能共享同一条电缆、登陆站或陆地管道并一起故障。海底维修可能需要故障定位、许可证、电缆船、合适的天气和受损光纤的物理回收。恢复可能需要数周或数月。因此,ESnet 针对同时三条电缆故障的场景进行规划,而不是假设一条备份路径就足够。
长期频谱权利使设施在升级方面比重复购买固定的成品电路拥有更多控制权。它们也创造了与特定电缆系统、登陆基础设施和运营合作伙伴的承诺。ESnet 通过租赁频谱并没有消除海上风险。它获得了跨多个系统工程容量和弹性的能力,同时仍依赖电缆所有者、维修过程和合作伙伴网络。
这是另一个需要谨慎使用“专用”一词的地方。ESnet 在重要路由上控制专用权利和基础设施,但物理资产模型各异。国内和国际路径可能涉及暗光纤、频谱、点亮服务、共置和合作伙伴容量。地图上的一条线并未披露每个段落上相同的所有权或维修权限。
与 GÉANT 的关系表明了研究网络为何是合作而无集中控制的。两个组织可以分担成本和协调科学流量,但每个仍对自己的机构和成员负责。端到端性能仍然依赖于两个骨干网之外的国家研究网络、园区系统和实验设施。(跨大西洋里程碑;2024 年年报)
科学以稳定规模、罕见突发和硬性截止日期的形式到来
大型强子对撞机提供稳定的规模。其分布式计算模型在欧洲核子研究中心、费米实验室、布鲁克海文、大学和其他中心之间移动实验数据,产生持续的国际流量。计划中的高亮度运行预计将增加探测器输出、模拟和复制。网络必须承载常规的巨大流量,同时保留足够的路线多样性以在电缆或设施故障中生存。
维拉·鲁宾天文台提供了一个截止日期。位于智利的望远镜被设计为每 30 秒产生大约 13 GB 的图像。数据路径支持在 SLAC 进行快速处理并生成关于瞬变天体的警报,以便其他天文台作出响应。ESnet 报告了一个目标,即在少于七秒内将每张图像移动大约 12,000 英里。该路线包括南美和国际研究网络合作伙伴,因此结果依赖于 ESnet 自身域以外的协调工程。
DUNE 提供了一个异常的突发。在超新星事件期间,该中微子项目预计需要在 100 秒内移动多达 600 TB。其更广泛的二十年计划预计将产生约 900 PB。这些是针对未来运营的规划需求,而非对当前常规流量的描述。它们至关重要,因为事件不能在容量变得可用之后安排。仅围绕平均利用率构建的网络可能恰恰在最具科学价值的那一刻失败。
聚变研究结合了国际距离和长期发展前景。2026 年 5 月,一次测试将 176 TB 的 ITER 数据从马赛以近 80 Gbps 的速率移动到通用原子公司的圣地亚哥 DIII-D 设施。ITER 当时仍在建设中,因此该传输展示的是准备状态,而非正常的满负荷生产。需求资料预计未来一些聚变工作流将达到每天约 2 PB 和至少 200 Gbps。
FRIB 和杰斐逊实验室展示了第三种模式:在数据仍在接收时,实验可能需要远程分析。EJFAT 允许事件流到达 NERSC 或橡树岭的计算设施,而不是等待文件完成和复制。光源、电子显微镜和其他仪器面临类似的选择:本地过滤、远程人工智能推理以及结果返回给操作员的速度。
气候和地球科学再次扩大了需求范围。大型模拟和观测数据集在计算和存储设施之间移动,而野外传感器可能位于传统光纤不可用的地方。没有单一的头条速率能够捕捉所有这些需求。ESnet 必须在同一个设施模型下支持持久的批量传输、罕见的突发、低延迟反馈、国际协作和远程采集。(鲁宾天文台案例研究;DUNE 案例研究;需求评审)
需求评审将科学计划转化为网络架构
ESnet 不能等到实验产生第一个数据集才开始订购光纤、路由器或跨大西洋容量。长途协议、设备采购、站点建设和软件开发需要数年时间。因此,该设施与能源部科学项目进行跨越五到十年周期的需求评审。
研究人员和设施团队描述仪器、预期数据量、存储位置、计算目的地、时间约束、国际合作者、云使用和弹性需求。然后网络和计算专家检查整个工作流。对更大链路的需求可能暴露出本地存储、路线多样性、安全架构或数据传输软件中更重要的问题。
评审过程是一种协同设计。科学节目解释他们试图实现的目标;ESnet 将这一目标转化为基础设施依赖项,并测试提议的路径是否可行。结果可以影响站点链路规模、新路由、海底采购、Science DMZ 部署、编排研究、人员配置和未来网络代际的时间表。
于 2025 年完成并于 2026 年 1 月发布的主要高能物理评审涉及 127 名贡献者和 14 个案例研究,报告约 400 页。其重要性不在于每个预测都将正确。仪器延期、软件变得更有效率以及新的工作负载出现。其价值在于一份文档化的记录,其中研究人员、网络工程师、计算中心和资助者可以看到相同的假设,并有意识地修改它们。
预测仍然困难,因为科学需求是不连续的。超新星可能在实验生命周期内永远不会发生,而人工智能工作负载可以比正式评审周期扩展得更快。平均流量增长对预算编制有用,但不能替代具体情况的规划。ESnet 在 2024 年异常低的 4% 流量增长并不表明长期需求已经停止;它表明为什么一年不应该决定一个数十年的基础设施计划。
需求评审也分散了责任。一个实验室不能假设国家骨干网会修复不完善的园区路径,而 ESnet 不能假设科学项目会在容量建成后适应。将依赖关系置于共享计划中,使后来的分歧更加具体。(需求评审报告)
无线和量子项目测试 ESnet 职权范围的边界
国家光纤网络很好地覆盖固定机构。科学仪器并不总是在那些地方运行。地热田、环境观测站和临时作业区可能缺乏运营商覆盖、可靠的电力或实用的光纤路由。ESnet 的无线边缘(Wireless Edge)计划研究私有蜂窝、Wi-Fi、定向无线电和卫星系统如何将科学工作流扩展到这些场所。
2026 年 6 月公布的一个内华达地热部署结合了使用公民宽带无线电服务频谱的私有 4G、长距离 Wi-Fi HaLow、普通 Wi-Fi、Starlink 回传、定向无线电和便携式自供电塔。该设计针对一个野外站点的条件。它不是通用的 ESnet 无线产品,也不能提供长途光纤的持续容量。地形、天气、频谱、电力和卫星提供商仍然是服务路径的一部分。
重要的组织点是 ESnet 没有在最近的光纤点止步,将剩余问题称为别人的责任。其科学联络功能将采集、回传和广域传输视为一个工作流。这种方法可能比统一的产品更有价值,因为远程科学站点具有不同的物理约束。
QUANT-NET 探索另一个前沿。ASCR 资助的项目正在建设一个三节点量子网络测试环境,连接伯克利实验室和加州大学伯克利分校的两个地点,跨度约五公里。工作包括离子阱、光子耦合、纠缠交换、贝尔态测量、时间关键控制和模块化软件框架。
与 ESnet 的联系主要是控制和编排。量子实验需要经典通信、精确的时序和仍然难以操作的设备之间的协调。开源控制软件可以使实验更具可重复性,并减少手动调整。该测试环境不是生产性的量子互联网,也不通过纠缠传输常规的大量科学数据。
因此,应通过它们教授的内容和可重用的东西来衡量无线边缘和 QUANT-NET。它们都不是证据表明每个 ESnet 用户将获得无线接入服务或量子链接。它们将设施的研究功能扩展到未来科学网络可能需要新物理介质和控制系统的领域。(无线边缘部署;量子网络研究)
美国科学云和 ESnet7 将规划从场站转移到工作流
集成研究基础设施(IRI)计划和新兴的美国科学云(American Science Cloud)反映了能源部描述其设施方式的一种变化。这些项目不是将仪器、网络、数据存储和超级计算机视为独立服务,而是旨在使它们作为一个联邦环境运作,用于科学数据、人工智能和高性能计算。
ESnet 的角色是连接和编排层。数据必须从仪器移动到存储和加速器;用户和服务需要受控访问;工作流必须发现可用资源;遥测必须显示系统是否满足科学目标。EJFAT、SENSE、OSCARS、云连接和 High-Touch 各自解决了该问题的一部分,但没有哪一个单独构成美国科学云。
在 Confab26 上,Inder Monga 被确认为美国科学云项目副主管,项目会议包括演示和下一代网络规划。这是积极机构工作的证据,而非证明在 2026 年 8 月就已完成了一个通用的科学云。访问策略、连接资源清单、生产支持和治理仍是发展中的问题。
ESnet7 出现在同一规划环境中。该标签是真实的,创新会议已经探讨了遥测、数据包检查、数据移动、人工智能和量子网络。然而,ESnet6 仍是当前的生产代际。在所提供证据中,未识别出最终的公开架构、项目基线、供应商选择、完整预算或启动日期。
网络代际标签在设备安装前早早地就创造了期望。一项规划项目可以塑造研究重点、供应商参与和资本请求。它不应被报道为已完成骨干网。最可辩护的解释是,ESnet 正在利用 ESnet6 的运营经验和当前的工作流项目来决定第七代应该是什么样子。
速度仍然重要,但证据表明可编程性和智能可能变得同样核心。更快的链路不能告诉应用哪里可用的计算资源,识别微观突发,调度探测器数据流,或证明跨域服务已被正确释放。因此,ESnet7 的战略问题是网络应该理解和协调科学工作流到何种程度,而不成为无法管理的中央控制器。(Confab26 会议议程;2024 应用研究)
联邦资金支持该设施,但预算项并非收入
ESnet 不是通过向公众出售带宽来为其骨干网融资。能源部主要通过 ASCR 中名为“高性能网络设施与测试环境”的活动为其提供资金。2027 财年请求为该计划项提议了 1.03 亿美元,而上年成行列为 9726.1 万美元。
这些数字提供了最佳的公开项目规模指示,但它们不是 ESnet 的损益表。该行还支持与网络相关的测试环境、软件管理、升级和研究活动。它没有披露生产骨干网的单独年度运营成本、按网络代际划分的资本支出,或与各个站点连接相关的收入。
公共资金使该设施能在需求商业化之前进行投资。它可以购买长期频谱,维护开源工具,支持数量小但科学重要性高的实验,并建设超出即时利用率可能合理范围的路线多样性。同样的模型也产生了对国会拨款、部门优先级和伯克利实验室运营框架的依赖。
站点连接并非总是零成本。ESnet 的站点用户成本政策允许机构用户根据赞助、资格和增量要求承担连接相关成本。关系的单位是站点,而非研究人员个人。端点用户不通过 ESnet 单独计费或注册。
独立账户的缺失限制了财务分析。公开材料未揭示完整的供应商集中度、工资单、折旧计划、逐路线资产登记或年度资本预算。因此,将 1.03 亿美元称为“ESnet 收入”将是不正确的。更准确的结论是,一个联邦项目通过一项更广泛的活动项为一个生产设施、其升级工作、软件管理和测试环境提供资金。
资金结构也影响战略选择。商业网络可以退出不足以覆盖其成本的路线。一个公共科学设施必须权衡国家使命、科学机遇和长期容量与预算约束。这可以让没有即时财务回报的投资变得合理,但也使透明的优先排序和需求证据至关重要。(2027 财年 ASCR 预算请求;ESCC 与站点政策)
可靠性和可见性创造了正常运行时间之外的义务
ESnet 2024 年报告记录了一个显著可用性结果:包含在相关测量中的十个科学办公室站点全部达到了不包含计划维护的 100% 服务可用性。这是第一年所有站点同时超过 99.9% 的要求。年报还给出了更广泛的 99.99% 正常运行时间数字。这些是有用但范围不同的度量,不是证明每个服务、机构和国际路径都经历了零中断。
站点弹性计划检查连接设施的多样入口、路由器、电源和故障域。这反映了一个令人不安的事实:一个骨干网可以是冗余的,而一个实验室仍然依赖一个本地的管道或设备。可靠性必须到达建筑物和数据传输系统,而不仅仅止步于骨干网地图。
路由策略提供了另一层控制。ESnet 在对等中拒绝 RPKI 无效宣告,要求当前路由记录,并支持路由劫持监测和目的地黑洞。这些控制减少了已知风险,但不能使域间路由万无一失。有效的路由起源仍可能与泄漏或策略错误相关联,而黑洞通过使被目标是目的的不可达来保护其他系统。
自动化创造了类似的权衡。标准化配置、库存和编排可以减少手动错误并加速恢复。一个错误的模板、策略或数据记录也可以快速传播到许多设备。适当的响应是分阶段部署、独立验证、清晰的回滚或前向恢复步骤,并限制任何单个自动化账户的权限。
运营数据值得同等关注。ESnet 的设施数据政策规定路由器利用率和 NetFlow 数据可以无限期保留,并在东西海岸存储之间复制。主动 perfSONAR 测量在没有备份的单个磁盘上保留六个月。路由器利用率和 traceroute 数据是公开的,而流量和安全记录具有受限访问权限。
ESnet 可以缺乏单个用户关系而仍收集详细的运营元数据;这些是不同的系统。ESnet 缺乏单独成员资格和计费关系,然而网络元数据可以识别端点、通信机构、时序和流量模式。高保真遥测改善了诊断和安全性,同时增加了对最小化、访问控制、保留审查和负责任使用的需求。
可靠的弹性模型依赖于有边界的机制:物理多样性、站点工程、路由安全、测量、事件响应、数据治理和清晰范围的指标。(可用性里程碑;设施数据政策;对等政策)
检验标准是分布式科学在实践中是否奏效
ESnet 的历史可以被解读为一系列更快的网络:专业的前身、ESnet4、大陆级 100G 的 ESnet5 和多太比特的 ESnet6。这一时间线是真实的,但它错过了更重要的连续性。当仅靠原始带宽无法解决问题时,该设施反复改变了围绕科学工作的架构。
科学数据网络将异常流与普通流量分开。OSCARS 使容量变得可预订。Science DMZ 改变了机构边界。perfSONAR 和 iperf3 将性能争议转化为测量。SENSE 将应用意图连接到了几个管理域。EJFAT 将广域路径带入了探测器回路。缓存改变了需求,跨大西洋频谱改变了 ESnet 对国际增长的控制。
该组织的权力仍然有边界。能源部和 ASCR 设定任务和资金。伯克利实验室运营该设施。加州大学根据合同管理实验室。站点协调员批准影响他们机构的变更。国际合作伙伴控制自己的网络。云提供商、运营商、电缆所有者和设备供应商保留对 ESnet 所依赖组件的权力。
这种控制权的分布不是软件可以消除的不便。它是科学网络运作的条件。实际成就是协调强大到足以交付工作流,而不假装一个机构拥有整条路径。
同样的纪律应适用于关于未来的主张。ESnet7 是规划,根据最新的完整报告 SENSE 仍处于研究阶段,EJFAT 是先进原型或新兴平台,QUANT-NET 是实验性的,美国科学云仍在建设中。当成熟度被准确描述时,它们的证据才是有价值的。
ESnet 更长远的重大意义在于用户设施模式。该网络被视为一个科学仪器,具有需求、运营、软件、测量、研究和公共资金。该模式认识到,相隔数千英里的探测器和超级计算机几乎不产生共同价值,除非它们之间的系统被设计为一条路径。
在所提供证据中,没有中立的最新度量能将 ESnet 排为世界上最快的网络,而且这也不是最有用的检验标准。更强的检验标准是一个仪器是否能够以所需的速率到达远程存储或计算,在路径的一部分失效时恢复,并产生表明责任在哪里的证据。随着美国科学云工作、实时流传输以及最终的 ESnet7 项目从演示和计划转向得到支持的科学服务,ESnet 的地位将通过这些生产成果得到证实或削弱。(ESnet 历史;ESnet6 启动;2024 年年报)
来源
- ESnet 治理与政策
- ESnet 历史
- ESnet 2024 年年报
- ESnet 2024 数字一览
- 2024 年运营创新
- 2024 年应用研究活动
- 跨大西洋频谱里程碑
- 可用性里程碑
- ESnet 领导层
- ESnet 站点协调员委员会
- 网络服务菜单
- 对等连接与路由策略
- 设施数据管理政策
- 能源部 ASCR 2027 财年预算请求
- 伯克利实验室 ESnet6 启动
- ESnet4 架构与科学数据网络
- ESnet5 大陆 100G 启动
- Science DMZ
- OSCARS
- SENSE
- EJFAT
- 网络性能工具
- 科学需求评审
- 无线边缘地热部署
- 量子网络研究
- FRIB 直接数据流结果
- 鲁宾天文台案例研究
- DUNE 案例研究
- Confab26 议程
Strategic Circle:指标、触发因素与情景
ESnet 的下一阶段应通过经营证据来评判。第一个指标是正式的 ESnet7 基准。一个获得资助的项目计划、明确的架构、采购时间表和迁移方法将使该项目从创新工作转向一个可问责的网络代际项目。在这些要素出现之前,ESnet6 仍是生产系统,“ESnet7”只是一个规划标签。
第二个指标是网络如何吸收下一个科学需求周期。高亮度 LHC 运行、鲁宾调试、DUNE 开发、ITER 数据生产以及人工智能工作负载的增长,对流量形态的改变可能与其对流量量的改变一样大。有用的证据将包括站点链路升级、持续生产速率、突发测试、错过的截止日期以及需要实时而非推迟传输的工作流数量。
国际弹性应与聚合带宽分开追踪。达到计划的 3.2 Tbps 跨越四个真正物理多样的跨大西洋路径将是一个实质性的里程碑。一次重大电缆故障将提供更严峻的考验:有多少流量能够恢复,以多快的速度,以及当多个系统同时不可用时,哪些科学工作流获得优先处理。
研究软件向得到支持的服务过渡是另一个触发因素。如果 ESnet 发布被多个仪器使用的生产支持模型、集成要求和服务水平责任,EJFAT 将跨越一个重要的边界。当多域编排在选定演示之外成为常规时,SENSE 的状态将发生改变。High-Touch 应通过它所改善的运营决策和治理最终数据的控制措施来评估,而不仅仅依靠遥测量。
美国科学云工作需要同样的纪律。一次生产启动应定义合格用户、连接的计算和存储、身份和授权、服务支持、数据责任以及商业云的角色。演示展示了技术方向。它们尚未回答当一个工作流跨越能源部设施、ESnet 和一个商业提供商时,谁是其责任人。
资金是一个实际触发因素。最终的 2027 财年拨款应与高性能网络设施与测试环境项申请的 1.03 亿美元进行比较,同时记住该行比 ESnet 更宽泛。持续的拨款减少不一定立即中断当前流量,但可能延迟光学、站点弹性、软件维护、国际频谱和 ESnet7。大幅增加可以加速项目,同时也提高同时追求过多研究前沿的风险。
运营团队应关注 400G 站点连接的数量、800G 或更高速分组服务的引入、员工队伍增长以及关键光平台和路由平台的服役年限。他们还应关注 2024 年记录的异常 4% 增长之后的流量。回归高增长将印证积极的容量规划;持续的较低增长将加强选择性升级、缓存和工作流优化而非均匀扩张的理由。
几种情景随之而来。在工作流整合情景中,ESnet 成为美国科学云的连接和编排层,实时仪器流和共享计算成为正常的设施设计。在容量受限情景中,国际科学增长快于海底多样性,从而迫使优先级决策。在站点瓶颈情景中,国家骨干网成功扩展,而本地存储、防火墙和园区链路仍是限制因素。在资金受限情景中,ESnet6 寿命更长,软件、相干光学升级和缓存承担更多责任。无线和量子工作可能产生可重用的控制系统,而不在下一代成为主流生产服务。
对实验室负责人而言,专业启示很简单:ESnet 升级不能替代本地工程。站点弹性、Science DMZ 设计、数据传- 继续 -输入节点、存储和测量应作为同一科学能力的一部分得到资助。对项目经理而言,相关问题是一个计划的仪器是否拥有可执行的端到端工作流,而不是一张国家骨干网幻灯片是否显示了足够的容量。
Leadership Alliance:控制、激励与不可逆决策
ESnet 的控制结构分布在拥有不同激励措施的机构之间。能源部和 ASCR 定义任务并分配联邦资金。伯克利实验室的科学网络部门设计和运营该设施。加州大学提供实验室运营框架。ESnet 领导层在运营、安全、软件、研究和科学联络之间分配工程注意力。站点协调员控制影响自身连接的变更。科学项目阐述未来需求,而合作伙伴网络、电缆提供商、云公司和设备供应商控制端到端系统的部分要素。
该结构防止任何一方单方面指挥整个科学路径,但也可能使故障责任变得模糊不清。一个中央项目可以资助骨干网,而不修复本地设施。一个实验室可以要求容量,而不准备存储。一个云提供商可以提供专用互联,而同时保留对区域可用性和定价的控制。因此,有效的领导取决于使边界明晰,并在每次交接时要求证据。
第一个决策是网络应该在工作流中获得多少权力。更多的编排可以有效地分配容量、存储和计算。它也可能集中凭据并创造一个庞大的自动化影响范围。一种审慎的设计将策略所有权保留给承担后果的机构,通过经认证的接口暴露狭窄能力,并要求在高影响变更之前进行独立验证。
第二个决策是在何处不可逆地投入资本。光纤和频谱权、登陆安排、光平台和站点建设可以塑造网络十五年甚至更长时间。等待保留了灵活性,但在实验开始时可能无法获得容量。早期承诺确保了控制权,但如果科学时间表或技术改变,可能形成搁浅投资。需求评审之所以有价值,是因为它们将这些承诺与命名的工作流联系起来,而不是将增长视为一条通用曲线。
第三个决策涉及数据。无限期的流量保留和高保真遥测可以改善事件响应、容量规划和安全性。它们也创建了科学关系和端点行为的持久记录。领导层应区分对连续性至关重要的数据与因存储可用而保留的数据,记录访问和使用,并随着遥测变得更加详细,审查无限期保留是否仍然相称。
第四个决策是公共基础设施与商业服务之间的边界。云连接可以给研究人员提供通向强大资源的专用路径,但云账户、安全配置、出站定价和服务可用性仍然是外部依赖项。ESnet 应使这些依赖关系变得清晰可读,而不是允许专用路径被误认为对完整服务的公共控制。
二阶效应很重要。如果实时流传输成为标准,设施可能减少本地计算建设,并变得更依赖广域网络和国家调度器。这可能提高利用率,同时将骨干网事故变成实验事故。如果应用驱动的编排成为常态,科学软件可能开始假定容量可以动态预约,使得手动回退更加困难。如果缓存和共享存储扩展,数据放置政策就变成了一个基础设施治理问题。
三阶效应触及科学的组织方式。一条可靠的仪器到超级计算机路径使较小的设施能够使用它们无法在本地承担的能力。它可以更广泛地分配访问权,但也可能将必要的计算集中在少数几个国家中心。人工智能工作流可能增加对共享加速器的需求,并给网络决策更大影响力,以决定哪些实验获得及时分析。
最严重的不可逆风险不是一次失败的升级。而是设计一个科学生态系统,其组件不再能够足够独立地运行以实现恢复。ESnet 应在深化集成的同时,保持可观察的边界、本地回退、路由多样性、开放接口以及替换供应商或服务的能力。该设施的历史支持这种方法:其最强大的贡献并非将每个决策集中化。它们使共享基础设施变得可编程和可测量,同时让责任保持可见。
因此,领导层应通过三项成果评判 ESnet:科学项目是否获得可靠的端到端能力,而非名义带宽;长期投资是否保留了选项;以及自动化和遥测是否增加了证据,而不将不可审查的权力置于单一系统之中。这些测试将确定该设施是否在科学需求、技术和公共优先事项变化时仍可恢复且有用。
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
