摘要
- Evelyn Berezin 主导设计的 United Airlines 全国系统采用三台独立处理器、快速故障隔离,以及覆盖约六十座城市的通信枢纽。
- 这些设计保障的是可用性,并不会自动验证终端输入、销售与取消语义,或机位库存与实际运营是否一致。
- Berezin 本人明确区分了这套以机位和票务数据为主的早期系统与后来的完整订座系统;保留这条边界,反而更能说明其贡献。
航空公司职员在终端上查询“还有没有座位”时,系统实际上承担两个责任:机器要能回答,答案还要与运营现场相符。Evelyn Berezin 在 Teleregister 的工作,极有远见地解决了第一个问题。若仅凭系统从未完全停机,就宣称第二个问题也已解决,则会把工程韧性误写成数据真理。
Berezin 回忆,United 项目从 1958 年开始设计;计算机历史博物馆把交付时间放在约 1962 年。位于丹佛的中央系统需要全天运行,并通过全国通信网络服务各地柜台。故障容忍的时间单位不是维修所需的小时,而是几秒:检测异常、移出故障处理器,然后让其他机器继续接单。
三台机器构成的失效边界
系统使用三台独立处理器,并让它们访问共享内存和外围设备。美国专利 3,253,262 的发明人包括 Evelyn Berezin Wilenitz、Frank C. Marino 和 Donald W. Russell;专利描述了由任一空闲处理器接收下一笔事务、再用互锁机制保护共享资源的结构。
Berezin 把思路称为“软失效”。机器在预设节点比较内部运行结果,出现偏差的处理器可以自动离线,其余机器继续工作。她还说,系统初期一台处理器已能承担常规流量,另外两台既是计算资源,也是安全余量。因此,设备损失可能先表现为速度下降,而不是整套服务停止。
这也说明可用性并非一个简单的绿色指示灯。缓冲区耗尽时,系统可能返回忙碌信号,要求职员稍后重试。处理器还在运行,不等于每个请求都在规定时间内完成。
Berezin 曾表示,中央处理系统在十一年运行期间没有完全停机。这是一段值得重视的亲历回忆,却不是独立审计的服务等级报告。常被引用的“一秒响应”同样需要限定:它是设计要求或公开目标;她后来明确说,系统实际并未完全达到这个速度。
六十座城市与一条共同命运的线路
中央计算机之外,还有约六十个城市枢纽,每个枢纽再连接多个柜台终端。系统把输入和输出放在不同路径上,并设计了绕过故障枢纽的开关。Teleregister 设有独立通信设计部门;Berezin 回忆,当时电话技术速度不足,Philips 在 Eindhoven 的人员参与设计通信设备。
然而,一次 Nevada 事故揭示了“图上冗余”的局限。按照 Berezin 的叙述,本应分离的东西向路径被铺设在同一条微波路由上,一次爆破便让美国约一半地区的终端失联,而丹佛中央计算机仍在工作。数据中心没有宕机,全国服务却已局部消失。两条线路若共享同一个物理故障点,就不是两种命运。
当年的“订座系统”究竟是什么
Teleregister 1956 年的产品手册记录了分阶段路径。UNISEL 在四个交通中心展示未来 33 天的航班余量;一旦低于预设“缓冲值”,职员仍须打电话确认。手册还描述了下一阶段设想:各地可用性设备成为中央 Reservisor 磁鼓存储的卫星,销售和取消直接更新精确座位数。
这份材料证明了产品方向,却不能证明所有规划功能后来都原样进入 United 系统。Berezin 自己给出了更谨慎的界限:她为了方便把项目称为旅客订座系统,但它主要保存每个航班和座位的票务数据;后来的系统为每个座位保存更多信息,也承担更多业务。
因此,SABRE 只能作为代际参照,不能用来倒推 Teleregister 的能力。计算机历史博物馆将 SABRE 归于 American Airlines 与 IBM 的联合项目,并称其于 1964 年投入运行,同时也指出它不是第一套计算机订座系统。后来的交易范围和旅客记录能力属于另一支团队、另一代系统;Teleregister 的先行价值也不应被后来者的影响力抹去。
可用性不是库存真实性
三处理器、共享资源互锁、过载退化和通信绕行回答的是:特定硬件或链路失效后,系统怎样继续提供处理。库存真实性则要求另一组控制:销售和取消是否只执行一次,两名职员能否同时拿走最后一个座位,重试会不会制造重复事务,航班变动是否及时进入记录,以及数据库能否与实际运营对账。
现有资料没有证明所有这些性质。正确运行的处理器可以忠实保存错误输入;三台机器可以一致同意一份过时数据;幸存链路也可以再次送达同一请求。即便中央系统十一年从未完全停机,也不能推出库存十一年从无偏差。
划清边界不是削弱 Berezin。她领导的部门把熟悉继电器的设计人员带入电子计算,和独立通信团队协作,在全国联机系统仍需从零发明时把它交付出来。核心处理专利同时署名 Marino 与 Russell;Teleregister 工程师、Philips 通信设计者、United 运营人员和基础设施提供者也共同构成了这套服务。
真正的成就是把处理器、共享资源、枢纽和传输路径拆成可隔离的失效域,使一个故障不必演变成全国停摆。今天的系统依然需要这种纪律,也需要更进一步的诚实:说明持续在线究竟保证了什么,又没有保证什么。
来源
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
