OpenAI用2名工程师把核心存储从Python迁到Rust,AI改写技术债偿还逻辑
OpenAI核心在线存储平台Habitat从Python重写为Rust,仅2名工程师借助Codex与GPT-5.5完成,CPU效率达6倍、内存效率达15倍,验证大模型可显著压缩关键系统重构成本。
一场提前下注的技术债实验
在业务规模连续三年保持每年十倍以上增速的背景下,OpenAI 对核心在线存储平台 Habitat 做出了一次反常规选择:明知 Python 难以支撑未来体量,仍先以 Python 构建服务,并主动接受由此产生的技术债。支撑这一决策的判断是,等到系统不得不重写时,编程模型的能力可能已足以大幅压低迁移成本。
一年之后,这一判断得到验证。今年第二季度,仅 2 名工程师借助 Codex 与 GPT-5.5,将整个 Habitat 服务从 Python 重写为 Rust。当前 Rust 版本已承接 95% 的生产请求,Python 版本计划在未来几周内彻底下线。新系统 CPU 效率达到原版的 6 倍,内存效率达到 15 倍,平均延迟与尾延迟同步下降。
Habitat 是 OpenAI 几乎所有产品背后的在线存储平台,每秒处理超过 7000 万次请求,服务每周超过 10 亿用户,覆盖接近 40 个地理区域,承载超过 500PB 数据。用户登录 ChatGPT、读取 Codex 设置或创建新对话,背后都依赖大量数据查询,底层存储一旦变慢,产品体验会立刻受损。
从客户端库到统一咽喉的演进
Habitat 最早于 2023 年 DevDay 大会上发布,最初只是一个与 ChatGPT 主服务器交互的小型 Python 库,底层部分操作映射到 Azure Cosmos DB。它的目标很明确:让产品工程师无需掌握整套数据库运维知识,schema 查询、数据路由、权限验证、加密、序列化、请求整形与连接池等工作全部由 Habitat 处理。
随着内部产品增多、逻辑日益复杂,把所有能力塞进客户端库变得难以维护。一次协议或路由逻辑变更,往往需要协调几十个服务分别升级客户端。OpenAI 团队曾尝试将部分数据迁移到多区域分布的 Azure Cosmos DB 账户,仅修改路由逻辑、功能开关、影子流量验证和 Bug 修复就耗费数天,最终还因其他团队回滚服务时连带回退客户端版本,触发了原本极力避免的故障。
这促使 Habitat 从嵌入数十个服务的 Python 客户端库,抽离为独立服务。集中化之后,路由、部署、监控和基础设施升级可在中央完成,访问控制策略、审计日志以及对 Azure Cosmos DB 等底层资源的权限也得以统一执行,同时承担保护用户数据、防范外部人员、内部人员及 Agent 的职责。
Python 的性能极限与运维博弈
把本地库变成承载海量流量的网络服务后,Python 的成本被迅速放大。OpenAI 从一开始就清楚,高吞吐服务会带来更高网络延迟和 CPU、内存扩展成本,并判断若 Habitat 继续增长 100 倍,效率问题将无法接受,重写几乎不可避免。但当时更紧迫的任务是解除产品团队阻塞、稳定平台并确定核心 API 与基础设施形态,因此团队选择先以熟悉的技术栈高速迭代。
在等待 Codex 成熟的一年里,OpenAI 几乎把 Python 架构的性能榨到极限。Habitat 的真正难点之一是尾延迟:一次普通用户请求可能触发数百次数据库访问,只要其中一次异常缓慢,用户感知到的就是最慢的那一次。Python 的 asyncio 能并发大量 I/O,却无法绕过全局解释器锁获得真正 CPU 并行,而 Habitat 还要处理路由、压缩、加密、校验、下游健康检查、请求影子流量和对冲请求等 CPU 任务。
团队发现,高负载下拖慢请求的有时并非数据库。Azure Cosmos DB 可能早已返回结果,负责该请求的 Python 协程却因 CPU 繁忙未被事件循环及时调度,只能在队列中等待。为此,OpenAI 增加了一套 asyncio 事件循环监控,周期性调度后台任务并比较其应执行时间与实际执行时间。结果显示,高 CPU 负载下调度抖动可达数百毫秒,极端情况下甚至达到数秒。
- 严格限制每个 Python 进程的并发请求数,并大量横向扩展 worker;
- 减少下发给 Habitat 的配置规模,延长 Statsig 刷新间隔并加入随机抖动;
- 应对连接池导致的流量分配不均,避免少数尾部进程承受平均 5 至 10 倍的并发请求。
其中一次突发流量事故暴露出亚稳态故障:某个客户端制造大量负载,关闭后部分进程不仅未恢复,反而持续恶化并获取更多请求,直到被手动重启。这些经历让团队更清楚,Python 架构的运维复杂度已接近边界。
AI 重写基础设施的成本拐点
Habitat 的迁移案例表明,大模型正在改变一个传统工程问题:技术债何时偿还。过去,语言迁移往往意味着庞大的人力投入与漫长周期,而 Codex 与 GPT-5.5 的介入,使极小规模团队也能完成超大规模基础设施重构。对于 SRE、基础设施工程师、平台架构师与 AI 工程化负责人而言,这一信号值得关注:技术选型的时间窗口正在被模型能力重新定价,延迟偿还技术债可能从冒险变为一种可计算的策略。