2026-09-10 12:42 1001 次浏览

CUDA 13.4 首度原生适配 Windows on Arm64,为 RTX Spark 提前搭桥

英伟达发布 CUDA Toolkit 13.4,首次为 Windows on Arm64 提供原生开发包,并预览支持 Rubin 架构。该更新被视为给 10 月上市的 RTX Spark PC 铺路,开发者可在新硬件到来前完成应用移植与验证。

Arm 版 Windows 迎来原生 CUDA 开发能力

英伟达于 9 月 9 日推出 CUDA Toolkit 13.4,首次将 Arm 平台支持从 Linux 延伸至 Windows on Arm64。这意味着开发者可以直接在 Windows Arm64 环境中编译 CUDA 程序,同时保留通过 Windows x86-64 工具包进行交叉编译的路径。

CUDA Toolkit 是英伟达 GPU 编程的核心工具集,涵盖编译器、库与配套工具,用于编写在 NVIDIA GPU 上加速执行的应用程序。此前 Windows on Arm 设备若想参与 CUDA 开发,往往需要依赖 Linux 环境或跨平台方案,原生支持的缺失长期制约了该生态的软件丰富度。

Rubin 架构预览支持与组件级更新

CUDA Toolkit 13.4 以预览形式为 NVIDIA Rubin 架构(计算能力 107)提供功能性支持。计算能力 107 对应版本号 10.7,是 CUDA 用于识别 GPU 架构特性并生成适配机器代码的编号体系。预览版允许开发者与关键软件库维护者在正式版发布前提前移植、开发与验证应用。

本次更新覆盖 CUDA 编译器、PTX ISA、CUDA C++、CUDA Tile 编程、运行时 API、软件库和开发者工具,具体变化包括:

  • CUDA Python 中,cuda.core 升级至 1.1.0,新增纹理与表面编程、NUMA 感知托管内存及 .pyi 类型存根;cuda.compute 1.1 支持为多个 GPU 架构预先编译 CCCL 算法。
  • Multi-Process Service V3 增加脚本化命令行界面、命名服务器实例、TOML 配置,以及与 cgroup 集成的 GPU 显存限制,面向容器化环境提供更精细的 GPU 分区能力。
  • CUDA Compute Fabric Transport 面向通信库开发者,通过命名逻辑端点和异步操作,在 NVLink 互连架构中传输数据。

为 RTX Spark 上市铺路的战略意图

业界普遍将此次更新视为英伟达为 10 月即将上市的 RTX Spark PC 提前布局。RTX Spark 是英伟达首款消费级 PC 处理器,集成 20 核 Grace CPU 与 6,144 个 CUDA 核心的 Blackwell GPU,FP4 精度 AI 算力达 1 PFLOPS,可在本地运行 1,200 亿参数大模型,搭载该芯片的笔记本预计下个月上市。

对普通用户而言,这次工具包更新不会直接提升现有设备性能,但其价值在于为 Windows on Arm 平台上的 CUDA 应用兼容性铺路。如果开发者能在 RTX Spark 上市前完成移植和验证,使用该平台的用户届时可能获得更完善的 GPU 加速软件支持。

行业影响:Arm PC 生态的 GPU 计算拼图

从更宏观的视角看,CUDA 对 Windows on Arm 的原生支持补上了 Arm PC 生态中 GPU 通用计算的关键一环。过去几年,Windows on Arm 在 CPU 性能与续航上逐步缩小与 x86 的差距,但 GPU 加速软件栈的成熟度始终是短板。英伟达将 CUDA 开发能力下放到该平台,有望吸引更多 AI 推理、科学计算与创意生产工具向 Arm 笔记本迁移。随着 RTX Spark 上市临近,软件生态的提前就位可能成为其市场表现的重要变量。