開發者 Speedstu 9 月 13 日在 GitHub 公開 CUDA-for-AMD-Windows,用 ZLUDA 與 AMD HIP SDK 讓 CUDA 程式跑在 AMD 顯示卡上,目前只在 RX 9060 XT 驗證過。
(前情提要:AMD 讓OpenAI「入股一成」股價暴漲24%,全面宣戰Nvidia Cuda?)
(背景補充:四大巨頭自研 AI 晶片全進入量產,會動搖 NVIDIA 地位嗎?)
重點摘要
- 開源專案用 ZLUDA 讓 AMD 顯卡跑 CUDA 程式
- 只在 RX 9060 XT 驗證過,cuDNN 仍不能用
- 官方路徑每秒 13,278 步,自改版慢 3.03%
開發者 Speedstu 9 月 13 日在 GitHub 公開專案 CUDA-for-AMD-Windows。它把 ZLUDA 與 AMD 的 Windows 版 HIP SDK 包成一套 PowerShell 安裝腳本。目標是讓原本寫給 NVIDIA 顯示卡的 CUDA 程式,在 AMD Radeon 顯示卡上執行。
這個專案本身不是新的轉譯技術,真正負責轉換的是開源專案 ZLUDA,它的官方說明是讓未經修改的 CUDA 程式在非 NVIDIA 顯示卡上執行。程式對 CUDA 的呼叫會被 ZLUDA 接手,再交給 AMD 的 HIP 執行環境處理。Speedstu 做的是把版本鎖定、下載、雜湊驗證、環境設定與診斷工具串成一套可以重複執行的流程。
驗證環境只有 RX 9060 XT
專案的驗證文件列出的組合是 ZLUDA v6-preview.69、AMD HIP SDK 6.4 與 LibTorch 2.3.0+cu118。顯示卡是 AMD Radeon RX 9060 XT,架構代號 gfx1200。這是 AMD 2025 年 6 月推出的中階卡。README 在開頭註明,目前驗證過的硬體只有這一張,其他 AMD 顯示卡都只算候選裝置,不保證能用。
在這個環境下,ZLUDA 內建的 cuda_check 檢查工具回報五組元件正常。這五組是 nvcuda(CUDA 驅動介面)、cuBLAS、cuBLASLt、cuSPARSE 與 cuFFT。cuBLAS 轉給 AMD 的 rocBLAS,cuBLASLt 轉給 hipBLASLt。cuSPARSE 則轉給 rocSPARSE。這些函式庫負責矩陣乘法、稀疏矩陣與傅立葉轉換等數學運算,許多 AI 與科學運算程式都會用到。
作者接著拿原本的訓練程式實測。這是一個有 2,216,347 個參數的 PPO 強化學習模型,PPO 是常見的強化學習訓練演算法。模型在 AMD 顯示卡上完成推論、學習更新與優化器運算,跑完一輪 65,536 個時間步。README 說明,這正是當初促使作者做這個專案的訓練工作。作者另一個公開專案,是用 LibTorch 與 PPO 訓練 Rocket League 遊戲 AI 的程式。
支援更多顯示卡的工作已經有人開始做。9 月 14 日,另一位開發者 l33tm4st3r 提交合併請求,加入 gfx1201 架構。他的實測卡是 AMD Radeon AI PRO R9700,目前尚未合併。gfx1201 也是 RX 9070 系列使用的架構。依 AMD 官方的 Windows 硬體支援表,RX 9070 系列與 RX 7000 系列同樣支援 HIP SDK。這些卡能不能跑這套流程,要等使用者實測回報。
效能數字要分開看
9 月 13 日的對照測試用同一個訓練設定,比較官方 ZLUDA 路徑與作者早期自己改過的元件。兩種各跑 2 組、每組 5 輪,扣掉每組第一輪暖機後各留 8 輪。官方路徑的整體速度中位數是每秒 13,278 步,自改版是 12,876 步,慢了 3.03%。因此專案預設使用官方版本。
那組自改元件的原始碼已經找不到。專案文件說明,作者只從舊的開發環境救回編譯好的 DLL 檔,其中 cuBLASLt 轉接層的原始碼與除錯檔都遺失。這些檔案因此只保留雜湊值,沒有公開。
README 另外列出每秒 7 萬到 10.9 萬步的舊紀錄。文件註明那是另一套大幅調校過的設定,不能和上面的數字直接比較。文件也提到,作者後來把訓練程式改寫成直接呼叫 AMD HIP,拿掉了 LibTorch 與 ZLUDA,速度明顯更快。作者自己的訓練程式,現在已經不經過 ZLUDA。
能跑的範圍與授權都有限制
README 的限制清單指出,ZLUDA 不是完整的 CUDA 實作。Windows 版 HIP SDK 也只提供 ROCm 的一部分。穩定版 HIP SDK 沒有 MIOpen,所以需要 cuDNN 的程式可能無法執行。cuDNN 是 NVIDIA 的深度學習加速函式庫,大量使用卷積運算的影像模型多半會用到。NCCL(多卡通訊)、TensorRT(推論加速)與部分自訂 CUDA 擴充也可能失敗。
專案頁面上的「verify passing」綠色徽章,也不代表 CUDA 程式在 AMD 顯示卡上通過測試。這個 GitHub Actions 流程跑在 GitHub 的 Windows 雲端主機上。它檢查 PowerShell 語法與 JSON 設定檔格式,在沒有顯示卡的狀態下測試掃描工具,並核對下載的 ZLUDA 壓縮檔雜湊值。
使用的版本也不是最新。專案鎖定的 ZLUDA v6-preview.69 在 2026 年 5 月 4 日發布。ZLUDA 6 月 29 日推出正式版 v6,8 月 26 日已經出到 v7-preview.10。AMD 的 Windows 版 HIP SDK 最新版是 7.2.0,7 月 31 日發布,專案驗證用的是 6.4。README 表示較新版本可能可用,但在有人回報之前都視為未驗證。
授權方面,NVIDIA 的 CUDA 授權條款目前仍有一條轉譯限制。條款規定,不得為了把 CUDA 開發工具產出的程式轉到非 NVIDIA 平台,而對它反向工程、反編譯或反組譯。這份條款最近一次更新是 2026 年 1 月 26 日。專案的第三方聲明也提醒,NVIDIA 元件仍受 NVIDIA 授權約束。
ZLUDA 本身的資金也不穩定。它在 2022 年起曾由 AMD 資助,合約在 2024 年初結束。之後程式碼回滾到 AMD 參與之前的版本,改由一家未具名的公司資助。開發者 Andrzej Janik 在 更新文章中表示,ZLUDA 已經沒有商業資助,重新變成他週末做的個人專案。他說開發優先順序因此改成自己覺得有趣的項目,例如 PhysX 與 Blender 支援。
專案上線兩天,GitHub 上還沒有任何顯示卡相容性回報。RX 9060 XT 以外的型號能不能用,目前沒有公開的測試資料。
常見問題
AMD 顯示卡可以跑 CUDA 程式嗎
可以部分執行。開源專案在 RX 9060 XT 跑通五組 CUDA 元件與 221 萬參數模型訓練,但需要 cuDNN 的程式可能失敗。
CUDA-for-AMD-Windows 支援哪些顯示卡
目前只驗證 RX 9060 XT,其他 AMD 顯示卡列為候選。9 月 14 日有人提交 gfx1201 支援,尚未合併。
📍相關報導📍
OpenAI 稱自研晶片實測贏過 Nvidia GB300,真的這麼強?
Intel:我們將推出的 AI 晶片比 NVIDIA 與 AMD 更便宜、氣冷 Crescent Island 主攻推理

