輝達把 GPU 運算核心正式向 Rust 開啟大門,SIMT 與 Tile 兩條路線並行;同一週,輝達拿下 Rust 基金會白金會員席位,開放語言的背後,其實是把 CUDA 的護城河挖得更深。
(前情提要:AMD 顯示卡能跑 CUDA!開源安裝包上線,目前僅能驗證一張卡)
(背景補充:DeepSeek 核心工程師預言:AI半年內將遠超人類,我將被慘淡取代轉業)
輝達(NVIDIA)在 8 日的官方技術部落格宣布一件事:GPU 上最核心的那段程式,終於可以直接用 Rust 撰寫。CUDA 生態原本就有成熟的 C++ 與 Python 工具鏈,唯獨真正跑在顯示卡上的核心程式(kernel。簡單來說,就是實際在 GPU 上執行運算的那一小段程式)是例外,開發者能用 Rust 呼叫它,卻不能用 Rust 寫它。
CUDA Rust 補上的,正是這最後一塊拼圖。
隔天(9 月 9 日),Rust 基金會執行長 Rebecca Rumbul 在蒙特婁 RustConf 2026 的開幕致詞中宣布輝達與 Solana 基金會同時成為基金會白金會員,年費 32.5 萬美元,並各取得一席董事席位。兩則訊息說的其實是同一件事:輝達要把自己嵌進 Rust 的核心決策圈,而不只是當一個用戶。
為什麼 CUDA 需要 Rust?
AI 系統層,推理引擎、部署基礎設施、驅動程式、代理人執行環境,正快速改用 Rust 撰寫,原因很直接:Rust 能在編譯期檢查(也就是程式還沒真正跑起來、僅在編譯階段,編譯器就先幫你抓出記憶體使用上的錯誤)攔下一整類臭蟲,同時不犧牲效能。
輝達自己的 Linux 驅動程式 Nova 以 Rust 撰寫,推理框架 NVIDIA Dynamo 的核心也建立在 Rust 之上。但 GPU 核心程式始終是最後一塊沒被攻下的地盤:開發者可以從 Rust 呼叫它,卻只能用 CUDA C++ 或其他語言把它寫出來。
CUDA Rust 要補的,就是這道缺口。這種系統層與運算核心之間的語言落差,本身就是一種隱性技術債:上層用 Rust 寫得再嚴謹,呼叫一旦穿過那道邊界、進到核心程式,原本的保證就斷在那裡,問題往往要等到生產環境才會現形。
兩條路線,同一張安全網
輝達這次開出兩條路線,對應 CUDA 原本就有的兩套程式設計模型。第一條是 cuda-oxide,對應 SIMT(單指令多執行緒。簡單來說,就是開發者只需要寫「一個執行緒該做什麼」,GPU 就自動派出成千上萬個執行緒各自照做),這是 CUDA C++ 開發者最熟悉的寫法,cuda-oxide 把整套流程搬進 Rust 編譯器,一路編譯到 PTX(GPU 看得懂的底層組合語言)。
第二條是 cutile-rs,對應 Tile(圖塊。簡單來說,是一種更新的程式設計模型,開發者只需要描述「一整塊資料該做什麼」,編譯器自己決定怎麼拆給硬體去跑)。輝達在部落格中建議,開發者應優先選擇 Tile,因為架構差異的判斷都交給編譯器;只有真的需要手動管理執行緒與共享記憶體時,才該回頭選 SIMT。
兩條路線賭的是同一件事:用 Rust 的所有權規則,在編譯期就攔下競態條件(也就是多個執行緒同時搶著讀寫同一塊記憶體,順序一亂、資料就跟著錯亂的臭蟲)。輝達在部落格中示範,同一塊輸出緩衝區若被同時當輸入又當輸出丟進去,cuda-oxide 會直接編譯失敗;cutile-rs 的判斷更嚴格,所有權會一路跟著資料穿過整個核心呼叫邊界,而不只是檢查呼叫當下那一刻。
這類臭蟲過去往往要等到程式上線、流量夠大才偶爾發作,如今在寫程式的當下就先被攔下來。
距離終點,還早
不過輝達自己也坦承,這兩個專案都還沒到能放進正式環境的程度。cuda-oxide 目前仍屬早期 alpha,必須搭配版本釘死的 nightly 工具鏈(也就是 Rust 官方每天更新、尚未正式穩定發布的實驗版編譯器,功能較新但相容性沒有保證)才能編譯,共享記憶體目前仍得靠 unsafe(不安全語法,也就是暫時關掉編譯器的保護機制,把正確性責任交還給開發者自己)才能操作。
cutile-rs 進度快一些,已經能跑在標準版 Rust 上、不需要 nightly 工具鏈,也已經被 Hugging Face 的推理引擎 Grout、以及 mistral.rs 專案實際採用;但輝達也直言,API 介面仍會持續變動,涵蓋範圍也還不完整。換句話說,兩條路線目前都還停在「能動,但別急著下注」的階段。
把兩則新聞疊在一起看,輝達的算盤並不難懂。CUDA 是輝達最深的護城河,這幾年 AMD 力推 ROCm、Google 力推自家 TPU 與軟體棧,不少雲端業者也在自研晶片,盤算的都是同一件事:只要能繞過 CUDA,輝達的定價權與話語權就會跟著鬆動。
外界原本擔心,CUDA 一旦被迫向其他生態系開放,輝達的鎖定優勢就會被稀釋;但這次輝達的做法恰好相反,它沒有把 CUDA 留在原地坐等對手包抄,而是主動把使用門檻降到系統工程師最熟悉的語言上,把 Rust 開發者一起接進 CUDA 的圍牆裡,語言換了,入場券還是輝達發的,原本想找理由出走的人,反而更沒有理由現在就走。
📍相關報導📍
OpenAI 稱自研晶片實測贏過 Nvidia GB300,真的這麼強?

