前幾天說到 NVIDIA 推出採用 ARM 處理器跑 Windows on Arm 的 RTX Spark,順便整理了處理器基本常識,稱霸 PC、筆電、Windows 多年的 x86,與靠省電在行動裝置一統江湖的 ARM,以程式的角度二者壁壘分明,由於指令集完全不同,軟體需重新編譯甚至改寫才能跨進對方陣營;再不然就是靠著模擬器,忍受打折的效能運行。這也導致微軟過去幾次推動 Windows on Arm 的嘗試,終究都敗在軟體相容性的致命傷。過去愈成功、發展愈蓬勃,愈是會成為改革創新的障礙,這大概就是 Windows 想從 x86 邁向 ARM 之路難以擺脫的魔咒。

我對這塊格外好奇,但苦於背景知識不足不知從何深入。前兩天滑到一部 YT 影片做了蠻深入的剖析,解答了一些疑惑,就簡單整理心得順手分享。

歷史上的嘗試

Windows 的 Arm 之路,微軟過去已經嘗試過三次:

  • 2012 推出 Windows RT,當時 Surface RT 用的就是 NVIDIA 的 Tegra 芯片,但戰略失策,完全沒打算支援 x86 程式,現成 Windows 程式不能用,為 RT 開發的 App 又屈指可數,淪為一塊昂貴又沒程式可用的平板
  • 2019 的 Surface Pro X 改用高通 SQ1、SQ2 芯片,Windows 內建了 WOW64 模擬器,能讓 ARM 假裝成 x86 跑 Windows 程式。但純軟體模擬加上當年的 CPU 硬體效能不能與今天相提並論,用模擬器跑 x86 程式的效能很難讓人滿意。要命的是,一些涉及作業系統核心的底層程式,像防毒軟體、驅動程式,幾乎都無法用模擬器跑,x86 程式的相容問題並未徹底解決。
  • 2024,靠著高通驍龍 X Elite 在續航與多核效能上,終於有較像樣的表現,幾乎可以對標 Apple 的中底端 M 系列。微軟在 Windows 11 24H2 引入新模擬器 Prism,Chrome、Photoshop 等旗艦軟體也出了原生 ARM 版本。但高通的AI 用的是自家的 QNN 和 QDA,不是業界主流的 CUDA,另一大硬傷則在 GPU,X Elite 處理器的 Adreno 內顯,扛不住 3D 創作、3A 遊戲的強大顯示運算需求,最終沒能在市場佔有一席之地。

RTX Spark 有何不同?

這次 NVIDIA 推出的 N1x 晶片,是把一顆 ARM CPU 跟一顆 Blackwell GPU 用 NVLink-CC (傳輸頻寬 600 GB/s)串起來,再配上最高 128GB 的 LPDDR5X 統一記憶體,使用台積電 3 奈米製程。

Grace CPU 有 20 核心 (10 顆 ARM Cortex-X925 核心與 10 顆 ARM Cortex-A725 核心),Blackwell 則有 6144 個 CUDA,相當於桌機版 RTX 5090,提供 1 PFLOP 的 FP4 AI 運算效能 (每秒 1000 萬億次浮點運算)。

這個架構下,運行 CPU + GPU 只需要 45 到 80 瓦 (桌機版 RTX 5070 光顯卡就要 200 瓦),而 128GB 統一記憶體是 CPU、GPU 共用是一大賣點。傳統要跑大一點的地端模型,VRAM (顯示記憶體 )往往是最大瓶頸,最頂級的 RTX 5090 也不過 32GB。120B 參數的開源大模型,就算量化到 4bit 也要 70GB,RTX 5090 吞不下,但 128GB 統一記憶體可以,讓你能在本機跑 120B 大模型,還能一口氣處理 1M Token 上下文。

但光談硬體沒用,過去 Windows on Arm 都是敗在軟體,關鍵未解,仍難逃悲劇收場。但 NVIDIA 這回靠著主場優勢,還真能扭轉幾分情勢:

  • 直接支援當今業界 AI 標準 - CUDA
    當前 AI 模型訓練、推理生態系幾乎都是基於 CUDA,用蘋果 M4 配 128GB 統一記憶體也可以跑 120B 大模型,但需要轉換、轉譯,面臨類似 x86 轉換 ARM 的阻礙。所有模型都一定有 CUDA 版本,可不經轉換直接在 Windows on Arm 上跑,是贏過 Mac 的一大優勢。
  • 江湖盟主的號召力
    過往 ARM 筆電常死在遊戲的反作弊引擎,在被關進 Prism 模擬器沙箱後,反作弊程式摸不到系統底層就死了,連帶讓遊戲開不起來。NVIDIA 靠著自己在遊戲圈混了 20 年的影響力,硬是讓 Denuvo、Easy Anti-Cheat 三大主流反作弊和版權保護引擎在 RTX 平台發布當天就宣告原生支援 Arm64。而另一個大絕是 DLSS,用 AI 計算畫面,填補 GPU 運算不及之處,讓 Blackwell GPU 能順跑 3A 大作,跑出 1440p 分辨率、100 幀的效能,提高遊戲玩家對 Windows on Arm 的接受度。

難以憾動的商務市場

模擬器可將 x86 指令即時翻成 Arm64,跑瀏覽器、文書作業沒問題,但遇上 AVX 這類高階向量指令,麻煩就來了。影像渲染、物理模擬、科學計算重度依賴這些複雜指令集,而在模擬器這類指令只有原生速度的三分之二、三分之一。高度依賴向量運算的專業工作站,在軟體原生支援之前,改換 ARM 絕對不划算。

而更致命的是企業 IT 那堆底層工具:CrowdStrike、安全防護等端點安全代理、企業 VPN、驅動程式、老舊設備管理軟體,全部都跟作業系統底層綁得緊緊的。遊戲廠商會給 NVIDIA 面子專門改版,企業安全廠商呢?很難。

蘋果 2020 年展示過傑出的一手:靠 M1 芯片加 Rosetta 轉換,把整個生態從轉移到 ARM 上,但蘋果能成功靠的是微軟和 NVIDIA 永遠不具備的東西 - 獨裁。從硬體到系統一手包辦,軟件生態誰敢不從跟就斷誰活路,強令所有人跟上。而 Windows 世界有幾十家互相競爭的電腦廠商、一堆守著老軟體的供應商、無數獨立軟件開發者,開放生態高度碎片化,無緣仿效蘋果的做法。因此直以來只能花錢,利用技術說服、資金補貼,懇求開發者一個個把軟體移植過來。如此注定了這場轉型一定更慢、更亂、風險更高。本質上的差異,讓這一塊只能等待時間醞釀...

未來的劇情走向

RTX Spark 終究還是能吸引特定玩家:想在筆電用 CUDA 跑 120B 大模型的 AI 研究者與資料科學家、原本要買 RTX 5070 捏一下換台能多跑 AI 的遊戲玩家... 人數有限,後續真能帶來革命性改變?

  • 快樂結局 Happy Endding
    36 個月內,1000 美元筆電市場 Windows on Arm 市佔突破 30%,成為內容創作、AI 工程的首選,x86 被擠回低階入門機。
  • 悲劇收尾
    原生 ARM 軟體遲未普及,x86 程式用模擬器跑就是慢三成,企業安全軟體還是與 ARM 絕緣,N1x 只是少數 AI 研究者的昂貴玩具。

劇情會怎麼發展,影片作者給了三個觀察點:

  1. 除了 Adobe 這些先鋒部隊,主流軟體有多少家願意提供原生 Arm64 版本?
  2. 500 大企業的 IT 部門有沒有開始接受 ARM 作為員工設備?這取決定 VPN、端點安全等廠商是否轉向。
  3. HP、Dell、Asus、聯想的 N1x 產量是否一路撐到 2027 下半年?還是悄悄把高階機型又換回 X86?

一切就留待時間驗證了。


Comments

# by yoyo

DLSS應該是用深度學習加強GPU渲染畫面的效果,而不是CPU運算

# by Jeffrey

to yoyo,YES,應該為 GPU 才對,謝謝指正。

Post a comment