跳至主要內容

NVIDIA 押注「Local AI」成為 2026 新趨勢!推出 NVIDIA PAIR 串連家中 GPU,RTX Spark「N1X」10 月正式登場

作者 安 drew3 分鐘閱讀
NVIDIA 押注「Local AI」成為 2026 新趨勢!推出 NVIDIA PAIR 串連家中 GPU,RTX Spark「N1X」10 月正式登場

NVIDIA 在 IFA 2026 前夕舉行最新消費者 AI 媒體報告,將今年形容為「Local AI 之年」,並一口氣公開多項圍繞本地 AI、AI Agent 與新一代 PC 平台的最新進展。 除了 Hermes、OpenClaw 與 Perplexity 等熱門 AI Agent 將陸續導入 NVIDIA GPU 一鍵 Local AI 設定外,NVIDIA 更正式公開全新的 NVIDIA PAIR,讓家中不同 PC 可以透過區域網路共同分擔 AI 推論工作。而今年 COMPUTEX 首度亮相的 RTX Spark 平台,也正式確認產品名稱為 N1X,預計於 2026 年 10 月上市,提供最高 128GB Unified Memory,並將進入筆電與小型桌機市場。 NVIDIA 認為,隨著本地端模型品質快速追上雲端服務,加上使用者希望降低 Token 成本、保護私人資料,甚至進行近乎無限制的 AI 實驗,Local AI 已經從少數玩家的興趣,逐漸變成日常工作的一部分。

NVIDIA 在 IFA 2026 前夕舉行最新消費者 AI 媒體報告,將今年形容為「Local AI 之年」,並一口氣公開多項圍繞本地 AI、AI Agent 與新一代 PC 平台的最新進展。

除了 Hermes、OpenClaw 與 Perplexity 等熱門 AI Agent 將陸續導入 NVIDIA GPU 一鍵 Local AI 設定外,NVIDIA 更正式公開全新的 NVIDIA PAIR,讓家中不同 PC 可以透過區域網路共同分擔 AI 推論工作。而今年 COMPUTEX 首度亮相的 RTX Spark 平台,也正式確認產品名稱為 N1X,預計於 2026 年 10 月上市,提供最高 128GB Unified Memory,並將進入筆電與小型桌機市場。

NVIDIA 認為,隨著本地端模型品質快速追上雲端服務,加上使用者希望降低 Token 成本、保護私人資料,甚至進行近乎無限制的 AI 實驗,Local AI 已經從少數玩家的興趣,逐漸變成日常工作的一部分。

NVIDIA:2026 年 Local AI 模型下載量正在爆發

NVIDIA 表示,從今年目前的 Hugging Face 模型下載數據來看,Local AI 的成長速度相當明顯。以熱門模型為例,2026 年尚未結束,LLM 相關下載量已達去年同期約 4 倍,Creative AI 模型亦成長至約 2 倍。

背後主要有兩個原因。首先,越來越多人開始將 Local AI 真正部署到日常工作,而不再只是下載模型測試;其次則是本地端模型本身的能力快速提升,與雲端 Frontier Model 之間的差距正在縮小。NVIDIA 以今年 LLM 市場為例指出,幾個月前雲端模型仍站在 Benchmark 最前線,但短短數月後,已經有多款可在 DGX Station、DGX Spark 等本地硬體執行的模型追上相近表現。

對使用者而言,最大的吸引力就是能夠在自己的硬體上執行接近雲端品質的模型,不需要按照每次輸入與輸出計算 Token 費用。

Creative AI 同樣出現類似趨勢。創作者原本就偏好利用本地硬體反覆生成、嘗試與修改內容,避免受到雲端額度限制,而隨著本地影片與影像生成模型品質持續提升,如今也能在減少 Token 焦慮的同時,進一步縮小與雲端模型之間的品質差距。

79467040.png

AI Agent 成為 PC 下一波重要運算模式

除了模型本身,NVIDIA 認為 2026 年 AI 成長的另一個重要推力,就是 Agent。

傳統 PC 操作方式,是使用者必須先理解不同應用程式,再親自完成每個操作步驟;Agent 的概念則反過來,使用者只需要說明「自己想完成什麼」,再由 AI 判斷需要使用哪些應用程式、工具與 Skill,並替使用者完成工作流程。

這些 Agent 背後使用的 LLM,可以執行於雲端,也可以直接放在本地端。NVIDIA 表示,目前正與多家主流 Agent 開發團隊合作,希望進一步降低 Local AI 的使用門檻。

Hermes、OpenClaw 將加入一鍵 Local AI 設定

過去要在電腦上執行 Local AI,使用者往往需要自己研究應該下載哪個模型、使用哪種 Quantization、搭配哪套 Inference Engine,接著再自行安裝與配置環境。NVIDIA 希望把這個流程壓縮成「一鍵完成」。

Hermes Agent 即將加入新的 Local Model 設定功能。玩家在初次設定時,只需要選擇 Local Model,系統便會根據 NVIDIA GPU 自動推薦適合的模型與配置,並完成下載、安裝及設定。這項功能預計於 9 月推出,支援 Windows 與 Linux 上的 NVIDIA RTX GPU 與 DGX 系統。

近期推出新版的 OpenClaw 亦將加入類似的一鍵 Local AI 功能。Windows 版本能在初次設定時自動判斷適合的模型與參數,再套用針對 NVIDIA GPU 最佳化的設定。OpenClaw 的相關功能同樣預計於 9 月推出,初期將針對配備 24GB 或以上顯示記憶體的 NVIDIA GPU。

Perplexity Local Agent 將從 DGX Spark 擴展至 RTX GPU

另一項合作則來自 Perplexity。

Perplexity 先前已於 DGX Spark 推出 Local Agent Portable Computer,讓使用者在同一套介面中自由切換 Local Agent 與 Cloud Agent。

如今 NVIDIA 宣布,這套方案將進一步擴展至 Windows 與 Linux 上配備 24GB 或以上 VRAM 的 RTX GPU。本地模式能提供較高的隱私性與不限 Token 的 Agent 對話,並使用 Perplexity 自行訓練的 Local Model;遇到模型無法有效完成的複雜工作時,系統也可以自動將任務升級至 Cloud Model 處理。

這種 Local 與 Cloud 的聯合 Hybrid AI 模式,也是 NVIDIA 相當看好的使用方向。例如稅務工作者可以透過雲端 Perplexity 搜尋最新法規,再讓 Local Agent 處理不能上傳雲端的客戶私人資料;金融業同樣能結合 Perplexity 的市場資訊與本地機密資料分析。

對一般使用者而言,則可以讓雲端 AI 處理最新網路資訊,把日常 To-do List、Project Tracker 或私人文件整理等高頻率工作留在本地端執行。

57528656.jpg

Llama.cpp、vLLM 持續加速 RTX 本地推論

除了讓 Agent 更容易使用,NVIDIA 亦持續與 Llama.cpp、vLLM 等主流開源推論框架合作,提高 Local LLM 在 NVIDIA GPU 上的執行效率。

官方表示,Llama.cpp 最新版本透過 Kernel 最佳化、更進階的 Speculative Decoding 以及更快的 Prefetch,最高可帶來約 1.9 倍 Throughput 提升。vLLM 則透過新的 XQA Attention Kernel 與 Backend 最佳化,在 RTX PRO 6000 Blackwell 上帶來約 1.2 倍效能提升,使用兩台 DGX Spark 時最高則可達約 1.4 倍。

相關改進目前已可透過 Llama.cpp、LM Studio、Ollama 與 vLLM 等工具使用。

83592579.jpg

NVIDIA PAIR 把家裡「閒著的 GPU」全部利用起來

本次報告中,其中一項最有意思的新功能就是全新 NVIDIA PAIR 了。

NVIDIA 指出,美國超過一半家庭擁有兩台或以上 PC,但這些電腦一天大部分時間都沒有真正被充分利用。以 NVIDIA 在簡報中展示的一個家庭為例,家中同時擁有 RTX 桌機、RTX 筆電與 DGX Spark 等裝置,若假設每台裝置每天實際使用時間只有約 17%,剩餘的大量 GPU 算力其實都處於閒置狀態。

NVIDIA PAIR 的目的,就是把這些原本散落在不同裝置中的 AI 算力串連起來。PAIR 會透過區域網路自動探索家中的裝置,再依照不同 AI Inference Request,把工作分配至適合或目前較空閒的電腦執行。初期將支援 Windows、Linux 與 macOS,並可搭配 Ollama、LM Studio 等 Inference Server 使用。

836598259.jpg

值得特別一提的是,NVIDIA PAIR 並不是將家中多台電腦的 VRAM 合併變成一台擁有超大顯示記憶體的虛擬電腦。根據 NVIDIA 的進一步說明,模型本身依然必須完整放得進單一節點的記憶體中。

PAIR 真正做的,是把不同的 Inference Request 分配至不同裝置。例如家中一台雙 RTX 3090 系統負責執行較大型模型,一台 RTX 4080 筆電則可以執行另一個能放入其 VRAM 的較小模型。不同 Agent 或 Sub-Agent 的推論要求,可以再由 PAIR 根據硬體狀態分別送往這些節點處理。

換句話說,它並不會讓 RTX 4080 的 VRAM「借給」雙 RTX 3090 使用,也不會讓多台 PC 一起完成同一個 Model 的單次 Inference。但對同時執行大量 Agent、Sub-Agent 與平行任務的使用者而言,這種分配方式反而相當實用。

NVIDIA PAIR Beta 預計於 9 月 3 日正式推出,並以 Apache 2.0 授權方式開源,讓開發者可以自行修改、擴充,甚至向專案提交程式碼。

nvidia-pair-ollama-inference-distribution-gif.gif

NVIDIA 特別以 Multi-Agent Workflow 展示 PAIR 的應用。

目前 Hermes、OpenClaw 等 Agent Framework 都已大量利用 Sub-Agent,將大型任務拆成多個專業工作,再交回主要 Agent 統整。但在只有單一 GPU 的情況下,即使同時啟動多個 Sub-Agent,大部分 Inference Request 仍必須排隊等待。

NVIDIA 展示的案例中,一個包含五個 Sub-Agent 的複雜工作,在單一 GPU 上約需 18 分鐘完成。透過 PAIR 將工作分散至 RTX 筆電、GeForce RTX 5090 桌機與 DGX Spark 等三個節點後,完成時間縮短至約 9.8 分鐘,接近 2 倍加速。

除了 Multi-Agent 之外,PAIR 亦特別適合 Multitasking。例如使用者可以同時叫 Agent 處理多個不同任務,PAIR 再把它們分配到家中不同 PC,不需要全部排隊使用同一張 GPU。

打遊戲、剪影片時,也能把 AI 推論丟到另一台 PC

PAIR 的第三種應用,就是 System Offloading。

假設主要 PC 正在打遊戲或進行 3D Render,GPU 本身已處於高負載狀態,使用者依然可以繼續透過 Agent 工作。此時 PAIR 能把 AI Inference 轉移到家中另一台閒置 PC 或 DGX Spark 處理,避免 AI 與遊戲、影片輸出互相爭奪 GPU 資源。

NVIDIA 也確認,RTX Spark 與 DGX Spark 可以透過 PAIR 互相分配 AI Inference 工作。不過兩者在硬體連接能力上仍存在差異:DGX Spark 配備 ConnectX 網路介面,可以用於特定叢集與高速連接用途;RTX Spark 筆電本身則不具備相同的 ConnectX 能力,因此不能直接利用這種方式與 DGX Spark 建立硬體層級的 VRAM Pool。

這也再次反映 PAIR 的定位:它是 AI 工作調度工具,而不是多機 GPU Memory Pooling 技術。

597357093608.png

RTX Spark 正式定名「N1X」,10 月上市

除了 Local AI 軟體生態外,NVIDIA 亦帶來 RTX Spark 的最新消息:這個由黃仁勳(Jensen Huang)在 COMPUTEX 2026 首度公開、定位為新一代 AI PC 平台的產品,如今正式確認晶片名稱為 N1X,預計於 2026 年 10 月上市。

N1X 將提供兩種主要配置:

  • 高階版本搭載 6,144 CUDA Core Blackwell RTX GPU、20 核心 Grace CPU,並可配置 24GB 至 128GB Unified Memory,預計用於筆電以及 Small Form Factor 桌上型裝置。
  • 搭載 5,120 CUDA Core Blackwell RTX GPU、18 核心 Grace CPU,配置 24GB 至 32GB Unified Memory,初期將主要應用於筆電。

NVIDIA 表示,目前包括多家主要 OEM 品牌都已準備推出 N1X 設計,而這些產品也將在 IFA 現場展示。Lenovo 同步公布全新 Yoga 9N 2-in-1,Acer 則準備推出旗下 Small Form Factor RTX Spark 系統,更多筆電與迷你桌機設計預計於 2027 年陸續登場。

至於外界關心的 Memory Bandwidth 等更完整硬體規格,NVIDIA 表示目前仍不會提前公布,相關資訊將會在產品接近正式上市時進一步揭露。NVIDIA 目前也沒有推出自家 RTX Spark「Founders Edition」的計畫,現階段將主要透過 OEM 合作夥伴提供產品。

6835959.jpg

EA、Ubisoft、Embark 等遊戲廠商加入 RTX Spark 支援

NVIDIA 同時再次確認 RTX Spark 的遊戲生態。

在 Gamescom 期間,EA、Ubisoft 與 Embark 已加入支援陣容,承諾旗下遊戲及相關 Anti-Cheat 技術將支援 RTX Spark。這意味著包括《Apex 英雄》、《F1》、《ARC Raiders》與《最終決戰》等作品,都預計能在 RTX Spark 系統上正常執行。

此外,包括 Riot Games、Epic Games 等多家遊戲與技術廠商也已加入合作,希望確保這個 ARM-based 新平台在上市時,不只是一台 AI PC,也能真正成為日常遊戲與創作使用的主力電腦。

65865392.jpeg

NVIDIA 想把「無限 Token」變成 PC 本身的一項資源

從這次 NVIDIA 將在 IFA 2026 期間展開的情報可以看出,NVIDIA 對 Local AI 的想像已經不再只是「讓顯示卡跑 LLM」。

真正的核心,是把 PC 本身的 GPU 算力重新視為一種可以隨時使用的 AI 資源。Hermes、OpenClaw 與 Perplexity 負責把 Local Agent 變得更容易上手;Llama.cpp 與 vLLM 持續提升模型推論速度;NVIDIA PAIR 則進一步把家裡原本彼此獨立的 PC 串連起來,讓多 Agent 工作能夠真正平行執行。最後再由最高可配置 128GB Unified Memory 的 RTX Spark N1X,提供一套從硬體開始就為 Agent 與 Local AI 打造的新平台。

對使用者而言,這套 Local AI 最大的吸引力依然相當直接:資料可以留在自己的裝置中、模型可以反覆使用,而且不必每執行一次工作就開始計算用了多少 Token。

如果 NVIDIA 對 2026 年的判斷沒有錯,那麼接下來 AI PC 之間真正比拼的,或許不再只是「這台電腦能不能跑 AI」,而是使用者手邊那些原本閒置的 GPU 算力,到底能被利用到什麼程度。

關於作者

安 drew

A gamer is a gamer, even... in a dream~ 👾🎮

正在載入下一篇文章...