GPU 伺服器選購指南:如何選型、採購與部署 AI 硬體
AI 與 GPU 基礎設施採購 · 發布於 2026-07-25
購買 GPU 伺服器歸結為按正確順序做出的四項決策:讓 GPU 等級對應工作負載,選定形態(PCIe 還是 SXM),在全新與整新晶片之間做出取捨,再選擇一個在供電、散熱與互連上都能滿足 GPU 需求的平台。順序對了,剩下的只是採購流程;順序反了(先定平台、最後看工作負載),買到的不是規格過剩的機器,就是一台會降頻的機器。
這是我們 AI 與 GPU 基礎設施系列的樞紐指南。它反映了我們在 AXISLINK 為買家實際選型與報價 GPU 系統的方式,隨著系列各篇陸續發佈,還會連結到關於價格、出口規則與特定型號比較的深入文章。
重點速覽
- 工作負載決定 GPU 等級,其餘一切由此展開
- SXM 模組提供完整的互連頻寬;PCIe 卡以速度換取彈性
- 整新資料中心 GPU 在來源可驗證的前提下能大幅壓低成本
- 一台 8 GPU 節點是一項供電與散熱工程,而不只是買一台伺服器
- 先進 AI 加速器受出口管制約束:下單前先規劃合規
- 交期因通路而異;二手市場的流轉快於原廠配額排隊
從工作負載出發,而不是從 GPU 出發
市場習慣用 GPU 型號說話,但選型要從這台機器必須完成的任務開始。以當前世代格局為準的粗略對應如下:
| 工作負載 | 最重要的因素 | 典型 GPU 等級 |
|---|---|---|
| LLM 訓練與微調 | 記憶體容量、互連頻寬、多 GPU 擴展能力 | 旗艦資料中心加速器(H100/H200 級,SXM) |
| 規模化 LLM 推論 | 單位成本的記憶體容量、吞吐量 | H100/A100 級或大記憶體推論卡(L40S 級) |
| 擴散模型、算圖、媒體處理 | 原始算力、VRAM、驅動生態系 | L40S 級或工作站卡(RTX 6000 系列) |
| 傳統 ML、分析、CV | 單 GPU 成本、單節點部署的簡潔性 | 上一代資料中心卡(A100,甚至 V100 級) |
| VDI 與虛擬工作站 | 授權模式、單卡承載密度 | 專為虛擬化打造的 GPU |
兩點實際推論。第一,上一代旗艦依然真正有用:A100 叢集至今仍能訓練並部署相當規模的模型,而二手市場價格只是現役旗艦的零頭。第二,如果互連、儲存或網路先成為瓶頸,買一張超出工作負載所需的更大 GPU 並不能帶來任何面向未來的保障。
PCIe 還是 SXM:形態的分岔口
同一代 GPU 通常以兩種形態出貨,這個選擇決定了整台伺服器的走向。
| PCIe 卡 | SXM 模組 | |
|---|---|---|
| 安裝方式 | 標準插槽,適用多種伺服器機型 | 焊接在專用基板上(HGX 級) |
| GPU 對 GPU 頻寬 | 有限;部分卡對可加橋接器 | 全網狀高頻寬互連 |
| 供電與散熱 | 單卡功耗較低,2U 內可氣冷 | 功耗最高;需要專用機殼 |
| 彈性 | 可在系統間加裝或移轉卡片 | 固定為 4 GPU 或 8 GPU 配置 |
| 最適合 | 推論、混合負載、漸進擴充 | 擴展效率能帶來回報的多 GPU 訓練 |
來自我們報價工作的誠實經驗法則:單節點推論與混合研究機器通常做 PCIe 方案;認真的多 GPU 訓練叢集做 SXM 方案,溢價換來的是實打實的訓練吞吐量,而不是規格表上的一個數字。
全新還是整新:二手市場真正提供什麼
當超大規模雲端業者與 AI 實驗室汰換機隊時,資料中心 GPU 便進入二手市場。這一供給讓上一代加速器遠比全新旗艦便宜,也是許多團隊買得起真實算力的原因。區分一筆可靠的整新採購與一場賭博的是:
- 來源:這張卡由誰運行、在什麼環境中、因何退役
- 測試:按單卡而非按批次出具的燒機結果,並附記憶體與溫度檢查
- 以書面寫明的機況分級,二手現貨附實物照片
- 保固:賣方明示的退換窗口,因為原廠保固很少隨卡移轉
- 韌體與授權狀態:鎖定或綁定廠商的卡確實存在,必須如實揭露
這是一門講究來源的生意。買家之所以透過可負責任的貿易交易對手而不是市集刊登來完成整新採購,是因為驗證、分級與求償管道才是真正的產品;晶片本身兩邊並無不同。我們的GPU 與加速器庫存正是出於這個原因,逐項明確標註機況與分級。
平台:GPU 周圍的那台伺服器
GPU 不會自己運轉。平台決策正是預算悄悄失守的地方。
機殼與密度
常見形態:可裝 2 到 4 張 PCIe 卡的 2U 伺服器;風道更好、可裝 4 到 8 張 PCIe 卡的 4U/5U 直立式與機架機殼;以及承載 8 個 SXM 模組的專用 6U-8U HGX 平台(Dell PowerEdge XE9680 級、HPE Cray 級、Supermicro HGX 系統)。裝得下這些卡的機殼,不等於能在持續負載下壓得住溫度的機殼。
供電是隱藏的限制
一台 8 GPU 旗艦節點滿載功耗在 10 kW 量級。這超出許多辦公室機房的承受能力,在代管機房裡也要佔去機櫃電力預算的可觀份額。下單之前,請確認機櫃電力預算與 PDU 容量、對應實際發熱量的冷卻能力,以及機房是否按預配電力計費。我們不止一次純粹因為機房電力限制,把買家的方案從一台 8 GPU 節點改報為兩台 4 GPU 節點。
CPU、記憶體、儲存、網路
跨世代都成立的平衡法則:系統記憶體至少與 GPU 記憶體總量持平(訓練場景下留到兩倍更從容);NVMe 暫存碟要快到足以持續餵飽 GPU;多節點訓練則需要與目標相稱的互連網路(高速乙太網路或 InfiniBand 級),因為餵不飽的互連會讓昂貴的晶片閒置。
出口管制:下單之前先規劃合規
先進 AI 加速器受出口管制約束,最突出的是美國工業與安全局限制頂級資料中心 GPU 向特定目的地出貨的規則。對買家而言,這在實務上意味著:
- 旗艦加速器的可取得性因目的地市場而異;受限目的地無法合法接收某些 SKU
- 對受管制型號,賣方會要求提供最終用戶與最終用途資訊;應把這視為合法交易對手的標誌,而非麻煩
- 法規會變動;管轄你這批貨物的是現行規則,而不是去年的摘要
我們在自己的條款中說得很直白:訂單可能需要提供最終用戶資訊,無法合法履行的交易我們會拒絕。本系列中會有專門一篇指南,更深入地為海外買家拆解這些規則。
採購通路與交期
GPU 系統大體來自三類通路。OEM 配額(透過 Dell、HPE、Supermicro 或 Lenovo 通路訂購整機配置)交付有保固背書的全新系統,但需求高峰時交期會被拉長。二手與整新市場流轉最快,上一代產品定價誘人,品質則完全取決於驗證。像我們這樣的貿易公司橫跨兩端:採購全新或整新的 GPU 與平台,完成驗證與併櫃,並附出口文件從香港或中國大陸出貨。哪條通路勝出,取決於你的限制是預算、交期還是保固涵蓋。
決策路徑的實例演算
一位買家想微調中型開放模型,並向數千名用戶提供服務。決策路徑:工作負載是訓練與推論混合;記憶體容量比峰值互連更重要,因此 4 到 8 張 H100/A100 級 PCIe 加速卡在成本上勝過一塊 SXM 基板;來源有據可查的整新 A100 80GB 卡把晶片預算砍半;平台選配備援電源與 NVMe 暫存碟的 4U 機殼;機房查核確認機櫃供得起電。這就是一份完整且站得住腳的規格,其中每一步都是我們每週與買家進行的對話。
常見問題
GPU 伺服器與一般伺服器有什麼差別?
GPU 伺服器圍繞加速器的供電與散熱而打造:更高瓦數的電源供應器、為持續負載下的卡或模組設計的風道,以及連接它們的 PCIe 或 SXM 拓撲。一般伺服器有時能插一到兩張卡;GPU 伺服器則是為滿載配置而設計的。
GPU 算力應該買還是租?
突發性或探索性的工作租用更划算;當使用率持續走高、資料重力或隱私要緊、或者雲端 GPU 價格超過你使用節奏下的硬體攤提成本時,自購更勝一籌。許多團隊用租來做原型、用買來上線生產。本系列另有一篇指南專門演算這筆帳。
整新資料中心 GPU 可靠嗎?
資料中心卡本就為連續運轉而設計,退役流程規範、附單卡測試結果的機隊卡有很長的可用壽命。風險集中在來源與測試上,而不是晶片這個概念本身:向可負責任的賣家購買經分級、經測試、有文件佐證的現貨。
一台 8 GPU 伺服器需要多少電力?
旗艦 8 GPU SXM 節點滿載功耗在 10 kW 量級;PCIe 方案低一些,但仍遠超一般辦公室線路。請在下單之前而不是到貨之後確認機房供電與冷卻。
4 GPU 伺服器以後能升級到 8 GPU 嗎?
在 PCIe 平台上,只有當機殼、電源供應器與風道從一開始就按此預留時才可行。SXM 基板是固定配置。如果擴充是大概率事件,就買更大的平台、先裝較少的卡,隨時間逐步插滿。