Saltar para o conteúdo
sales@axislinktrading.com
AXISLINKTRADING LIMITED

Guia de compra de servidor GPU: como especificar, adquirir e implantar hardware de IA

Compra de infraestrutura de IA e GPU · Publicado 2026-07-25

Comprar um servidor GPU se resume a quatro decisões tomadas na ordem certa: casar a classe de GPU com a carga de trabalho, escolher o formato (PCIe ou SXM), decidir entre silício novo e recondicionado, e escolher uma plataforma com a alimentação, a refrigeração e a conectividade que as GPUs exigem. Com a ordem certa, o resto é mecânica de compras; com a ordem invertida (plataforma primeiro, carga de trabalho por último), compra-se ou máquina demais ou uma máquina que sofre throttling.

Este é o guia central da nossa série sobre infraestrutura de IA e GPU. Ele reflete como realmente especificamos e cotamos sistemas GPU para compradores na AXISLINK, e passará a apontar para mergulhos mais profundos em preços, regras de exportação e comparativos de modelos específicos à medida que esses guias forem publicados.

Em resumo

  • A carga de trabalho determina a classe de GPU; todo o resto decorre disso
  • Módulos SXM entregam a largura de banda plena de interconexão; placas PCIe trocam velocidade por flexibilidade
  • GPUs de datacenter recondicionadas podem cortar bastante o custo se a procedência for verificada
  • Um nó de 8 GPUs é um projeto de energia e refrigeração, não apenas uma compra de servidor
  • Aceleradores avançados de IA estão sujeitos a controles de exportação: planeje a conformidade antes de encomendar
  • Prazos variam por canal; o mercado secundário se move mais rápido do que as filas de alocação

Comece pela carga de trabalho, não pela GPU

O mercado fala em números de modelo de GPU, mas a especificação começa pelo que a máquina precisa fazer. Mapeamento aproximado no cenário da geração atual:

Carga de trabalhoO que mais importaClasse de GPU típica
Treinamento e fine-tuning de LLMCapacidade de memória, largura de banda de interconexão, escalonamento multi-GPUAceleradores de datacenter topo de linha (classe H100/H200, SXM)
Inferência de LLM em escalaCapacidade de memória por dólar, throughputClasse H100/A100 ou placas de inferência com muita memória (classe L40S)
Difusão, renderização, mídiaPoder de cálculo bruto, VRAM, ecossistema de driversClasse L40S ou placas de estação de trabalho (família RTX 6000)
ML clássico, análise de dados, CVCusto por GPU, simplicidade de nó únicoPlacas de datacenter da geração anterior (A100, até classe V100)
VDI e estações de trabalho virtuaisModelo de licenciamento, densidade por placaGPUs feitas sob medida para virtualização

Dois corolários práticos. Primeiro, os topos de linha da geração anterior continuam genuinamente úteis: um cluster A100 ainda treina e serve modelos sérios, por uma fração do preço do topo de linha atual no mercado secundário. Segundo, comprar uma GPU maior do que a carga de trabalho precisa não garante o futuro se a interconexão, o armazenamento ou a rede virarem o gargalo primeiro.

PCIe ou SXM: a bifurcação do formato

A mesma geração de GPU costuma chegar ao mercado em dois formatos, e a escolha molda o servidor inteiro.

Placas PCIeMódulos SXM
InstalaçãoSlots padrão em muitos modelos de servidorSoldados a uma placa-base dedicada (classe HGX)
Largura de banda GPU a GPULimitada; conectores de ponte em alguns paresInterconexão em malha completa de alta largura de banda
Energia e refrigeraçãoMenor consumo por placa, refrigerável a ar em 2UMaior consumo; exige chassi dedicado
FlexibilidadeAdicionar ou mover placas entre sistemasConfigurações fixas de 4 GPUs ou 8 GPUs
Melhor usoInferência, cargas mistas, escala gradualTreinamento multi-GPU onde a eficiência de escala compensa

A regra prática honesta do nosso trabalho de cotação: máquinas de inferência de nó único e equipamentos mistos de pesquisa costumam ser montagens PCIe; clusters sérios de treinamento multi-GPU são montagens SXM, e o prêmio compra throughput real de treinamento, não um número de ficha técnica.

Novo ou recondicionado: o que o mercado secundário realmente oferece

GPUs de datacenter entram no mercado secundário quando hyperscalers e laboratórios de IA renovam suas frotas. Essa oferta torna os aceleradores da geração anterior dramaticamente mais baratos que os novos topos de linha, e é assim que muitas equipes conseguem pagar por capacidade real. O que separa uma boa compra recondicionada de uma aposta:

  • Procedência: quem operou a placa, em que ambiente, e por que foi desativada
  • Testes: resultados de burn-in por placa, não por lote, com verificações de memória e térmicas
  • Classificação de estado declarada por escrito, com fotografias para estoque usado
  • Garantia: uma janela de devolução declarada pelo vendedor, já que a cobertura do fabricante raramente é transferida
  • Estado de firmware e licenciamento: placas travadas ou atreladas a um fornecedor existem e precisam ser informadas

Este é um negócio de procedência. O motivo pelo qual compradores fazem compras recondicionadas por meio de uma contraparte comercial responsável, e não por um anúncio de marketplace, é que verificação, classificação e possibilidade de recurso são o produto de fato; o silício é o mesmo nos dois casos. Nosso estoque de GPUs e aceleradores informa estado e classificação explicitamente exatamente por essa razão.

A plataforma: o servidor ao redor das GPUs

GPUs não funcionam sozinhas. A decisão de plataforma é onde os orçamentos quebram em silêncio.

Chassi e densidade

Formatos comuns: servidores 2U que recebem de 2 a 4 placas PCIe; torres e chassis de rack 4U/5U que recebem de 4 a 8 placas PCIe com melhor fluxo de ar; e plataformas HGX dedicadas de 6U-8U carregando 8 módulos SXM (classe Dell PowerEdge XE9680, classe HPE Cray, sistemas Supermicro HGX). Um chassi em que as placas cabem não é o mesmo que um chassi que as refrigera sob carga sustentada.

Energia é a restrição escondida

Um nó topo de linha de 8 GPUs consome na ordem de 10 kW sob carga. Isso está além de muitas salas de servidores de escritório e é uma fração relevante do orçamento de um rack em colocation. Antes de encomendar, confirme o orçamento de energia do rack e a capacidade das PDUs, a capacidade de refrigeração para o calor realmente produzido, e se a instalação cobra por potência provisionada. Mais de uma vez recotamos um comprador de um nó de 8 GPUs para dois nós de 4 GPUs puramente por causa dos limites de energia da instalação.

CPU, memória, armazenamento, rede

Regras de equilíbrio que valem entre gerações: memória de sistema no mínimo igual à memória total de GPU (o dobro é confortável para treinamento); scratch NVMe rápido o bastante para manter as GPUs alimentadas; e, para treinamento multinó, uma malha (Ethernet de alta velocidade ou classe InfiniBand) à altura da ambição, porque uma interconexão faminta deixa silício caro ocioso.

Controles de exportação: planeje a conformidade antes de encomendar

Aceleradores avançados de IA estão sujeitos a controles de exportação, com destaque para as regras do Bureau of Industry and Security dos Estados Unidos que restringem o envio das GPUs de datacenter de primeira linha a certos destinos. O que isso significa na prática para um comprador:

  • A disponibilidade de aceleradores topo de linha difere por mercado de destino; destinos restritos não podem receber legalmente certos SKUs
  • Vendedores pedirão informações de usuário final e uso final em modelos controlados; trate isso como sinal de uma contraparte legal, não como atrito
  • Regulamentos mudam; o que rege seu embarque é o conjunto de regras vigente, não o resumo do ano passado

Dizemos isso com clareza em nossos próprios termos: pedidos podem exigir informações de usuário final, e recusamos transações que não possam ser cumpridas legalmente. Um guia dedicado desta série destrincha as regras para compradores internacionais em mais profundidade.

Canais de fornecimento e prazos

Três grandes canais fornecem sistemas GPU. A alocação OEM (encomendar um sistema configurado pelos canais Dell, HPE, Supermicro ou Lenovo) entrega sistemas novos com garantia, com prazos que se esticam quando a demanda dispara. O mercado secundário e recondicionado se move mais rápido e precifica as gerações anteriores de forma atraente, com a qualidade dependendo inteiramente da verificação. Empresas de trading como a nossa atuam nos dois lados: buscamos GPUs e plataformas novas ou recondicionadas, verificamos e consolidamos, e embarcamos com documentação de exportação a partir de Hong Kong ou da China continental. Qual canal vence depende de a sua restrição ser orçamento, prazo ou cobertura de garantia.

Um exemplo resolvido do caminho de decisão

Um comprador quer fazer fine-tuning de modelos abertos de porte médio e servi-los a alguns milhares de usuários. Caminho de decisão: a carga de trabalho mistura treinamento e inferência; capacidade de memória importa mais que pico de interconexão, então de 4 a 8 aceleradores PCIe da classe H100/A100 vencem uma placa-base SXM em custo; placas A100 80GB recondicionadas com procedência documentada cortam o orçamento de silício pela metade; a plataforma é um chassi 4U com alimentação redundante e scratch NVMe; a checagem da instalação confirma que o rack dá conta da energia. Essa é uma especificação completa e defensável, e cada passo dela é uma conversa que temos com compradores toda semana.

Perguntas frequentes

Qual é a diferença entre um servidor GPU e um servidor comum?

Um servidor GPU é construído em torno da energia e da refrigeração dos aceleradores: fontes de maior potência, fluxo de ar projetado para placas ou módulos sob carga sustentada, e topologia PCIe ou SXM para conectá-los. Um servidor comum às vezes aceita uma ou duas placas; um servidor GPU é projetado para a lotação completa.

Devo comprar ou alugar computação GPU?

Alugar vence para trabalho pontual ou exploratório; comprar vence quando a utilização é sustentada, quando gravidade de dados ou privacidade importam, ou quando o preço da GPU em nuvem supera o custo amortizado do hardware para o seu ciclo de uso. Muitas equipes alugam para prototipar e compram para produção. Um guia separado desta série faz essa conta.

GPUs de datacenter recondicionadas são confiáveis?

Placas de datacenter são projetadas para operação contínua, e placas de frota bem desativadas, com resultados de teste por placa, têm vida útil longa. O risco se concentra na procedência e nos testes, não no conceito do silício: compre estoque classificado, testado e documentado de um vendedor responsável.

Quanta energia um servidor de 8 GPUs precisa?

Nós SXM topo de linha de 8 GPUs consomem na ordem de 10 kW sob carga; montagens PCIe menos, mas ainda muito além da fiação comum de escritório. Confirme energia e refrigeração da instalação antes de encomendar, não depois da entrega.

Posso fazer upgrade de um servidor de 4 GPUs para 8 GPUs depois?

Em plataformas PCIe, só se o chassi, as fontes e o fluxo de ar tiverem sido dimensionados para isso desde o início. Placas-base SXM são configurações fixas. Se o crescimento é provável, compre a plataforma maior com menos placas e vá populando ao longo do tempo.

Adquirindo este hardware?

A AXISLINK fornece a compradores empresariais em todo o mundo a partir de Hong Kong e da China continental, com documentação de exportação e frete organizados. Envie seus requisitos e receba uma cotação formal, normalmente em 24 horas.

Pedir cotação