Guia de compra de servidor GPU: como especificar, adquirir e implantar hardware de IA
Compra de infraestrutura de IA e GPU · Publicado 2026-07-25
Comprar um servidor GPU se resume a quatro decisões tomadas na ordem certa: casar a classe de GPU com a carga de trabalho, escolher o formato (PCIe ou SXM), decidir entre silício novo e recondicionado, e escolher uma plataforma com a alimentação, a refrigeração e a conectividade que as GPUs exigem. Com a ordem certa, o resto é mecânica de compras; com a ordem invertida (plataforma primeiro, carga de trabalho por último), compra-se ou máquina demais ou uma máquina que sofre throttling.
Este é o guia central da nossa série sobre infraestrutura de IA e GPU. Ele reflete como realmente especificamos e cotamos sistemas GPU para compradores na AXISLINK, e passará a apontar para mergulhos mais profundos em preços, regras de exportação e comparativos de modelos específicos à medida que esses guias forem publicados.
Em resumo
- A carga de trabalho determina a classe de GPU; todo o resto decorre disso
- Módulos SXM entregam a largura de banda plena de interconexão; placas PCIe trocam velocidade por flexibilidade
- GPUs de datacenter recondicionadas podem cortar bastante o custo se a procedência for verificada
- Um nó de 8 GPUs é um projeto de energia e refrigeração, não apenas uma compra de servidor
- Aceleradores avançados de IA estão sujeitos a controles de exportação: planeje a conformidade antes de encomendar
- Prazos variam por canal; o mercado secundário se move mais rápido do que as filas de alocação
Comece pela carga de trabalho, não pela GPU
O mercado fala em números de modelo de GPU, mas a especificação começa pelo que a máquina precisa fazer. Mapeamento aproximado no cenário da geração atual:
| Carga de trabalho | O que mais importa | Classe de GPU típica |
|---|---|---|
| Treinamento e fine-tuning de LLM | Capacidade de memória, largura de banda de interconexão, escalonamento multi-GPU | Aceleradores de datacenter topo de linha (classe H100/H200, SXM) |
| Inferência de LLM em escala | Capacidade de memória por dólar, throughput | Classe H100/A100 ou placas de inferência com muita memória (classe L40S) |
| Difusão, renderização, mídia | Poder de cálculo bruto, VRAM, ecossistema de drivers | Classe L40S ou placas de estação de trabalho (família RTX 6000) |
| ML clássico, análise de dados, CV | Custo por GPU, simplicidade de nó único | Placas de datacenter da geração anterior (A100, até classe V100) |
| VDI e estações de trabalho virtuais | Modelo de licenciamento, densidade por placa | GPUs feitas sob medida para virtualização |
Dois corolários práticos. Primeiro, os topos de linha da geração anterior continuam genuinamente úteis: um cluster A100 ainda treina e serve modelos sérios, por uma fração do preço do topo de linha atual no mercado secundário. Segundo, comprar uma GPU maior do que a carga de trabalho precisa não garante o futuro se a interconexão, o armazenamento ou a rede virarem o gargalo primeiro.
PCIe ou SXM: a bifurcação do formato
A mesma geração de GPU costuma chegar ao mercado em dois formatos, e a escolha molda o servidor inteiro.
| Placas PCIe | Módulos SXM | |
|---|---|---|
| Instalação | Slots padrão em muitos modelos de servidor | Soldados a uma placa-base dedicada (classe HGX) |
| Largura de banda GPU a GPU | Limitada; conectores de ponte em alguns pares | Interconexão em malha completa de alta largura de banda |
| Energia e refrigeração | Menor consumo por placa, refrigerável a ar em 2U | Maior consumo; exige chassi dedicado |
| Flexibilidade | Adicionar ou mover placas entre sistemas | Configurações fixas de 4 GPUs ou 8 GPUs |
| Melhor uso | Inferência, cargas mistas, escala gradual | Treinamento multi-GPU onde a eficiência de escala compensa |
A regra prática honesta do nosso trabalho de cotação: máquinas de inferência de nó único e equipamentos mistos de pesquisa costumam ser montagens PCIe; clusters sérios de treinamento multi-GPU são montagens SXM, e o prêmio compra throughput real de treinamento, não um número de ficha técnica.
Novo ou recondicionado: o que o mercado secundário realmente oferece
GPUs de datacenter entram no mercado secundário quando hyperscalers e laboratórios de IA renovam suas frotas. Essa oferta torna os aceleradores da geração anterior dramaticamente mais baratos que os novos topos de linha, e é assim que muitas equipes conseguem pagar por capacidade real. O que separa uma boa compra recondicionada de uma aposta:
- Procedência: quem operou a placa, em que ambiente, e por que foi desativada
- Testes: resultados de burn-in por placa, não por lote, com verificações de memória e térmicas
- Classificação de estado declarada por escrito, com fotografias para estoque usado
- Garantia: uma janela de devolução declarada pelo vendedor, já que a cobertura do fabricante raramente é transferida
- Estado de firmware e licenciamento: placas travadas ou atreladas a um fornecedor existem e precisam ser informadas
Este é um negócio de procedência. O motivo pelo qual compradores fazem compras recondicionadas por meio de uma contraparte comercial responsável, e não por um anúncio de marketplace, é que verificação, classificação e possibilidade de recurso são o produto de fato; o silício é o mesmo nos dois casos. Nosso estoque de GPUs e aceleradores informa estado e classificação explicitamente exatamente por essa razão.
A plataforma: o servidor ao redor das GPUs
GPUs não funcionam sozinhas. A decisão de plataforma é onde os orçamentos quebram em silêncio.
Chassi e densidade
Formatos comuns: servidores 2U que recebem de 2 a 4 placas PCIe; torres e chassis de rack 4U/5U que recebem de 4 a 8 placas PCIe com melhor fluxo de ar; e plataformas HGX dedicadas de 6U-8U carregando 8 módulos SXM (classe Dell PowerEdge XE9680, classe HPE Cray, sistemas Supermicro HGX). Um chassi em que as placas cabem não é o mesmo que um chassi que as refrigera sob carga sustentada.
Energia é a restrição escondida
Um nó topo de linha de 8 GPUs consome na ordem de 10 kW sob carga. Isso está além de muitas salas de servidores de escritório e é uma fração relevante do orçamento de um rack em colocation. Antes de encomendar, confirme o orçamento de energia do rack e a capacidade das PDUs, a capacidade de refrigeração para o calor realmente produzido, e se a instalação cobra por potência provisionada. Mais de uma vez recotamos um comprador de um nó de 8 GPUs para dois nós de 4 GPUs puramente por causa dos limites de energia da instalação.
CPU, memória, armazenamento, rede
Regras de equilíbrio que valem entre gerações: memória de sistema no mínimo igual à memória total de GPU (o dobro é confortável para treinamento); scratch NVMe rápido o bastante para manter as GPUs alimentadas; e, para treinamento multinó, uma malha (Ethernet de alta velocidade ou classe InfiniBand) à altura da ambição, porque uma interconexão faminta deixa silício caro ocioso.
Controles de exportação: planeje a conformidade antes de encomendar
Aceleradores avançados de IA estão sujeitos a controles de exportação, com destaque para as regras do Bureau of Industry and Security dos Estados Unidos que restringem o envio das GPUs de datacenter de primeira linha a certos destinos. O que isso significa na prática para um comprador:
- A disponibilidade de aceleradores topo de linha difere por mercado de destino; destinos restritos não podem receber legalmente certos SKUs
- Vendedores pedirão informações de usuário final e uso final em modelos controlados; trate isso como sinal de uma contraparte legal, não como atrito
- Regulamentos mudam; o que rege seu embarque é o conjunto de regras vigente, não o resumo do ano passado
Dizemos isso com clareza em nossos próprios termos: pedidos podem exigir informações de usuário final, e recusamos transações que não possam ser cumpridas legalmente. Um guia dedicado desta série destrincha as regras para compradores internacionais em mais profundidade.
Canais de fornecimento e prazos
Três grandes canais fornecem sistemas GPU. A alocação OEM (encomendar um sistema configurado pelos canais Dell, HPE, Supermicro ou Lenovo) entrega sistemas novos com garantia, com prazos que se esticam quando a demanda dispara. O mercado secundário e recondicionado se move mais rápido e precifica as gerações anteriores de forma atraente, com a qualidade dependendo inteiramente da verificação. Empresas de trading como a nossa atuam nos dois lados: buscamos GPUs e plataformas novas ou recondicionadas, verificamos e consolidamos, e embarcamos com documentação de exportação a partir de Hong Kong ou da China continental. Qual canal vence depende de a sua restrição ser orçamento, prazo ou cobertura de garantia.
Um exemplo resolvido do caminho de decisão
Um comprador quer fazer fine-tuning de modelos abertos de porte médio e servi-los a alguns milhares de usuários. Caminho de decisão: a carga de trabalho mistura treinamento e inferência; capacidade de memória importa mais que pico de interconexão, então de 4 a 8 aceleradores PCIe da classe H100/A100 vencem uma placa-base SXM em custo; placas A100 80GB recondicionadas com procedência documentada cortam o orçamento de silício pela metade; a plataforma é um chassi 4U com alimentação redundante e scratch NVMe; a checagem da instalação confirma que o rack dá conta da energia. Essa é uma especificação completa e defensável, e cada passo dela é uma conversa que temos com compradores toda semana.
Perguntas frequentes
Qual é a diferença entre um servidor GPU e um servidor comum?
Um servidor GPU é construído em torno da energia e da refrigeração dos aceleradores: fontes de maior potência, fluxo de ar projetado para placas ou módulos sob carga sustentada, e topologia PCIe ou SXM para conectá-los. Um servidor comum às vezes aceita uma ou duas placas; um servidor GPU é projetado para a lotação completa.
Devo comprar ou alugar computação GPU?
Alugar vence para trabalho pontual ou exploratório; comprar vence quando a utilização é sustentada, quando gravidade de dados ou privacidade importam, ou quando o preço da GPU em nuvem supera o custo amortizado do hardware para o seu ciclo de uso. Muitas equipes alugam para prototipar e compram para produção. Um guia separado desta série faz essa conta.
GPUs de datacenter recondicionadas são confiáveis?
Placas de datacenter são projetadas para operação contínua, e placas de frota bem desativadas, com resultados de teste por placa, têm vida útil longa. O risco se concentra na procedência e nos testes, não no conceito do silício: compre estoque classificado, testado e documentado de um vendedor responsável.
Quanta energia um servidor de 8 GPUs precisa?
Nós SXM topo de linha de 8 GPUs consomem na ordem de 10 kW sob carga; montagens PCIe menos, mas ainda muito além da fiação comum de escritório. Confirme energia e refrigeração da instalação antes de encomendar, não depois da entrega.
Posso fazer upgrade de um servidor de 4 GPUs para 8 GPUs depois?
Em plataformas PCIe, só se o chassi, as fontes e o fluxo de ar tiverem sido dimensionados para isso desde o início. Placas-base SXM são configurações fixas. Se o crescimento é provável, compre a plataforma maior com menos placas e vá populando ao longo do tempo.
Adquirindo este hardware?
A AXISLINK fornece a compradores empresariais em todo o mundo a partir de Hong Kong e da China continental, com documentação de exportação e frete organizados. Envie seus requisitos e receba uma cotação formal, normalmente em 24 horas.
Pedir cotação