ArmazenamentoReview.com

Intel mira inferência de IA no OCP 2025 com GPU Crescent Island e racks Gaudi 3

Empreendimento  ◇  servidor

No OCP Global Summit de 2025, a Intel enfatizou a inferência de IA ao revelar dois avanços importantes: uma nova GPU para data center chamada "Crescent Island" e um design de referência em escala de rack para o Gaudi 3. Ambos os desenvolvimentos se alinham com a crescente transição do treinamento de modelos para a inferência generalizada em tempo real, onde fatores como latência, largura de banda de memória, eficiência e simplicidade operacional são agora cruciais.

Do treinamento estático à inferência generalizada em tempo real

O CTO da Intel, Sachin Katti, resumiu a transição observando que, à medida que a IA agêntica se torna mais difundida, a inferência se torna contínua, rica em contexto e cada vez mais intensiva em termos de sistema. Para gerenciar os crescentes volumes de tokens, as combinações complexas de modalidades e os rigorosos requisitos de SLA, torna-se necessária uma infraestrutura heterogênea que combine silício otimizado com uma pilha de software aberta e centrada no desenvolvedor. Nesse ambiente, as GPUs de data center com arquitetura Xe da Intel oferecem a capacidade e a confiabilidade necessárias à medida que os comprimentos de sequência e as taxas de token aumentam, enquanto o Gaudi 3 oferece suporte a um ecossistema de inferência aberto e escalável com custo total de propriedade (TCO) previsível.

A principal conclusão não é simplesmente "chips mais rápidos". O sucesso da inferência depende da integração de sistemas: memória com reconhecimento de topologia, interconexões flexíveis, energia e resfriamento adequados aos perfis de utilização e orquestração que trata modelos, tokens e fluxos como cidadãos de primeira classe. As empresas não querem ficar presas precisamente no momento em que precisam iterar entre modelos, estruturas e pilhas de serviço.

Abrangendo PC, Edge e Data Center

A Intel afirma estar em uma posição única para oferecer abrangência de ponta a ponta, com PCs de IA, edge industrial e racks de data center baseados em CPUs Xeon 6, aceleradores Gaudi 3 e GPUs Intel. Os temas comuns incluem:

  • A flexibilidade do PCIe na diversidade permite a reutilização de áreas existentes quando adequado e permite o dimensionamento para racks centrados em malha, se necessário.
  • Os projetos em escala de rack garantem desempenho previsível por watt e incluem opções de resfriamento líquido quando requisitos térmicos e de alta densidade exigem isso.
  • Uma plataforma de software abrangente e integrada que visa garantir o desenvolvimento perfeito em vários tipos de silício e níveis de implantação.

A parceria com a OCP reforça a preferência da empresa por designs abertos e referenciáveis, que são mais fáceis de adquirir, validar e dimensionar nas operações.

Crescent Island: Uma GPU de Data Center Ajustada para Economia de Inferência

Crescent Island é a próxima GPU para data center da Intel, projetada para servidores corporativos refrigerados a ar que exigem alta taxa de transferência de tokens sem a necessidade de soluções avançadas de energia ou resfriamento. Seu foco é prático: priorizar a eficiência de custos e o desempenho energético, ao mesmo tempo em que oferece a capacidade de memória e a largura de banda essenciais para tarefas de inferência modernas.

Os destaques incluem:

  • Microarquitetura Xe3P focada em desempenho por watt. Isso se alinha bem com a inferência de estado estacionário, onde a utilização é sustentada e a sensibilidade ao custo é alta.
  • Memória LPDDR5X de 160 GB no cartão. Para servidores LLM/RAG, sumarização de contexto longo e pipelines multimodais, a capacidade de memória e a largura de banda geralmente limitam o QPS e a latência de cauda mais do que o TOPS bruto.
  • Amplo suporte a tipos de dados, projetado com provedores de "tokens como serviço" em mente. A flexibilidade de precisão/quantização mista é essencial para reduzir a taxa de transferência e, ao mesmo tempo, preservar a precisão dos endpoints de produção.
  • Preparação de software por meio da pilha aberta e unificada da Intel. A otimização antecipada nas GPUs Arc Pro Série B visa otimizar os fluxos de trabalho dos desenvolvedores e minimizar o atrito de portabilidade.
  • Cronograma: A amostragem de clientes para Crescent Island é esperada para o segundo semestre de 2026. Para compradores que planejam ciclos de atualização de 2026–2027, isso oferece uma janela prática para pilotar a pilha de software e os padrões de atendimento de modelos agora.

Crescent Island é sobre economia de inferência em escala. É refrigerado a ar, voltado para capacidade e focado em desempenho/W. Suponha que suas cargas de trabalho sejam dominadas por serviços com uso intensivo de tokens e SLOs de latência estrita. Nesse caso, os 160 GB integrados e os tipos de dados eficientes devem se traduzir em mais sessões simultâneas por watt e menos surpresas no cluster à medida que os comprimentos das sequências aumentam.

Gaudi 3: Rack-Scale referenciável para modelos grandes e inferência em tempo real

O Gaudi 3 abrange desde implementações PCIe até configurações completas em escala de rack, oferecendo um caminho para escalabilidade sem a necessidade de uma mudança arquitetônica radical. O novo design de referência em escala de rack é voltado para empresas que padronizam a inferência de modelos complexos e sistemas de tempo real com baixa latência.

Dell PowerEdge XE7740 Intel Gaudi 3 GPUs

Elementos chave:

  • A sequência PCIe-para-rack começa com placas PCIe nos servidores atuais e se estende aos racks, conforme determinado pelos tamanhos dos modelos, simultaneidade e perfis de SLA. Essa abordagem, uma estratégia corporativa comum, ajuda a minimizar os riscos do projeto.
  • Suporta até 64 aceleradores por rack com 8.2 TB de memória de alta largura de banda. O principal recurso, o domínio de memória (HBD), permite mais parâmetros e contextos de memória mais longos, resultando em menos quedas de desempenho e latência de cauda mais consistente.
  • As opções de resfriamento líquido são essenciais em densidades de aceleradores onde o resfriamento a ar por si só limita a inferência sustentada.
  • A orquestração envolve uma pilha de software aberta, como Kubernetes, servidores de modelo padrão e estruturas populares, o que simplifica a integração com arquiteturas MLOps e service-mesh existentes.

Na inferência de produção, fatores como topologia de memória e gerenciamento térmico consistente superam o desempenho teórico máximo. O rack Gaudi 3, que possui 8.2 TB de HBM em 64 aceleradores, atende a necessidades práticas como carregar múltiplas variantes grandes, gerenciar prompts longos e lidar com picos de processamento sem causar sobrecarga. O resfriamento líquido não é apenas opcional nessas densidades; é essencial para manter o QPS e a latência sob estresse térmico.

Timeline

  • Software: A pilha de software unificada e aberta da Intel está sendo preparada nas GPUs Arc Pro Série B para dar aos desenvolvedores uma janela inicial para otimização e integração de CI/CD.
  • Ilha Crescente: Amostragem de clientes projetada para o 2º semestre de 26. Planeje avaliações sobre prontidão de software, perfis de serviço baseados em memória e restrições de data center refrigerado a ar.
  • Gaudi 3 prateleiras: Os projetos de referência especificam até 64 aceleradores/rack, 8.2 TB de HBM e resfriamento líquido, alinhando instalações e envelopes de energia/resfriamento antecipadamente com suas equipes de DC/colo.

Envolva-se com a StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Haroldo Fritts

Estou na indústria de tecnologia desde que a IBM criou a Selectric. Minha formação, porém, é escrever. Então decidi sair do negócio de pré-vendas e voltar às minhas raízes, escrevendo um pouco, mas ainda envolvido com tecnologia.