The Infrastructure Behind AI

Do cluster ao circuito: a observabilidade integrada mantém os sistemas de IA em funcionamento

Garantir a integridade dos sistemas de IA exige visibilidade completa dos sistemas de computação e da infraestrutura das instalações

Claudio Frazão
Victor Arnaud
Do cluster ao circuito: a observabilidade integrada mantém os sistemas de IA em funcionamento

TL:DR

  • A infraestrutura de IA exige observabilidade tanto dos clusters de computação quanto dos sistemas das instalações, já que é na lacuna entre esses ambientes que as interrupções ocorrem com mais frequência.

  • A integração da telemetria das instalações do Equinix Smart View com a orquestração de recursos computacionais do NVIDIA Mission Control cria uma visão operacional unificada dos sistemas de energia, refrigeração e hardware.

  • A observabilidade compartilhada entre a infraestrutura de computação e das instalações permite uma recuperação mais rápida, uma utilização mais eficiente dos recursos e maior resiliência para cargas de trabalho de IA em escala de produção.

As cargas de trabalho modernas de IA estão se tornando cada vez mais poderosas. As empresas estão adotando agentes de IA capazes de se integrar entre si e perseguir objetivos comuns sem intervenção humana. Segundo uma previsão da IDC, os investimentos em IA agêntica chegarão a US$ 1,3 trilhão até 2029, representando mais de 26% dos orçamentos totais de TI em todo o mundo.[1] 

À medida que as empresas ampliam o uso da IA, também aumentam suas dependências. Quanto mais recursos e permissões concedem aos agentes, maior é o risco quando esses agentes não conseguem funcionar corretamente. Garantir uma infraestrutura de IA resiliente tornou-se uma prioridade para os líderes empresariais, porque, quando essa infraestrutura fica indisponível, processos de negócios automatizados essenciais também são interrompidos. As organizações que conseguirem escalar a IA de forma mais eficaz serão aquelas capazes de detectar, isolar e se recuperar de interrupções antes que elas afetem as operações do negócio.

Felizmente, já temos um modelo para a resiliência da IA: detectar interrupções rapidamente e automatizar a recuperação para minimizar o tempo de inatividade. Quando a Meta treinou seu modelo Llama 3 usando GPUs NVIDIA, registrou 419 interrupções inesperadas em 54 dias, mas ainda assim alcançou 90% de tempo efetivo de treinamento, graças à manutenção automatizada do cluster.[2]

Esse tipo de resposta automatizada exige observabilidade. O desafio é que a infraestrutura de IA não funciona como um único sistema. Tanto os clusters de computação quanto as operações das instalações geram sinais críticos, mas esses sinais normalmente são gerenciados separadamente. À medida que as cargas de trabalho de IA se tornam mais distribuídas e consomem mais energia, essa separação passa a representar um risco operacional.

Esses sinais estão presentes tanto no software de orquestração que monitora o cluster de computação de IA quanto no software de gerenciamento da infraestrutura do data center (DCIM), que monitora os sistemas de energia e refrigeração. Tradicionalmente, essas soluções não conseguem se integrar entre si. É justamente nessa lacuna entre o hardware e o data center que as interrupções de IA tendem a se originar.

Para garantir uma infraestrutura de IA confiável, as equipes precisam de uma visão integrada que abranja tanto a computação quanto as instalações. Como costumamos dizer, elas precisam de observabilidade do cluster ao circuito. Essa mudança representa mais do que um monitoramento melhor. Trata-se de um novo modelo operacional para a infraestrutura de IA, no qual a orquestração da computação e as operações do data center trabalham a partir da mesma visão, em vez de responderem de forma independente ao mesmo evento.

Uma infraestrutura de IA resiliente depende da observabilidade do data center

As cargas de trabalho de IA são, por natureza, mais densas do que a TI convencional. As GPUs atuais podem consumir até 200 quilowatts por rack, em comparação com os 10 a 20 kW para os quais os data centers tradicionais foram projetados. Esse nível de densidade exige refrigeração líquida, o que introduz novos riscos que não existem em sistemas refrigerados a ar.

Por exemplo, as organizações precisam estar atentas a questões relacionadas à temperatura, pressão e vazão do líquido refrigerante, além do risco de vazamentos. E, como uma única unidade de distribuição de líquido refrigerante (CDU) pode atender a um cluster de computação inteiro, basta um pequeno problema para causar uma interrupção significativa.

Os sistemas de energia são outra fonte comum de falhas na infraestrutura de IA. De fato, o relatório anual mais recente do Uptime Institute sobre interrupções constatou que os problemas de energia foram, mais uma vez, a principal causa de interrupções significativas em data centers.[3] Esses problemas podem incluir desde limitações da rede elétrica, no nível da concessionária, até falhas em sistemas UPS, chaves de transferência e geradores, no nível das instalações.

A densidade cada vez maior das cargas de trabalho de IA atuais só tende a agravar esses problemas de energia. E, assim como ocorre com a refrigeração, até mesmo problemas relativamente pequenos nos sistemas de energia podem ter um impacto extremamente significativo. Isso é especialmente verdadeiro para tarefas de treinamento síncrono de IA. Quando até mesmo um único nó fica offline, milhares de outros permanecem ociosos enquanto a tarefa se recupera.

Os operadores de data centers devem oferecer redundância para os sistemas de refrigeração e energia, mas isso só é útil se o ambiente de computação for projetado para tirar proveito dessa redundância.

Muitos dos sinais de alerta que indicam uma possível interrupção vêm dos sistemas de energia e refrigeração. Por isso, é problemático quando as equipes de TI que gerenciam clusters de IA não conseguem acessar a telemetria das instalações. Quando surge um problema — como um circuito elétrico se aproximando do limite ou a temperatura do líquido refrigerante saindo da faixa padrão — elas só ficam sabendo depois que a equipe das instalações as notifica manualmente.

Esse atraso inevitavelmente leva a GPUs ociosas. Por outro lado, quando a equipe das instalações e a equipe de TI compartilham a mesma observabilidade, ambas ficam sabendo do problema ao mesmo tempo, eliminando esse atraso.

Equinix Smart View e NVIDIA Mission Control eliminam a lacuna de observabilidade

O NVIDIA Mission Control é a solução de inteligência de software que opera um NVIDIA DGX SuperPOD. Ele é responsável por agendar tarefas, monitorar GPUs, redes e armazenamento e automatizar a recuperação.

O Equinix Smart View é nossa solução de DCIM. Ele coleta dados operacionais dos data centers, incluindo:

  • Consumo de energia no nível do circuito
  • Temperatura e umidade em gabinetes, cages e sensores
  • Status de ativos mecânicos e elétricos

Essas duas soluções são integradas para oferecer uma visão completa dos dois lados da equação: o hardware e os sistemas de energia e refrigeração que mantêm esse hardware em funcionamento.

A telemetria das instalações do Smart View é enviada ao Mission Control por meio dos recursos de integração com sistemas de gerenciamento predial (BMS) da NVIDIA.[4] Isso significa que as equipes de TI agora podem visualizar informações sobre os sistemas de energia e refrigeração no mesmo lugar onde já acessam dados sobre computação, rede e armazenamento.

O Equinix Smart View leva a telemetria das instalações ao NVIDIA Mission Control

A observabilidade integrada permite agir, não apenas enxergar

O valor da observabilidade integrada não está simplesmente em visualizar mais dados, mas em viabilizar a manutenção preditiva da infraestrutura. Quando a orquestração da computação e as operações das instalações compartilham o mesmo contexto operacional, as organizações conseguem detectar problemas mais cedo, automatizar respostas e reduzir falhas em cascata que podem interromper cargas de trabalho de IA em grande escala.

A integração entre o Smart View e o Mission Control viabiliza tanto recursos de automação para a recuperação da computação quanto a intervenção manual de profissionais de operações qualificados.

Do lado da computação, o Autonomous Recovery Engine do Mission Control pode reiniciar tarefas que falharam a partir do checkpoint mais recente, sem necessidade de intervenção humana. Segundo a NVIDIA, isso pode ser até dez vezes mais rápido do que recuperar tarefas manualmente.[5] 

O Mission Control também inclui recursos avançados de otimização de energia. Quando combinado à telemetria das instalações do Smart View, ele pode ajustar o consumo de energia das GPUs à quantidade real de energia que o circuito é capaz de fornecer. Isso permite que as organizações aproveitem ao máximo a capacidade pela qual já estão pagando. Em contrapartida, definir um limite estático com base no que o circuito talvez seja capaz de fornecer pode resultar em subutilização e ineficiência.

A telemetria das instalações também ajuda a identificar os circuitos mais adequados para dar suporte às tarefas de recuperação. Caso contrário, o sistema pode transferir uma carga de trabalho de recuperação para um circuito que já esteja em risco, criando as condições para que o problema que causou a falha se repita.

A automação acelera a recuperação, mas operações de IA resilientes ainda dependem de uma ação coordenada entre o software e a infraestrutura física. Isso porque a automação contém o problema e protege a carga de trabalho naquele momento, mas não resolve a causa raiz. Isso só pode ser feito do lado das instalações. Seja um circuito sobrecarregado ou um vazamento de líquido refrigerante, eventos físicos no data center exigem uma resposta humana.

A equipe de operações do data center responde aos sinais das instalações enviando um técnico ao local para reparar ou substituir o sistema afetado. A integração com a observabilidade da computação ajuda essa equipe a responder aos problemas mais rapidamente. Ela já sabe exatamente qual circuito ou loop de refrigeração causou o problema, porque pôde acompanhar a reação do cluster quase em tempo real.

Quando os recursos de automação do lado da computação e a equipe de operações do lado das instalações compartilham a mesma visão, do cluster ao circuito, eles podem trabalhar juntos para manter uma fábrica de IA operando em todo o seu potencial no longo prazo.

O que a observabilidade integrada significa para os líderes empresariais

O futuro das operações de IA depende de tratar a infraestrutura de computação e a infraestrutura das instalações como um único sistema operacional integrado. À medida que as cargas de trabalho de IA se tornam mais densas, mais autônomas e mais críticas para os negócios, as organizações que se anteciparem às falhas — em vez de apenas reagirem a elas — alcançarão maior utilização, mais resiliência e melhores retornos sobre seus investimentos em IA.

Com a integração entre o Equinix Smart View e o NVIDIA Mission Control, as organizações passam a ter uma visão operacional unificada dos sistemas de computação e das instalações. As equipes de TI não precisam mais reagir às falhas de hardware somente depois que elas acontecem. Agora, elas sabem quando é provável que uma falha ocorra e, mais importante, sabem por quê. O resultado é uma recuperação mais rápida, uma utilização mais eficiente da infraestrutura e maior confiança para executar cargas de trabalho de IA em escala de produção.

 

Essa integração é o desenvolvimento mais recente da Equinix AI Factory acelerada pela NVIDIA. Com essa solução pronta para uso, as organizações podem implementar uma infraestrutura de IA NVIDIA de propriedade privada, instalada, monitorada e mantida por nossas equipes de serviços gerenciados. Graças ao nosso portfólio de mais de 280 data centers de colocation distribuídos por 77 áreas metropolitanas globais, elas podem implementar essa infraestrutura onde ela gera mais valor para os negócios e, ao mesmo tempo, manter a resiliência operacional.

No futuro, a observabilidade integrada será um recurso fundamental para uma IA resiliente e em escala de produção. Ao conectar a visibilidade do cluster ao circuito, a Equinix ajuda as empresas a construir uma infraestrutura de IA projetada para escalar com confiança.

Saiba mais sobre as soluções conjuntas da Equinix e da NVIDIA para IA empresarial: leia nosso resumo da solução (em inglês).

 

[1] IDC Blog, Agentic AI to Dominate IT Budget Expansion Over Next Five Years, Exceeding 26% of Worldwide IT Spending, and $1.3 Trillion in 2029, According to IDC, August 26, 2025.

[2] Llama Team, AI @ Meta, The Llama 3 Herd of Models, July 23, 2024.

[3] Douglas Donnellan, Andy Lawrence, Rose Weinschenk, Annual outage analysis 2026, Uptime Intelligence, May 11, 2026.

[4] NVIDIA Mission Control Integration with Building Management System

[5] NVIDIA Mission Control

Avatar photo
Claudio Frazão Senior Manager, Managed Services Solution Development
Avatar photo
Victor Arnaud Managing Director, Brazil
Subscribe to the Equinix Blog