O NVIDIA NIM é a camada de microserviços da NVIDIA para executar inferência de modelos em containers otimizados. Os microserviços rodam na infraestrutura do cliente — nuvem, data center ou estação de trabalho com GPU RTX — e são licenciados pelo NVIDIA AI Enterprise para uso em produção. A NVIDIA mantém ainda um catálogo de endpoints hospedados para testes, o build.nvidia.com.
Para que serve
- Padronizar a execução de modelos abertos e da família NVIDIA em containers prontos
- Levar o mesmo endpoint compatível com OpenAI entre nuvens e ambientes on-premise
- Testar modelos no catálogo hospedado antes de decidir onde implantar
Como funciona
- Cada modelo vem em um container com servidor de inferência, perfil de GPU e API padronizados
- Os microserviços se integram a Kubernetes e aos orquestradores já usados no ambiente do cliente
- O catálogo hospedado libera chaves de API para prototipagem e roda sobre a infraestrutura da NVIDIA
- A versão certificada adiciona suporte empresarial e ciclos de atualização de longo prazo
Pontos fortes
- Pacote pronto para produção, sem montar o servidor de inferência do zero
- Portabilidade entre provedores de nuvem e ambientes locais
- Catálogo hospedado permite avaliar modelos sem instalar nada
Pontos de atenção
- É software para implantar, não uma plataforma que hospeda o modelo por você; a produção exige licença
- Os endpoints hospedados são voltados a avaliação e prototipagem
- Não confundir com a nuvem de GPU da própria NVIDIA nem com gateways de roteamento

