NVIDIA NIM es la capa de microservicios de NVIDIA para ejecutar inferencia de modelos en contenedores optimizados. Los microservicios corren en la infraestructura del cliente — nube, data center o estación de trabajo con GPU RTX — y se licencian por NVIDIA AI Enterprise para uso en producción. NVIDIA mantiene además un catálogo de endpoints alojados para pruebas, build.nvidia.com.
Para qué sirve
- Estandarizar la ejecución de modelos abiertos y de la familia NVIDIA en contenedores listos
- Llevar el mismo endpoint compatible con OpenAI entre nubes y entornos on-premise
- Probar modelos en el catálogo alojado antes de decidir dónde desplegar
Cómo funciona
- Cada modelo llega en un contenedor con servidor de inferencia, perfil de GPU y API estandarizados
- Los microservicios se integran con Kubernetes y con los orquestadores que ya usa el cliente
- El catálogo alojado entrega claves de API para prototipar y corre sobre la infraestructura de NVIDIA
- La versión certificada añade soporte empresarial y ciclos de actualización de largo plazo
Puntos fuertes
- Paquete listo para producción, sin montar el servidor de inferencia desde cero
- Portabilidad entre proveedores de nube y entornos locales
- El catálogo alojado permite evaluar modelos sin instalar nada
Puntos de atención
- Es software para desplegar, no una plataforma que aloja el modelo por ti; producción exige licencia
- Los endpoints alojados están pensados para evaluación y prototipado
- No confundir con la nube de GPU de NVIDIA ni con gateways de enrutamiento

