CoreWeave (Estados Unidos) es una nube de IA que añadió una capa propia de serving de modelos, CoreWeave Inference, disponible en tres formatos: endpoints serverless cobrados por token, despliegues dedicados con pesos propios e inferencia autogestionada sobre el Kubernetes de la plataforma.
Para qué sirve
- Llamar modelos por un endpoint compatible con la API de OpenAI, sin aprovisionar GPU
- Publicar modelos propios o ajustados en despliegues dedicados, con vLLM o SGLang
- Ejecutar inferencia en el mismo entorno donde el equipo ya entrena y ajusta modelos
Cómo funciona
- El modo serverless se usa con una clave de W&B Inference y se cobra por token consumido
- Los despliegues dedicados reservan capacidad de GPU y aceptan pesos propios
- Quien busca control total puede operar el serving dentro del Kubernetes gestionado de CoreWeave
- La plataforma se encarga del escalado, las réplicas y los endpoints compatibles en los tres formatos
Puntos fuertes
- Entrenamiento y serving en la misma infraestructura, sin mover pesos entre nubes
- Endpoints compatibles con OpenAI reducen el trabajo de integración
- Catálogo serverless con modelos abiertos de varios proveedores
Puntos de atención
- El cobro por token aplica al modo serverless; la capacidad dedicada y las instancias siguen precio por GPU-hora
- El núcleo del negocio sigue siendo infraestructura de GPU, así que la ficha cubre la capa de serving
- Parte del catálogo y de las funciones corporativas requiere contacto comercial

