OpenAI lanzó una vista previa del modo Ultrafast para el modelo GPT-5.6 Sol, capaz de generar hasta 750 tokens de salida por segundo.
La aceleración es proporcionada por Cerebras, con quien OpenAI firmó una asociación de US$ 10 mil millones a principios de este año. Inicialmente, el servicio estará disponible solo a través de la API de OpenAI y para clientes seleccionados, con expansión gradual a medida que aumente la capacidad.
Según OpenAI, el modo combina la velocidad de modelos más pequeños con la capacidad completa de un modelo de razonamiento grande, lo que la empresa llama "más trabajo útil por segundo".
Casos de uso
OpenAI afirma que ya usa el modo internamente para respuesta a incidentes, permitiendo analizar registros, cambios de código e informes durante una interrupción. En finanzas, el modelo puede evaluar señales de mercado y señalar transacciones sospechosas. En el soporte al cliente, las consultas complejas pueden resolverse en tiempo real, y en el comercio electrónico, puede responder preguntas, verificar inventarios y personalizar recomendaciones antes de que el comprador desista.
En el área de investigación, los experimentos que antes se ejecutaban durante la noche como tareas por lotes pueden convertirse en sesiones interactivas, lo que permite probar una idea, revisar resultados y ajustar el enfoque sin interrumpir el flujo de trabajo.
Velocidad como diferencial de precio
OpenAI ya ofrece niveles de velocidad en la API. El Fast Mode promete hasta 2,5 veces la velocidad con menor latencia para el GPT-5.6 Sol, por aproximadamente el doble del precio. El Ultrafast añade un tercer nivel, más rápido y posiblemente más caro.
La lógica se asemeja a la de los proveedores de nube, como AWS, que cobran más por el mismo servicio en niveles más altos de rendimiento. Con ello, OpenAI puede beneficiarse directamente de los ingresos generados por una inferencia más rápida.



