OpenAI y Google anunciaron el jueves (13) nuevas ofertas de inteligencia artificial que convierten la velocidad en un elemento de fijación de precios. OpenAI presentó el nivel Ultrafast, en vista previa para un pequeño grupo de clientes, y Google lanzó el modelo Gemini 3.7 Flash.

En el anuncio, OpenAI afirmó que el nivel Ultrafast ejecuta el modelo GPT-5.6 Sol hasta 14 veces más rápido que el nivel estándar, con hasta 750 tokens de salida por segundo. El modelo en sí es el mismo; la respuesta sale más rápida porque se ejecuta en chips de Cerebras. Los primeros clientes incluyen Jane Street, Podium, Basis y Rogo, que prueban la tecnología para programación, investigación financiera, atención al cliente, voz y comercio.

“Hasta ahora, obtener velocidad en tiempo real normalmente significaba elegir un modelo más pequeño o más especializado. Ultrafast apunta al progreso en una nueva dirección: más trabajo útil por segundo”, dice el anuncio.

Gemini 3.7 Flash cuesta la mitad hasta fin de año

En el mismo día, Google lanzó el Gemini 3.7 Flash. El modelo cuesta US$ 0,75 por millón de tokens de entrada y US$ 3,75 por millón de tokens de salida hasta el 31 de diciembre, la mitad del precio del Flash anterior. A partir del 1 de enero de 2027, el precio se duplica y pasa a ser el mismo que cobraba el Gemini 3.6 Flash. En el comunicado, Google afirmó que el Gemini 3.7 Flash es el “modelo de trabajo más inteligente hasta ahora para codificación y agentes”.

La empresa de benchmarking Artificial Analysis midió la salida del Gemini 3.7 Flash en alrededor de 340 tokens por segundo, casi tres veces la velocidad del GPT-5.6 Terra y del GLM-5.2, y colocó el modelo en la frontera entre inteligencia y tiempo por tarea.

La fijación de precios de la IA se divide entre carril rápido y lento

Los lanzamientos apuntan al mismo cambio: durante dos años, el precio de la IA dependió básicamente de la capacidad del modelo y del volumen de uso. La velocidad se convierte en un tercer recurso por el cual las empresas pasan a pagar por separado.

No toda tarea de IA necesita ser rápida. Un banco que verifica si una transacción es fraudulenta necesita decidir en fracciones de segundo. Según el informe “Where Payment Decisions Happen: How Issuer Data Is Powering the Next Era of Commerce”, de PYMNTS Intelligence, la detección de fraude por IA ya ha ahorrado al menos US$ 5 millones para el 42% de los emisores de tarjetas. La verificación lenta de fraude puede dejar pasar un cobro fraudulento antes de que el sistema lo detecte.

En el anuncio de Ultrafast, OpenAI citó aplicaciones de voz, atención al cliente, comercio, programación e investigación financiera como tareas para el nuevo nivel, además de respuesta a incidentes, que incluye amenazas de fraude y seguridad que exigen una decisión rápida. En cambio, una empresa que ejecuta una tarea de IA durante la noche para organizar documentos antiguos no tiene a nadie esperando al otro lado. Ese trabajo puede ejecutarse en computadoras más baratas y lentas, sin costo real para el negocio. Es la misma capacidad de IA, con dos precios diferentes, dependiendo solo de que haya alguien esperando la respuesta.

La división de precios se asemeja a la compra de internet: las empresas pagan más por una conexión rápida y garantizada cuando el tiempo importa y usan una conexión más barata y lenta en los demás casos. Cerebras, responsable de los chips del nivel Ultrafast, usó el mismo argumento en su anuncio del jueves, comparando el lanzamiento con cambios anteriores, como la transición de la internet por acceso telefónico a la banda ancha.

Si esa comparación se mantiene, las empresas dividirán sus gastos de IA en dos carriles: IA rápida y cara para tareas en las que la demora cuesta dinero, como atención en vivo o verificación de fraude en tiempo real; IA lenta y más barata para tareas en las que nadie nota la espera, como informes nocturnos o lotes de documentos. Los lanzamientos del jueves sugieren que OpenAI y Google esperan que esa división se vuelva normal.

Sigue en Radar