La OpenAI lanzó este martes (29) el GPT 6.1 Sol, solo una semana después del debut del GPT 6 Sol. La nueva versión llega con avances en programación, uso de computadoras y tareas profesionales y, según la empresa, acerca el rendimiento del GPT 6 Astra con precios de entrada y salida equivalentes a un quinto de los cobrados por el modelo más avanzado.
El modelo está disponible para usuarios Plus, Pro, Business, Enterprise y Edu en ChatGPT Work y en Codex, además de la API. Por ahora, el GPT 6.1 Sol no está disponible en el ChatGPT convencional.
En la API, OpenAI cobra US$ 2 por millón de tokens de entrada y US$ 10 por millón de tokens de salida. Las entradas recuperadas de la caché cuestan US$ 0,10 por millón de tokens, la mitad del precio cobrado por el GPT 6 Sol y 95% por debajo de la entrada sin caché.
La reducción es especialmente relevante para agentes que reutilizan grandes volúmenes de contexto entre diferentes solicitudes, ya que una mayor parte del procesamiento puede recurrir a información ya almacenada.
GPT 6.1 Sol se acerca al Astra en pruebas de OpenAI
En DeepSWE v1.1, orientado a tareas complejas de ingeniería de software en proyectos reales, OpenAI afirma que el GPT 6.1 Sol igualó al GPT 6 Astra por aproximadamente un quinto del costo por tarea. El resultado también quedó 6,4 puntos porcentuales por encima del mejor rendimiento del GPT 6 Sol, incluso utilizando un menor nivel de razonamiento y costo.
La empresa reporta ganancias similares en tareas de automatización y uso de computadoras. En OSWorld 2.0, el nuevo modelo quedó 2,1 puntos porcentuales por debajo del Astra en el nivel máximo de razonamiento, pero con un costo por tarea cercano a un séptimo. En AutomationBench, usado para evaluar flujos de trabajo corporativos con varias etapas, el avance sobre el GPT 6 Sol fue de 4,8 puntos porcentuales en el mismo nivel de razonamiento.
También hubo una mejora en la precisión factual en pruebas internas con preguntas deliberadamente difíciles. En un nivel bajo de razonamiento, la proporción de respuestas que contenían al menos un error factual cayó de 11,4% en GPT 6 Sol a 7,7% en GPT 6.1 Sol, una reducción de aproximadamente 32%. La propia OpenAI resalta que este conjunto de pruebas fue construido para provocar errores y no representa el uso cotidiano del modelo.
Astra aún mantiene ventaja en algunas tareas más exigentes. En Terminal Bench Science, por ejemplo, alcanzó la mayor puntuación entre los modelos evaluados, y OpenAI sigue recomendando su uso para trabajos científicos de mayor complejidad.
La compañía también afirma que el GPT 6.1 Sol mejoró en evaluaciones de alineación, con mayor transparencia sobre limitaciones y menor incidencia de acciones no autorizadas en tareas con agentes. Los resultados divulgados, sin embargo, se obtuvieron en los entornos de investigación y API de la propia OpenAI y pueden diferir del comportamiento observado en productos finales.
En los próximos días, la empresa planea lanzar el GPT 6.1 Sol Ultrafast, una versión que podrá generar tokens hasta ocho veces más rápido que la velocidad estándar en Codex.



