A OpenAI lançou nesta terça-feira (29) o GPT 6.1 Sol, apenas uma semana depois da estreia do GPT 6 Sol. A nova versão chega com avanços em programação, uso de computadores e tarefas profissionais e, segundo a empresa, aproxima o desempenho do GPT 6 Astra com preços de entrada e saída equivalentes a um quinto dos cobrados pelo modelo mais avançado.

O modelo está disponível para usuários Plus, Pro, Business, Enterprise e Edu no ChatGPT Work e no Codex, além da API. Por enquanto, o GPT 6.1 Sol não está disponível no ChatGPT convencional.

Na API, a OpenAI cobra US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Entradas recuperadas do cache custam US$ 0,10 por milhão de tokens, metade do preço cobrado pelo GPT 6 Sol e 95% abaixo da entrada sem cache.

A redução é especialmente relevante para agentes que reutilizam grandes volumes de contexto entre diferentes requisições, uma vez que uma parcela maior do processamento pode recorrer a informações já armazenadas.

GPT 6.1 Sol se aproxima do Astra em testes da OpenAI

No DeepSWE v1.1, voltado a tarefas complexas de engenharia de software em projetos reais, a OpenAI afirma que o GPT 6.1 Sol igualou o GPT 6 Astra por aproximadamente um quinto do custo por tarefa. O resultado também ficou 6,4 pontos acima do melhor desempenho do GPT 6 Sol, mesmo utilizando menor nível de raciocínio e custo.

A empresa relata ganhos semelhantes em tarefas de automação e uso de computadores. No OSWorld 2.0, o novo modelo ficou 2,1 pontos abaixo do Astra no nível máximo de raciocínio, mas com custo por tarefa próximo de um sétimo. No AutomationBench, usado para avaliar fluxos de trabalho corporativos com várias etapas, o avanço sobre o GPT 6 Sol foi de 4,8 pontos no mesmo nível de raciocínio.

Também houve melhora na precisão factual em testes internos com perguntas deliberadamente difíceis. Em baixo nível de raciocínio, a parcela de respostas contendo pelo menos um erro factual caiu de 11,4% no GPT 6 Sol para 7,7% no GPT 6.1 Sol, redução de aproximadamente 32%. A própria OpenAI ressalta que esse conjunto de testes foi construído para provocar erros e não representa o uso cotidiano do modelo.

O Astra ainda mantém vantagem em algumas tarefas mais exigentes. No Terminal Bench Science, por exemplo, alcançou a maior pontuação entre os modelos avaliados, e a OpenAI continua recomendando seu uso para trabalhos científicos de maior complexidade.

A companhia também afirma que o GPT 6.1 Sol melhorou em avaliações de alinhamento, com maior transparência sobre limitações e menor incidência de ações não autorizadas em tarefas com agentes. Os resultados divulgados, porém, foram obtidos nos ambientes de pesquisa e API da própria OpenAI e podem diferir do comportamento observado em produtos finais.

Nos próximos dias, a empresa planeja lançar o GPT 6.1 Sol Ultrafast, versão que poderá gerar tokens até oito vezes mais rápido que a velocidade padrão no Codex.

Continue no Radar