A OpenAI lançou o GPT-6 Sol e o GPT-6 Luna, adições de menor custo à sua família de modelos GPT-6. Os modelos já estão disponíveis por meio da API, com implantação em curso no ChatGPT Work e no Codex, e são relevantes sobretudo por reduzirem os custos de tokens e de execução de tarefas.
Testes independentes constataram custos de tarefas substancialmente menores, embora os ganhos de desempenho variassem entre os benchmarks.
A OpenAI lançou o GPT-6 Sol e o GPT-6 Luna como alternativas mais rápidas e baratas ao GPT-6 Astra, que continua sendo seu modelo de maior desempenho. Os lançamentos são relevantes principalmente porque reduzem os custos de tokens e de execução de tarefas, ao mesmo tempo que incorporam aos modelos de menor preço parte dos avanços do Astra.
A OpenAI disse ter treinado o Sol e o Luna usando os mesmos métodos aplicados ao Astra. A empresa incorporou alguns dos avanços de seu modelo principal em tarefas profissionais, programação, uso de computadores, precisão factual e alinhamento.
O Sol é destinado a trabalhos complexos e tarefas agentivas, enquanto o Luna é voltado principalmente a operações de alto volume nas quais velocidade e custo são prioridades. Ambos os modelos estão disponíveis por meio da API da OpenAI, e a empresa começou a implantá-los no ChatGPT Work e no Codex.
Preços e resultados de benchmarks
O GPT-6 Sol custa US$ 2 por 1 milhão de tokens de entrada e US$ 10 por 1 milhão de tokens de saída, ante US$ 4 e US$ 20, respectivamente, para o GPT-5.6 Sol. O GPT-6 Luna custa US$ 0,10 por 1 milhão de tokens de entrada e US$ 0,50 por 1 milhão de tokens de saída, abaixo dos US$ 0,20 e US$ 1,20 de seu antecessor.
A OpenAI também disse que o GPT-6 Sol cometeu cerca de metade dos erros do GPT-5.6 Sol em um teste interno de precisão factual. Em um nível alto de raciocínio, a empresa afirmou que o Luna teve desempenho comparável ao GPT-5.6 Sol nessa métrica por cerca de um centésimo do custo.
No AutomationBench, o GPT-6 Sol obteve 33,2% no nível de raciocínio xhigh, em comparação com 26,9% para o Claude Opus 5 em sua configuração máxima. A OpenAI estimou que o custo por tarefa do Sol era cerca de 11 vezes menor. O GPT-6 Astra obteve 30,3% no nível low.
O Sol obteve 68,8% no benchmark de programação DeepSWE v1.1, contra 69,9% do Claude Fable 5, mas a OpenAI estimou que o Sol concluiu a tarefa a um custo cerca de 80% menor. O Luna obteve 66,6%, resultado que a empresa comparou ao Claude Opus 5 e ao Fable 5 em um nível médio de raciocínio.
No benchmark de controle de computador OSWorld 2.0, o Sol obteve 60,5%, em comparação com 60,3% do Claude Opus 5 no nível médio. A OpenAI estimou que o custo por tarefa do Sol era cerca de 80% menor. As comparações não incluíram o Claude Opus 5.5, que a Anthropic lançou no mesmo dia.
Avaliação independente
A plataforma independente de testes Artificial Analysis atribuiu ao GPT-6 Sol 48 pontos no nível mais alto de seu Índice de Inteligência proprietário, enquanto o Luna recebeu 37. O Claude Opus 5.5 obteve 58 pontos no nível mais alto e ocupava a primeira posição no momento dos testes.
A Artificial Analysis concluiu que a eficiência era a principal vantagem dos novos modelos. O custo estimado por tarefa do Índice de Inteligência caiu para US$ 1,06 no caso do Sol, de cerca de US$ 1,99 para o GPT-5.6 Sol, enquanto o custo do Luna caiu para US$ 0,07, de US$ 0,18.
O Sol ganhou dois pontos em relação a seu antecessor no Índice de Agentes de Programação, enquanto o Luna perdeu dois pontos. A Artificial Analysis observou melhorias em alguns testes de automação e programação, mas desempenho mais fraco em diversas tarefas que envolvem trabalho profissional baseado em conhecimento.
Reações iniciais
O CEO da OpenAI, Sam Altman, disse que o Sol e o Luna superaram significativamente a geração GPT-5.6 em inteligência, programação, uso de computadores e outras áreas. Ele também enfatizou seus preços menores por token e custos menores para conclusão de tarefas.
Em outra publicação, Altman argumentou que o custo por tarefa concluída era mais importante do que o preço dos tokens e disse que os novos modelos da OpenAI não tinham equivalentes no mercado por essa métrica. Essa foi a avaliação de Altman, e não uma conclusão de testes independentes.
A Artificial Analysis adotou uma visão mais moderada, afirmando que o Sol e o Luna ampliaram a fronteira de preço e desempenho, mas permaneceram próximos da geração GPT-5.6 no Índice de Inteligência geral e no Índice de Agentes de Programação. Seus testes individuais mostraram tanto ganhos quanto regressões.
O especialista em produtos Peter Young disse que, subjetivamente, o Sol parecia melhor do que o GPT-5.6, embora preferisse o Claude Opus 5.5 para o trabalho diário e o classificasse acima do Fable e do Astra. O empreendedor de IA Matt Shumer também descreveu o Sol como de alta qualidade, mas disse que ainda preferia o GPT-6 Astra ou o Claude Fable 5.1 para o trabalho diário e esperava adicionar o Opus 5.5 a essa lista.
O desenvolvedor David Kramer elogiou a combinação de preço, capacidades e velocidade aceitável do Luna, chamando-o de uma das opções mais equilibradas do mercado.
Em conjunto, os testes independentes iniciais e o feedback dos usuários indicam que o Sol e o Luna mudam principalmente a economia do uso dos modelos da OpenAI. Seus custos menores acompanham melhorias em algumas tarefas, mas os testes não demonstraram um salto de desempenho generalizado em relação à geração anterior.
Fonte: HODL Press
