OpenAI ha presentado GPT-6 Sol y GPT-6 Luna, incorporaciones de menor coste a su familia de modelos GPT-6.
Los modelos ya están disponibles a través de la API, y su despliegue está en marcha en ChatGPT Work y Codex.
Las pruebas independientes detectaron costes sustancialmente más bajos por tarea, aunque las mejoras de rendimiento variaron entre los distintos benchmarks.
OpenAI ha presentado GPT-6 Sol y GPT-6 Luna como alternativas más rápidas y económicas a GPT-6 Astra, que sigue siendo su modelo de mayor rendimiento. Los lanzamientos son relevantes principalmente porque reducen los costes de tokens y de ejecución de tareas, al tiempo que trasladan algunas de las mejoras de Astra a modelos de menor precio.
OpenAI afirmó que entrenó Sol y Luna mediante los mismos métodos aplicados a Astra. La empresa incorporó algunos de los avances de su modelo insignia en tareas profesionales, programación, uso de ordenadores, precisión factual y alineamiento.
Sol está dirigido a trabajo complejo y tareas agénticas, mientras que Luna está destinado principalmente a operaciones de gran volumen en las que la velocidad y el coste son prioridades. Ambos modelos están disponibles a través de la API de OpenAI, y la empresa ha comenzado a desplegarlos en ChatGPT Work y Codex.
Precios y resultados de benchmarks
GPT-6 Sol cuesta 2 dólares por cada 1 millón de tokens de entrada y 10 dólares por cada 1 millón de tokens de salida, frente a 4 dólares y 20 dólares, respectivamente, para GPT-5.6 Sol. GPT-6 Luna cuesta 0,10 dólares por cada 1 millón de tokens de entrada y 0,50 dólares por cada 1 millón de tokens de salida, frente a 0,20 dólares y 1,20 dólares para su predecesor.
OpenAI también afirmó que GPT-6 Sol cometió aproximadamente la mitad de errores que GPT-5.6 Sol en una prueba interna de precisión factual. Con un nivel alto de razonamiento, la empresa afirmó que Luna tuvo un rendimiento comparable al de GPT-5.6 Sol en esa métrica, a cerca de una centésima parte del coste.
En AutomationBench, GPT-6 Sol obtuvo un 33,2% con el nivel de razonamiento xhigh, frente al 26,9% de Claude Opus 5 con su configuración máxima. OpenAI estimó que el coste por tarea de Sol fue aproximadamente 11 veces inferior. GPT-6 Astra obtuvo un 30,3% con el nivel low.
Sol obtuvo un 68,8% en el benchmark de programación DeepSWE v1.1, frente al 69,9% de Claude Fable 5, pero OpenAI estimó que Sol completó la tarea con un coste aproximadamente un 80% inferior. Luna obtuvo un 66,6%, un resultado que la empresa comparó con Claude Opus 5 y Fable 5 con un nivel medio de razonamiento.
En el benchmark de control informático OSWorld 2.0, Sol obtuvo un 60,5%, frente al 60,3% de Claude Opus 5 con el nivel medio. OpenAI estimó que el coste por tarea de Sol fue aproximadamente un 80% inferior. Las comparaciones no incluyeron Claude Opus 5.5, que Anthropic presentó el mismo día.
Evaluación independiente
La plataforma de pruebas independiente Artificial Analysis otorgó a GPT-6 Sol 48 puntos en el nivel superior de su índice propietario Intelligence Index, mientras que Luna recibió 37. Claude Opus 5.5 obtuvo 58 puntos en el nivel superior y ocupó el primer puesto en el momento de las pruebas.
Artificial Analysis concluyó que la eficiencia era la principal ventaja de los nuevos modelos. El coste estimado por tarea del Intelligence Index se redujo a 1,06 dólares para Sol, desde aproximadamente 1,99 dólares para GPT-5.6 Sol, mientras que el coste de Luna cayó a 0,07 dólares desde 0,18 dólares.
Sol ganó dos puntos frente a su predecesor en el Coding Agent Index, mientras que Luna perdió dos puntos. Artificial Analysis observó mejoras en algunas pruebas de automatización y programación, pero un rendimiento más débil en varias tareas relacionadas con trabajo profesional basado en conocimientos.
Reacciones iniciales
El consejero delegado de OpenAI, Sam Altman, afirmó que Sol y Luna superaron de forma significativa a la generación GPT-5.6 en inteligencia, programación, uso de ordenadores y otras áreas. También destacó sus menores precios por token y costes de finalización de tareas.
En otra publicación, Altman sostuvo que el coste por tarea completada era más importante que el precio por token y afirmó que los nuevos modelos de OpenAI no tenían equivalentes en el mercado según esa medida. Esa fue la valoración de Altman, no una conclusión de pruebas independientes.
Artificial Analysis ofreció una visión más cautelosa y afirmó que Sol y Luna ampliaron la frontera entre precio y rendimiento, pero se mantuvieron cerca de la generación GPT-5.6 en el Intelligence Index y el Coding Agent Index generales. Sus pruebas individuales mostraron tanto mejoras como retrocesos.
El experto en productos Peter Young afirmó que, subjetivamente, Sol le pareció mejor que GPT-5.6, aunque prefería Claude Opus 5.5 para el trabajo diario y lo situó por encima de Fable y Astra. El empresario de IA Matt Shumer también describió Sol como de alta calidad, pero afirmó que seguía prefiriendo GPT-6 Astra o Claude Fable 5.1 para el trabajo diario y que esperaba añadir Opus 5.5 a esa lista.
El desarrollador David Kramer elogió la combinación de precio, capacidades y velocidad aceptable de Luna, y la calificó como una de las opciones más equilibradas del mercado.
En conjunto, las pruebas independientes iniciales y los comentarios de usuarios indican que Sol y Luna modifican principalmente la economía del uso de los modelos de OpenAI. Sus menores costes van acompañados de mejoras en algunas tareas, pero las pruebas no han mostrado un salto de rendimiento generalizado frente a la generación anterior.
Fuente: HODL Press
