OpenAI hat GPT-6 Sol und GPT-6 Luna als kostengünstigere Ergänzungen seiner GPT-6-Modellfamilie eingeführt. Die Modelle sind bereits über die API verfügbar und werden derzeit in ChatGPT Work und Codex eingeführt; ihre Bedeutung liegt vor allem in niedrigeren Token- und Aufgabenausführungskosten bei gleichzeitiger Übernahme einiger Verbesserungen von Astra in günstigere Modelle.
Unabhängige Tests stellten deutlich niedrigere Kosten pro Aufgabe fest, obwohl die Leistungszuwächse je nach Benchmark unterschiedlich ausfielen.
OpenAI hat GPT-6 Sol und GPT-6 Luna eingeführt – schnellere und günstigere Alternativen zu GPT-6 Astra, das weiterhin das leistungsstärkste Modell des Unternehmens ist. Die Veröffentlichungen sind vor allem deshalb relevant, weil sie die Kosten für Token und Aufgabenausführung senken und zugleich einige von Astras Verbesserungen in preisgünstigere Modelle übertragen.
OpenAI erklärte, Sol und Luna mit denselben Methoden trainiert zu haben, die auch bei Astra zum Einsatz kamen. Das Unternehmen übernahm einige Fortschritte des Flaggschiffmodells bei professionellen Aufgaben, Programmierung, Computernutzung, faktischer Genauigkeit und Alignment.
Sol richtet sich an komplexe Arbeit und agentische Aufgaben, während Luna vor allem für hochvolumige Vorgänge gedacht ist, bei denen Geschwindigkeit und Kosten Priorität haben. Beide Modelle sind über die API von OpenAI verfügbar, und das Unternehmen hat mit ihrer Einführung in ChatGPT Work und Codex begonnen.
Preise und Benchmark-Ergebnisse
GPT-6 Sol kostet 2 US-Dollar pro 1 Million Eingabe-Token und 10 US-Dollar pro 1 Million Ausgabe-Token, verglichen mit jeweils 4 und 20 US-Dollar für GPT-5.6 Sol. GPT-6 Luna kostet 0,10 US-Dollar pro 1 Million Eingabe-Token und 0,50 US-Dollar pro 1 Million Ausgabe-Token, nach 0,20 beziehungsweise 1,20 US-Dollar für seinen Vorgänger.
OpenAI erklärte zudem, GPT-6 Sol habe in einem internen Test zur faktischen Genauigkeit etwa halb so viele Fehler wie GPT-5.6 Sol gemacht. Bei hohem Reasoning-Niveau habe Luna bei dieser Kennzahl eine mit GPT-5.6 Sol vergleichbare Leistung zu etwa einem Hundertstel der Kosten erzielt, so das Unternehmen.
In AutomationBench erreichte GPT-6 Sol beim Reasoning-Niveau xhigh 33,2 %, verglichen mit 26,9 % für Claude Opus 5 bei dessen maximaler Einstellung. OpenAI schätzte, dass Sols Kosten pro Aufgabe etwa elfmal niedriger gewesen seien. GPT-6 Astra erreichte bei niedrigem Reasoning-Niveau 30,3 %.
Sol erzielte im Coding-Benchmark DeepSWE v1.1 68,8 %, gegenüber 69,9 % für Claude Fable 5; OpenAI schätzte jedoch, dass Sol die Aufgabe zu rund 80 % niedrigeren Kosten abschloss. Luna erreichte 66,6 %, ein Ergebnis, das das Unternehmen mit Claude Opus 5 und Fable 5 bei mittlerem Reasoning-Niveau verglich.
Im Benchmark OSWorld 2.0 zur Computersteuerung erreichte Sol 60,5 %, verglichen mit 60,3 % für Claude Opus 5 bei mittlerem Reasoning-Niveau. OpenAI schätzte, dass Sols Aufgabenkosten etwa 80 % niedriger gewesen seien. Die Vergleiche schlossen Claude Opus 5.5 nicht ein, das Anthropic am selben Tag eingeführt hatte.
Unabhängige Bewertung
Die unabhängige Testplattform Artificial Analysis vergab für GPT-6 Sol auf der höchsten Stufe ihres proprietären Intelligence Index 48 Punkte, während Luna 37 Punkte erhielt. Claude Opus 5.5 erzielte auf der höchsten Stufe 58 Punkte und belegte zum Zeitpunkt der Tests den ersten Platz.
Artificial Analysis stellte fest, dass Effizienz der wichtigste Vorteil der neuen Modelle sei. Die geschätzten Kosten pro Aufgabe im Intelligence Index sanken bei Sol von etwa 1,99 US-Dollar für GPT-5.6 Sol auf 1,06 US-Dollar, während Lunas Kosten von 0,18 auf 0,07 US-Dollar fielen.
Sol gewann gegenüber seinem Vorgänger im Coding Agent Index zwei Punkte hinzu, während Luna zwei Punkte verlor. Artificial Analysis beobachtete Verbesserungen in einigen Automatisierungs- und Programmierungstests, aber eine schwächere Leistung bei mehreren Aufgaben mit professioneller Wissensarbeit.
Erste Reaktionen
OpenAI-Chef Sam Altman erklärte, Sol und Luna überträfen die GPT-5.6-Generation bei Intelligenz, Programmierung, Computernutzung und anderen Bereichen deutlich. Er betonte zudem ihre niedrigeren Tokenpreise und Kosten für die Aufgabenerledigung.
In einem weiteren Beitrag argumentierte Altman, die Kosten pro abgeschlossener Aufgabe seien wichtiger als Tokenpreise, und erklärte, dass die neuen Modelle von OpenAI nach dieser Kennzahl keine Marktäquivalente hätten. Dabei handelte es sich um Altmans Einschätzung und nicht um ein Ergebnis unabhängiger Tests.
Artificial Analysis äußerte sich zurückhaltender und erklärte, Sol und Luna hätten die Preis-Leistungs-Grenze verschoben, lägen beim Gesamtwert des Intelligence Index und des Coding Agent Index jedoch weiterhin nahe an der GPT-5.6-Generation. Die einzelnen Tests zeigten sowohl Fortschritte als auch Rückschritte.
Der Produktexperte Peter Young erklärte, Sol fühle sich subjektiv besser als GPT-5.6 an, auch wenn er Claude Opus 5.5 für die tägliche Arbeit bevorzuge und es über Fable und Astra einordne. Der KI-Unternehmer Matt Shumer bezeichnete Sol ebenfalls als hochwertig, erklärte jedoch, dass er für die tägliche Arbeit weiterhin GPT-6 Astra oder Claude Fable 5.1 bevorzuge und erwarte, Opus 5.5 dieser Liste hinzuzufügen.
Der Entwickler David Kramer lobte bei Luna die Kombination aus Preis, Fähigkeiten und akzeptabler Geschwindigkeit und nannte es eine der ausgewogensten Optionen am Markt.
Insgesamt deuten die ersten unabhängigen Tests und Nutzerreaktionen darauf hin, dass Sol und Luna vor allem die Wirtschaftlichkeit der Nutzung von OpenAI-Modellen verändern. Ihre niedrigeren Kosten gehen mit Verbesserungen bei einigen Aufgaben einher, doch die Tests haben keinen durchgängigen Leistungssprung gegenüber der vorherigen Generation gezeigt.
Quelle: HODL Press
