OpenAI hat den September mit drei Zügen abgeschlossen. Am 3. September wurde Astra, die Spitze der GPT-6-Familie, angekündigt und am Tag darauf allgemein freigegeben. Am 22. September kamen die mittleren und leichten Modelle der Familie, Sol und Luna. Und noch bevor der Monat zu Ende war, am 29. September, GPT-6.1 Sol.
Auf den ersten Blick eine vertraute Geschichte: ein großes, ein mittleres, ein kleines Modell. Aber diesmal ist der Held der Geschichte nicht das Spitzenmodell, sondern das in der Mitte.
Die Familie: Astra, Sol, Luna
- Astra: das leistungsfähigste Modell der Familie. Sein Kontextfenster übersteigt eine Million Token (1.050.000); lange Dokumente und große Codebasen kann es in einem Durchgang lesen.
- Sol: die Mittelklasse, für schwere Alltagsarbeit.
- Luna: für Geschwindigkeit und Kosten; ein leichtes Modell, das etwas Genauigkeit opfert.
Astra: Kraft mit Sicherheitsbremse
Astras Veröffentlichung verlief nicht geradlinig. OpenAI hielt das Modell wegen Cybersicherheitsrisiken einige Wochen zurück und veröffentlichte es mit zusätzlichen Schutzmaßnahmen. Die allgemein freigegebene Version lehnt bestimmte Anfragen im Bereich Cybersicherheit ab. Den ersten Zugang erhielten Organisationen aus OpenAIs Cybersicherheitsprogramm, an dem man auf Antrag teilnimmt; danach folgten die höheren ChatGPT-Tarife, die API und AWS.
Technisch fallen zwei Details auf. Laut OpenAIs Vizepräsident für Forschung ist Astra das erste Modell, das am Stargate-Standort in Texas auf mehr als 100.000 GPUs vortrainiert wurde. Außerdem soll eine als „rekurrente Tiefe“ bezeichnete Technik zum Einsatz kommen, die einen Teil der Denkschritte des Modells unsichtbar macht. Der zweite Punkt ist umstritten, denn nachvollziehen zu können, wie ein Modell denkt, war für die Sicherheit wertvoll.
Preis: 10 Dollar pro Million Eingabe-Token, 50 Dollar pro Million Ausgabe-Token. Spitzenpreis.
GPT-6.1 Sol: zu einem Fünftel des Preises nah an Astra
Das ist die eigentliche Nachricht des Monats. Laut OpenAI holt GPT-6.1 Sol beim Programmieren als Agent, bei der Computerbedienung und bei professioneller Arbeit fast zu Astra auf. Sein Preis beträgt ein Fünftel von Astras: 2 Dollar pro Million Eingabe-Token, 10 Dollar pro Million Ausgabe.
Die veröffentlichten Ergebnisse:
- DeepSWE 1.1 (Softwareentwicklung): derselbe Wert wie Astra.
- OSWorld 2.0 (Computerbedienung): 2,1 Punkte hinter Astra.
- AutomationBench (Geschäftsautomatisierung): 4,8 Punkte vor dem bisherigen GPT-6 Sol.
Auch unabhängige Messungen zeichnen ein ähnliches Bild. Im Intelligenzindex von Artificial Analysis erreicht GPT-6.1 Sol in den höchsten Einstellungen 52 Punkte, Astra 53; die Kosten pro Aufgabe liegen bei Sol bei 0,72 Dollar, bei Astra bei 3,26 Dollar.
Ein Punkt Unterschied, viereinhalbfacher Preis.
Wie man diese Zahlen lesen sollte
Die meisten Tests hat OpenAI selbst ausgewählt. Unabhängige Messungen scheinen das Gesamtbild zu bestätigen, im Detail sieht es aber bei jeder Aufgabe anders aus. Für mich zählt das Verhältnis: dieselbe Arbeit zu einem Fünftel des Preises in sehr ähnlicher Qualität erledigen zu können.
Was sich für mich ändert
Ich verfolge die Modelle beider Unternehmen; ich sitze nicht auf der Tribüne eines Rennens. Entscheidend ist, welche Aufgabe ich welchem Werkzeug gebe.
Das Bild in der GPT-6-Familie gleicht fast genau dem, das ich im selben Monat bei Anthropic gesehen habe: Die Spitzenleistung wandert zu einem kleineren Modell und zu einem deutlich niedrigeren Preis. Bei Anthropic hat Opus 5.5 Fable-Niveau erreicht, bei OpenAI ist GPT-6.1 Sol nah an Astra herangekommen.
Die praktische Folge ist einfach:
- Für die Standardarbeit das Mittelklassemodell. Lange Dokumente, mehrstufige Aufgaben, Code. GPT-6.1 Sol ist die neue Referenz dieser Klasse.
- Das Spitzenmodell, wenn es wirklich nötig ist. Für einen Punkt Unterschied das Fünffache zu zahlen, ergibt bei den meisten Aufgaben keinen Sinn.
- Die eigentliche Fähigkeit ist das Zuweisen. Zu wissen, welche Aufgabe man welchem Modell gibt, wird wertvoller, als das beste Modell auszuwählen.
Dazu kommt die Sicherheitsfrage. Dass Astra wegen Cybersicherheit zurückgehalten wurde und ein Teil seiner Denkschritte unsichtbar ist, erinnert daran, dass diese Modelle keine gewöhnliche Software mehr sind. Ich nutze diese Werkzeuge in der technischen Infrastruktur meiner Agentur; je stärker sie werden, desto genauer achte ich darauf, was ich automatisiert lasse und was ich selbst prüfe.
Fazit
Vor einem Jahr fragten alle: „Welches Modell ist das beste?“ Heute lautet die richtige Frage anders: Welches ist das effizienteste Modell, das für diese Aufgabe gut genug ist?
Das Gewöhnliche blickt auf den Gipfel. Das Rebellische blickt darauf, wo die Arbeit endet.