Drei KI-Labore, fünf Tage, drei neue Spitzenmodelle für GitHub Copilot. Zwischen 19. und 23. September 2026 haben OpenAI, Anthropic und xAI ihre neuesten Coding-Modelle veröffentlicht, und GitHub hat gleich zwei davon binnen Stunden in Copilot integriert. Für Entwicklerinnen und Entwickler bedeutet das: Die Auswahlliste im Modell-Dropdown wird länger, die Entscheidung schwerer und der Wettbewerb um die beste Coding-KI schärfer als je zuvor. Dieser Artikel ordnet ein, was GPT-6 Sol, GPT-6 Luna und Claude Opus 5.5 konkret bringen, wie sie sich in Benchmarks schlagen und was der Tempo-Sprung für den Markt der KI-Coding-Tools bedeutet.
Fünf Tage, drei Anbieter: Die Zeitleiste im Überblick
Am 19. September 2026 erschien Claude Code 2.1.278 mit einer Änderung am Auto-Modus, die Sicherheitsprüfungen künftig nicht mehr gegen das Token-Budget rechnet. Zwei Tage später, am 21. September, brachte xAI Grok 4.7 auf den Markt, den direkten Nachfolger von Grok 4.6, das erst wenige Wochen zuvor in Copilot gelandet war. Am 22. September folgte Anthropic mit Claude Opus 5.5, das GitHub laut eigenem Changelog am Folgetag in Copilot freischaltete. Den vorläufigen Abschluss der Woche markierte OpenAI: Am 23. September stellte das Unternehmen GPT-6 Sol und GPT-6 Luna vor, zeitgleich mit der Aufnahme beider Modelle in die Codex CLI (Version 0.156.1) und in Copilot.
Diese Verdichtung ist ungewöhnlich, selbst für ein Tempo, an das sich die Branche längst gewöhnt hat. Noch vor zwei Jahren lag zwischen zwei großen Modellgenerationen oft ein halbes Jahr. Im September 2026 reichten fünf Kalendertage, um drei neue Spitzenmodelle von drei konkurrierenden Anbietern auf den Markt zu bringen, und GitHub hat als größte Distributionsplattform für KI-Coding-Werkzeuge fast in Echtzeit reagiert.
GPT-6 Sol und GPT-6 Luna: OpenAIs Doppelschlag
OpenAI hat mit Sol und Luna gleich zwei Modelle auf einmal veröffentlicht statt eines einzelnen Nachfolgers. Laut der offiziellen Ankündigung von OpenAI sind beide Modelle ab dem Starttag in ChatGPT Work und in Codex verfügbar, und zwar für Plus-, Pro-, Business-, Enterprise- und Edu-Konten. Kostenlose Nutzer und Go-Abonnenten erhalten GPT-6 Luna zumindest in der Desktop-App, in den regulären Chat-Oberflächen sind beide Modelle zum Start noch nicht freigeschaltet. Über die OpenAI-API lassen sich die Modelle unter den Bezeichnern gpt-6-sol und gpt-6-luna ansprechen.
Die Namensgebung folgt einem Muster, das OpenAI schon bei GPT-6 Astra Anfang September etabliert hat: Statt einer reinen Versionsnummer bekommen einzelne Modellvarianten eigene Namen, je nach Einsatzzweck. Astra war für autonome Langzeit-Agentenaufgaben und Computerbedienung positioniert. Sol und Luna zielen stärker auf den alltäglichen Coding-Workflow, mit Schwerpunkt auf Codex und die Kommandozeile. Für Entwickler heißt das in der Praxis: Wer in Copilot oder Codex arbeitet, sieht ab sofort nicht mehr ein GPT-Modell zur Auswahl, sondern mehrere, jedes mit einem etwas anderen Stärkeprofil.
Claude Opus 5.5 zieht bei Copilot ein
Nur einen Tag vor OpenAIs Doppelschlag hat Anthropic mit Claude Opus 5.5 nachgelegt. Das Modell gilt als das erste seit Dario Amodeis vieldiskutiertem Essay zum Thema “Pace the Frontier” und wurde laut Anthropic zu rund 40 Prozent günstigeren Konditionen angeboten als sein Vorgänger. GitHub hat Opus 5.5 laut eigenem Changelog kurz darauf in Copilot aufgenommen, mit dem Hinweis auf schnellere Wiederherstellung nach Fehlern bei mehrstufigen Aufgaben und ein Wasserzeichen-Verfahren, das laut GitHub weder Qualität noch Kosten der Ausgabe beeinflusst.
Opus 5.5 reiht sich damit in eine Copilot-Modellauswahl ein, die inzwischen nach Leistungsstufen sortiert ist, wie shattered.io bereits bei der Einführung der dreistufigen Copilot-Modellwahl beschrieben hat. Opus 5.5 besetzt darin die obere Stufe für komplexe, wissensintensive Aufgaben, während kleinere Modelle wie MAI-Code-1.1-Flash von Microsoft für einfachere, günstigere Anfragen bereitstehen.
Grok 4.7 und der Wettlauf von xAI
xAI hat mit Grok 4.7 am 21. September den bislang kürzesten Abstand zwischen zwei eigenen Modellgenerationen hingelegt. Grok 4.6 war erst wenige Wochen zuvor in Copilot gestartet, wie shattered.io in der Analyse zum Copilot-Start von Grok 4.6 auf acht Plattformen beschrieben hat. Dass xAI bereits die nächste Generation nachschiebt, zeigt, wie sehr sich der Rhythmus der gesamten Branche beschleunigt hat. Während Grok 4.6 in Copilot fest verankert ist, war zum Redaktionsschluss noch nicht offiziell bestätigt, wann genau Grok 4.7 dort landet. Die Integration früherer Grok-Versionen erfolgte in der Vergangenheit aber jeweils innerhalb weniger Wochen nach dem eigentlichen Modell-Release.
Für xAI ist das Tempo auch ein strategisches Signal an Investoren und Unternehmenskunden: Wer in der Coding-Nische mit OpenAI, Anthropic und Google mithalten will, kann sich keine langen Entwicklungszyklen mehr leisten. Grok tritt damit endgültig aus dem Schatten der reinen Chat-Anwendung heraus und positioniert sich als ernstzunehmender Akteur im Markt für KI-Coding-Assistenten.
Die neuen Modelle im Überblick
Die folgende Tabelle fasst zusammen, welche Modelle im September 2026 neu zu GitHub Copilot beziehungsweise Codex hinzugekommen sind, wer sie entwickelt hat und was sie auszeichnet.
| Modell | Anbieter | Datum | Plattform | Besonderheit |
|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 3. September 2026 | Copilot (GA) | Autonome Langzeit-Agentenaufgaben, Computerbedienung |
| Claude Fable 5.1 | Anthropic | Anfang September 2026 | Copilot | 45 % günstiger, 1 Mio. Token Kontext |
| MAI-Code-1.1-Flash | Microsoft | September 2026 | Copilot | Vision-Unterstützung, günstige Einstiegsstufe |
| Gemini 3.8 Flash | September 2026 | Copilot | Einführungspreis bis Dezember 2026 | |
| Grok 4.6 | xAI | September 2026 | Copilot (8 Plattformen) | Komplexe, mehrstufige Entwicklungsaufgaben |
| Claude Opus 5.5 | Anthropic | 22.–23. September 2026 | Copilot | 40 % günstiger als Vorgänger, schnellere Fehler-Erholung |
| GPT-6 Sol | OpenAI | 23. September 2026 | Codex, Copilot, ChatGPT Work | API-Kennung gpt-6-sol |
| GPT-6 Luna | OpenAI | 23. September 2026 | Codex, Copilot, Desktop (Free/Go) | API-Kennung gpt-6-luna |
Benchmark-Check: Wer liegt bei Coding-Agenten vorne
Reine Modellnamen sagen wenig darüber aus, welche Kombination aus Modell und Agenten-Framework in der Praxis am besten abschneidet. Der Artificial Analysis Coding Agent Index in Version 1.5 vergleicht deshalb nicht einzelne Modelle isoliert, sondern konkrete Modell-Agent-Kombinationen unter realistischen Coding-Bedingungen. Interessant dabei: An der Spitze steht nicht das neueste Modell, sondern die Kombination aus Claude Code und dem etwas älteren Claude Fable 5.1.
| Modell-Agent-Kombination | Index-Score | Anbieter |
|---|---|---|
| Claude Code + Fable 5.1 | 62,2 | Anthropic |
| Devin Fusion CLI + SWE-2 | 61,7 | Cognition |
| Codex + GPT-6 Astra | 61,6 | OpenAI |
| OpenCode + GLM-5.3 | 53,6 | Open Source (Zhipu) |
Der Index von Artificial Analysis wird laufend aktualisiert. Sobald neue Modelle wie Opus 5.5 oder GPT-6 Sol und Luna ausreichend Testläufe durchlaufen haben, dürften sich die Platzierungen erneut verschieben. Bemerkenswert ist schon jetzt, wie eng die drei Spitzenreiter beieinanderliegen: Zwischen Platz eins und drei trennen nur 0,6 Punkte, ein Vorsprung, der in der Praxis kaum spürbar ist. Das relativiert auch Marketingaussagen einzelner Anbieter, ihr jeweils neuestes Modell sei nun eindeutig das leistungsfähigste am Markt.
Codex CLI und die Terminal-Perspektive
Für Entwickler, die lieber im Terminal arbeiten als in einer grafischen IDE, ist die Codex CLI der direkteste Weg zu den neuen Modellen. Mit Version 0.156.1 hat OpenAI GPT-6 Sol und Luna direkt in den Modell-Picker der Kommandozeile aufgenommen, wie auch die offizielle GitHub-Copilot-Dokumentation für die IDE-Integration nahelegt. Ein Modellwechsel lässt sich damit ohne Neustart des Tools per Flag erledigen:
codex --model gpt-6-sol "Refaktoriere die Auth-Middleware und ergänze Tests"
codex --model gpt-6-luna "Erkläre diesen Stacktrace und schlage einen Fix vor"
Diese Terminal-nahe Integration ist kein Zufall. shattered.io hat bereits im Artikel zu OpenAIs Öffnung von Codex für externe Partner beschrieben, wie stark das Unternehmen die Plattform inzwischen als eigenständiges Ökosystem ausbaut, losgelöst vom klassischen ChatGPT-Interface. Die parallele Verfügbarkeit neuer Modelle in Codex und Copilot zeigt, dass OpenAI und GitHub ihre Release-Zyklen inzwischen eng abstimmen, wohl auch, weil Microsoft an beiden Produkten beteiligt ist.
Preise und Abrechnung: Was Entwickler zahlen
Copilot rechnet seit der Umstellung auf nutzungsbasierte Abrechnung Modellaufrufe nach Anfragen ab, mit unterschiedlichen Multiplikatoren je nach Modellstufe. Teurere Spitzenmodelle wie Opus 5.5 oder GPT-6 Sol verbrauchen pro Anfrage mehr vom monatlichen Kontingent als kleinere Modelle wie MAI-Code-1.1-Flash oder Gemini 3.8 Flash, für das GitHub bis Dezember 2026 einen reduzierten Einführungspreis eingeräumt hat. Anthropic selbst positioniert Opus 5.5 als deutlich günstiger im Vergleich zum Vorgängermodell, laut eigenen Angaben um rund 40 Prozent.
Für Teams bedeutet die wachsende Modellvielfalt vor allem eines: Kostenkontrolle wird zur eigenen Disziplin. Wer unreflektiert immer das teuerste verfügbare Modell wählt, kann das monatliche Copilot-Kontingent deutlich schneller aufbrauchen als noch vor einem Jahr, als die Auswahl auf wenige Optionen beschränkt war. Viele Engineering-Teams beginnen deshalb, interne Richtlinien festzulegen, welches Modell für welche Aufgabenklasse freigegeben ist, ähnlich wie es Copilot mit seinem dreistufigen Auswahlsystem bereits vorgibt.
Historischer Kontext: Vom Autocomplete zum Modell-Marktplatz
GitHub Copilot startete 2021 als reines Autocomplete-Werkzeug mit genau einem zugrunde liegenden Modell aus der Codex-Familie von OpenAI. Über Jahre hinweg gab es faktisch keine Modellwahl, Copilot war gleichbedeutend mit einem einzigen OpenAI-Modell. Das änderte sich grundlegend, als GitHub 2024 begann, zusätzliche Anbieter wie Anthropic und Google in Copilot zu integrieren. Bis Mitte 2026 folgten dann in schneller Folge chinesische Modelle wie Kimi K3, wie shattered.io im Beitrag über Kimi K3 in Copilot aufgezeigt hat, sowie eine wachsende Zahl offener und geschlossener Alternativen.
Die Ereignisse der Woche um den 19. bis 23. September 2026 markieren so gesehen keinen Bruch, sondern die konsequente Fortsetzung eines Trends: Copilot hat sich von einem Produkt mit einem Modell zu einer Vertriebsplattform für die Modelle mehrerer konkurrierender Anbieter entwickelt. Für GitHub als Microsoft-Tochter ist das eine bewusste Strategie, denn sie bindet Entwickler an die eigene Oberfläche, unabhängig davon, welches KI-Modell im Hintergrund gerade das leistungsfähigste ist.
Der Wandel lässt sich auch an der schieren Zahl messen. Wo Copilot-Nutzer 2023 noch keine Modellwahl hatten, zeigt das Dropdown-Menü Ende September 2026 ein Dutzend aktive Modelle aus mindestens fünf verschiedenen Häusern, von großen US-Laboren über Microsofts eigenes MAI-Code bis zu chinesischen Alternativen wie Kimi K3. Diese Verbreiterung folgt derselben Logik wie bei App-Stores oder Cloud-Marktplätzen: Wer die Plattform kontrolliert, muss nicht mehr selbst das beste Produkt bauen, solange genügend externe Anbieter um die Gunst der Nutzer konkurrieren.
Marktauswirkungen: Druck auf Cursor, Windsurf und Co.
Der beschleunigte Modell-Rhythmus trifft nicht nur GitHub selbst, sondern auch die gesamte Konkurrenzlandschaft der KI-Coding-Tools. Anbieter wie Cursor oder Windsurf konkurrieren seit Monaten direkt mit Copilot um Marktanteile, wie shattered.io etwa im Vergleich Codex gegen Claude Code gegen Gemini CLI beschrieben hat. Diese Tools müssen neue Modelle in der Regel ebenfalls zügig integrieren, um konkurrenzfähig zu bleiben, was den technischen und finanziellen Druck auf kleinere Anbieter erhöht.
Besonders deutlich zeigt sich das bei reinen Wrapper-Produkten, die kein eigenes Modell trainieren, sondern auf APIs von OpenAI, Anthropic oder Google aufsetzen. Für sie bedeutet jede neue Modellgeneration zusätzlichen Integrationsaufwand, während GitHub dank der Konzernnähe zu Microsoft und OpenAI oft schon am Tag der Veröffentlichung liefern kann. Das verschärft die Konsolidierung im Markt: Kleinere Anbieter ohne exklusive Modellzugänge geraten zunehmend unter Druck, sich entweder auf eine Nische zu spezialisieren oder Partnerschaften mit einzelnen KI-Laboren einzugehen.
Auch etablierte Namen wie Cursor spüren den Effekt. Ein eigenständiges Produkt lebt davon, schneller oder gezielter zu sein als die breite Copilot-Plattform, und dieser Vorsprung schrumpft, sobald GitHub dieselben Spitzenmodelle nur wenige Stunden nach dem jeweiligen Anbieter selbst freischaltet. Für Investoren in reine KI-Coding-Startups verschiebt sich damit die zentrale Frage: Nicht mehr, welches Modell im Hintergrund läuft, sondern ob ein Produkt einen eigenständigen Workflow-Vorteil bietet, den auch eine Plattform mit riesigem Modellkatalog nicht einfach nachbauen kann.
Unternehmen zwischen Wahlfreiheit und Entscheidungsmüdigkeit
Mehr Auswahl klingt zunächst nach einem Vorteil für Entwicklerteams, in der Praxis bringt sie aber auch neue Reibung. IT-Abteilungen in Unternehmen müssen inzwischen laufend bewerten, welches der verfügbaren Copilot-Modelle für welchen Anwendungsfall freigegeben wird, welche Datenschutz- und Aufbewahrungsregeln jeweils gelten und wie sich die Kosten über verschiedene Teams hinweg entwickeln. Diese Entscheidungsmüdigkeit ist ein Nebeneffekt, den viele Anbieter beim Werben um immer mehr Modellvielfalt selten thematisieren.
Gerade in regulierten Branchen, etwa im Finanzsektor oder im öffentlichen Bereich, verlangsamt das die Einführung neuer Modelle zusätzlich. Bevor ein neues Modell wie Opus 5.5 oder GPT-6 Sol produktiv eingesetzt werden darf, müssen Compliance-Teams oft erst prüfen, ob sich an Datenverarbeitung, Serverstandort oder Protokollierung etwas geändert hat. Das bedeutet: Während einzelne Entwickler ein neues Modell oft schon Stunden nach Release ausprobieren können, dauert die offizielle Freigabe in größeren Organisationen mitunter Wochen.
Kritik: Modell-Fragmentierung als neues Risiko
Nicht alle Reaktionen auf die Modellflut sind positiv. Kritiker innerhalb der Entwickler-Community bemängeln, dass die schiere Zahl an Optionen die Reproduzierbarkeit von Ergebnissen erschwert. Wenn ein Code-Review-Kommentar oder ein generierter Pull Request von einem bestimmten Modell stammt, das wenige Wochen später schon wieder durch eine neuere Version ersetzt wurde, lässt sich ein Problem später kaum noch mit demselben Modell nachstellen. Für Teams, die Wert auf nachvollziehbare, auditierbare KI-Nutzung legen, ist das ein reales Problem, nicht nur eine theoretische Sorge.
Hinzu kommt ein psychologischer Effekt: Wenn praktisch jede Woche ein neues, angeblich besseres Modell erscheint, sinkt die Bereitschaft, sich mit den Stärken und Schwächen eines einzelnen Modells wirklich vertraut zu machen. Statt gezielt zu lernen, wie ein bestimmtes Modell am besten zu prompten ist, wechseln viele Entwickler ständig zum jeweils neuesten Namen, ohne den tatsächlichen Nutzen im eigenen Workflow zu überprüfen.
Was das für Entwicklerteams in Österreich und der DACH-Region bedeutet
Für österreichische Unternehmen, die Copilot bereits im Einsatz haben, ist die wichtigste praktische Konsequenz eine organisatorische: Wer nicht will, dass einzelne Teammitglieder unkontrolliert zwischen Dutzenden Modellen wechseln, sollte jetzt eine interne Modell-Policy festlegen, statt das jedem Entwickler individuell zu überlassen. Das betrifft vor allem regulierte Branchen wie Banken, Versicherungen oder öffentliche Verwaltung, wo Datenschutz- und Protokollierungsanforderungen ohnehin genau geprüft werden müssen, bevor ein neues Modell freigegeben wird.
Gleichzeitig eröffnet die größere Modellvielfalt auch Chancen: Kleinere Teams, die bisher aus Kostengründen auf günstigere, weniger leistungsfähige Modelle angewiesen waren, profitieren von Einführungspreisen wie bei Gemini 3.8 Flash oder von generell sinkenden Kosten bei Modellen wie Claude Opus 5.5. Wer die Modellwahl aktiv steuert, statt immer nur das neueste verfügbare Modell zu nutzen, kann die Kosten pro gelöster Aufgabe in der Praxis oft senken, ohne bei der Qualität spürbare Abstriche zu machen.
Prognosen: Wie es in den nächsten Monaten weitergeht
Auf Basis der aktuellen Entwicklung lassen sich einige Trends für den Rest des Jahres 2026 und den Jahreswechsel absehen.
- Der Rhythmus neuer Modell-Releases dürfte sich kurzfristig nicht verlangsamen. Google, Anthropic, OpenAI und xAI stehen in einem direkten Wettlauf, bei dem jede Woche ohne neue Ankündigung als Rückstand wahrgenommen wird.
- GitHub wird die Zahl der in Copilot verfügbaren Modelle voraussichtlich weiter erhöhen, gleichzeitig aber auch strenger kuratieren, welche Modelle in welcher Preisstufe landen, um die Kostenkontrolle für Unternehmenskunden zu erleichtern.
- Benchmarks wie der Artificial Analysis Coding Agent Index werden an Bedeutung gewinnen, weil einzelne Versionsnummern für Entscheidungsträger zunehmend unübersichtlich werden und ein aggregierter Vergleichswert Orientierung bietet.
- Kleinere KI-Coding-Anbieter ohne eigene Modellentwicklung geraten weiter unter Konsolidierungsdruck, Übernahmen oder exklusive Partnerschaften mit einzelnen Laboren werden wahrscheinlicher.
- Unternehmen mit strengen Compliance-Anforderungen werden verstärkt eigene, reduzierte Modell-Whitelists einführen, um die Flut an neuen Optionen organisatorisch beherrschbar zu halten.
Häufig gestellte Fragen (FAQ)
Was sind GPT-6 Sol und GPT-6 Luna genau?
GPT-6 Sol und GPT-6 Luna sind zwei neue Modelle von OpenAI, die am 23. September 2026 vorgestellt wurden. Beide sind in Codex und ChatGPT Work verfügbar, über die API lassen sie sich als gpt-6-sol und gpt-6-luna ansprechen. Sie ergänzen das bereits im September veröffentlichte GPT-6 Astra, das stärker auf autonome Agentenaufgaben ausgelegt ist.
Ist Claude Opus 5.5 bereits in GitHub Copilot verfügbar?
Ja. GitHub hat Claude Opus 5.5 laut eigenem Changelog kurz nach dem Anthropic-Release vom 22. September 2026 in Copilot aufgenommen. Das Modell ist Teil der oberen Leistungsstufe im dreistufigen Copilot-Modellsystem.
Was kostet die Nutzung der neuen Modelle in Copilot?
Copilot rechnet Modellaufrufe nutzungsbasiert ab, mit unterschiedlichen Multiplikatoren je nach Modellstufe. Teurere Spitzenmodelle wie Opus 5.5 oder GPT-6 Sol verbrauchen pro Anfrage mehr vom monatlichen Kontingent als kleinere Modelle. Anthropic gibt an, Opus 5.5 sei rund 40 Prozent günstiger als der Vorgänger.
Welches Modell schneidet aktuell bei Coding-Benchmarks am besten ab?
Nach dem Artificial Analysis Coding Agent Index in Version 1.5 liegt die Kombination aus Claude Code und Claude Fable 5.1 mit einem Indexwert von 62,2 knapp vorn, gefolgt von Devin Fusion CLI mit SWE-2 (61,7) und Codex mit GPT-6 Astra (61,6). Die neuesten Modelle wie Opus 5.5 und GPT-6 Sol waren zum Zeitpunkt der Veröffentlichung dieses Index noch nicht vollständig eingerechnet.
Wie unterscheidet sich Grok 4.7 von Grok 4.6?
Grok 4.7 wurde von xAI am 21. September 2026 veröffentlicht, nur wenige Wochen nach Grok 4.6. Zum Redaktionsschluss war die Aufnahme von Grok 4.7 in GitHub Copilot noch nicht offiziell bestätigt. Frühere Grok-Versionen wurden in der Vergangenheit aber meist innerhalb weniger Wochen nach dem Modell-Release in Copilot integriert.
Warum integriert GitHub so viele verschiedene KI-Modelle?
GitHub hat Copilot in den vergangenen Jahren von einem Ein-Modell-Produkt zu einer Vertriebsplattform für Modelle mehrerer Anbieter umgebaut. Das bindet Entwickler an die eigene Oberfläche, unabhängig davon, welches Modell gerade als leistungsfähigstes gilt, und erlaubt es GitHub, Preisstufen für unterschiedliche Budgets anzubieten.
Sollten Unternehmen jedes neue Modell sofort produktiv einsetzen?
Nicht zwangsläufig. Gerade regulierte Branchen sollten neue Modelle erst nach interner Prüfung von Datenschutz- und Protokollierungsanforderungen freigeben. Eine klare interne Modell-Policy hilft, Kosten und Compliance-Risiken zu kontrollieren, statt jedem Teammitglied die freie Wahl unter Dutzenden Optionen zu überlassen.
Wird sich das Tempo neuer Modell-Releases 2026 weiter beschleunigen?
Alle Anzeichen deuten darauf hin. OpenAI, Anthropic, Google und xAI liefern sich einen direkten Wettlauf um die Führungsposition bei Coding-Modellen, bei dem einzelne Anbieter kaum noch mehr als wenige Wochen zwischen zwei Modellgenerationen verstreichen lassen.




