Am 21. September 2026 hat xAI sein neuestes Modell Grok 4.7 veröffentlicht, und GitHub hat es noch am selben Tag in den Copilot-Modellwähler aufgenommen. Für Entwickler bedeutet das ein drittes Grok-Modell innerhalb weniger Monate, ein auf 500.000 Token erweitertes Kontextfenster und einen Terminal-Bench-Wert, der sich laut einem Generationsvergleich gegenüber dem Vorgänger fast verdoppelt hat. Der Preis bleibt dabei exakt derselbe wie bei Grok 4.5 und Grok 4.6.

Der Start zeigt, wie schnell sich der Markt für KI-Programmierwerkzeuge inzwischen dreht. Wo früher Jahre zwischen Modellgenerationen lagen, reihen Anbieter wie xAI, Anthropic und OpenAI heute Updates im Abstand von Wochen aneinander. Dieser Artikel ordnet ein, was an Grok 4.7 technisch neu ist, was es kostet, wie es im Vergleich zu anderen Copilot-Modellen abschneidet und was der Rollout für Entwickler und Unternehmen in Österreich bedeutet.

Relevant ist der Fall gerade deshalb, weil GitHub Copilot in Österreich und im gesamten DACH-Raum zu den meistgenutzten KI-Assistenten in Entwicklerteams zählt. Jede neue Modellgeneration im Copilot-Modellwähler verändert direkt, wie Teams Aufgaben zwischen günstigen und teuren Modellen verteilen, und wie verlässlich sich die monatliche API-Rechnung vorhersagen lässt.

Grok 4.7 ist da: Die wichtigsten Fakten zum Start in Copilot

xAI positioniert Grok 4.7 als sein leistungsfähigstes Modell für Coding, agentische Aufgaben und Wissensarbeit. Laut dem offiziellen GitHub-Changelog wurde das Modell am 21. September 2026 gleichzeitig für die Copilot-Stufen Pro, Pro+, Max, Business und Enterprise freigeschaltet. GitHub stuft Grok 4.7 intern als “Versatile”-Modell ein, also als Allrounder zwischen reinen Lightweight-Modellen und den teureren Powerful-Modellen von Anthropic.

Mehrere Branchenberichte beschreiben den Rollout als gestaffelt. Nicht jeder Account erhielt das Modell am ersten Tag, obwohl GitHub es offiziell für alle genannten Tarife ankündigte. Das deckt sich mit dem Muster, das bereits bei Grok 4.6 zu beobachten war, das erst wenige Wochen zuvor denselben Weg in den Modellwähler nahm. Entwickler mussten teils manuell prüfen, ob das Modell in ihrer VS-Code- oder Visual-Studio-Instanz bereits auftaucht.

500.000 Token Kontextfenster: Was sich technisch ändert

Grok 4.7 arbeitet mit einem Kontextfenster von 500.000 Token. Das reicht aus, um größere Code-Repositories, mehrere Dateien und lange Chat-Verläufe gleichzeitig im Arbeitsspeicher des Modells zu halten, ohne dass Copilot Teile des Projekts aus dem Kontext werfen muss. xAI beschreibt das Modell in den offiziellen Release Notes als Reasoning-Modell, das für mehrstufige Aufgaben und komplexe agentische Workflows optimiert wurde.

Praktisch heißt das: Wer mit Grok 4.7 ein Refactoring über mehrere Module hinweg anstößt, muss seltener nachträglich Kontext nachliefern. Für Teams, die große Monorepos pflegen, ist das ein reales Argument, auch wenn die 500.000 Token nicht am oberen Ende dessen liegen, was einzelne Anbieter inzwischen versprechen. Entscheidend ist, dass xAI diesen Wert über drei Generationen konstant gehalten hat, während sich bei Preis und Benchmark-Werten deutlich mehr bewegt hat.

Wie GitHub Grok 4.7 einordnet

GitHub sortiert jedes Modell im Copilot-Modellwähler in eine von drei Kategorien ein: Lightweight für günstige Routineaufgaben, Versatile für Allround-Einsätze und Powerful für die rechenintensivsten Anfragen. Grok 4.7 bleibt wie seine beiden Vorgänger in der mittleren Kategorie Versatile. Das positioniert das Modell bewusst zwischen schnellen, billigen Modellen für Codevervollständigung und den teuren Spitzenmodellen von Anthropic, die GitHub als Powerful einstuft.

Preismodell: Zwei Tarifstufen, ein Rechenweg

Copilot rechnet Grok 4.7 über tatsächlichen Token-Verbrauch ab, umgewandelt in AI-Credits. Laut der offiziellen Preistabelle von GitHub gelten für Prompts bis 200.000 Input-Token 2 Dollar pro Million Input-Token, 0,50 Dollar pro Million zwischengespeicherter Input-Token und 6 Dollar pro Million Output-Token. Überschreitet eine Anfrage die 200.000-Token-Marke, verdoppeln sich Input- und Cache-Preis, der Output-Preis steigt auf 12 Dollar pro Million Token.

Diese Umstellung auf nutzungsbasierte Abrechnung betrifft nicht nur Grok, sondern den gesamten Copilot-Modellwähler. Details zu diesem grundsätzlichen Wechsel hat die Redaktion bereits separat eingeordnet. Wichtig für Teams, die jetzt kalkulieren: Ein einzelner langer Prompt mit mehr als 200.000 Token kann die Kosten pro Anfrage verdoppeln, ohne dass sich am angezeigten Modellnamen etwas ändert.

Grok 4.7 im Preisvergleich mit anderen Copilot-Modellen

Ein Blick in die offizielle Preistabelle zeigt, wie unterschiedlich die Anbieter im selben Copilot-Modellwähler kalkulieren. Die folgende Tabelle vergleicht die Listenpreise pro Million Token für Modelle bis zur jeweiligen Standardschwelle.

ModellKategorieInput ($/Mio)Cache ($/Mio)Output ($/Mio)
Grok 4.5 (xAI)Versatile2,000,506,00
Grok 4.6 (xAI)Versatile2,000,506,00
Grok 4.7 (xAI)Versatile2,000,506,00
Gemini 3.8 Flash (Google)Versatile0,750,0753,75
MAI-Code-1.1-Flash (Microsoft)Lightweight0,200,021,20
Kimi K3 (Moonshot AI)Powerful3,000,3015,00

Auffällig ist, dass xAI den Preis über drei Grok-Generationen unverändert bei 2 Dollar Input und 6 Dollar Output belässt. Google unterbietet das mit Gemini 3.8 Flash deutlich, Microsofts MAI-Code-1.1-Flash positioniert sich als klar günstigste Option in der Lightweight-Klasse. Kimi K3 aus China liegt dagegen am oberen Ende der Tabelle.

Terminal-Bench und SWE-bench: Was die Zahlen wirklich zeigen

Bei den Leistungsdaten wird es unübersichtlicher. Ein unabhängiges Modellverzeichnis listet für Grok 4.7 einen SWE-bench-Verified-Wert von 58,6 Prozent (pass@1) und einen Terminal-Bench-4.0-Wert von 28,3 Prozent. Diese Zahlen stammen nicht aus einer offiziellen xAI-Veröffentlichung, sondern aus eigenen Testläufen des Verzeichnisses.

Ein zweiter, unabhängiger Vergleich von Codersera kommt zu abweichenden Werten: Dort steigt der Terminal-Bench-4.0-Wert von 20,3 Prozent bei Grok 4.6 auf 37,6 Prozent bei Grok 4.7, also fast eine Verdopplung innerhalb einer Modellgeneration. Die Diskrepanz zwischen beiden Quellen zeigt ein grundsätzliches Problem der Branche: Es fehlt ein einheitlicher, von allen Anbietern anerkannter Testaufbau für Terminal-Bench, sodass jedes Verzeichnis mit eigenen Parametern misst.

Benchmark-Entwicklung von Grok 4.6 zu Grok 4.7

Trotz der Unsicherheit bei den absoluten Werten lässt sich die Richtung der Entwicklung an einer Quelle konsistent nachvollziehen. Die folgende Tabelle fasst zusammen, was zwischen den beiden jüngsten Grok-Generationen gleich geblieben ist und was sich verändert hat.

MerkmalGrok 4.6Grok 4.7
Terminal-Bench 4.0 (Quelle: Codersera)20,3 %37,6 %
Preis Input bis 200K Token2,00 $/Mio2,00 $/Mio
Preis Output bis 200K Token6,00 $/Mio6,00 $/Mio
Copilot-StufenPro, Pro+, Max, Business, EnterprisePro, Pro+, Max, Business, Enterprise

Für Käufer heißt das: Wer bereits für Grok 4.6 budgetiert hat, zahlt für Grok 4.7 keinen Cent mehr, bekommt laut diesem Vergleich aber ein Modell, das bei agentischen Terminal-Aufgaben deutlich zulegt. Das ist ein seltenes Muster in einem Markt, in dem neue Modellgenerationen meist entweder teurer werden oder nur in Nischen besser abschneiden.

Verfügbarkeit: Von VS Code bis Xcode

Grok 4.7 lässt sich laut Branchenberichten in VS Code, Visual Studio, der Copilot CLI, Copilot Cloud Agents, der Copilot-App sowie in JetBrains-IDEs, Xcode und Eclipse auswählen. Das ist eine deutlich breitere Abdeckung als bei vielen konkurrierenden Modellen, die oft zuerst nur in einer oder zwei Umgebungen landen, bevor sie in der gesamten Produktfamilie ausgerollt werden.

Darüber hinaus ist Grok 4.7 auch außerhalb von Copilot erreichbar: über die xAI-API direkt unter der Modellkennung grok-4.7, über Cursor und über Gateways wie Vercel AI Gateway. Für Teams, die nicht exklusiv an Copilot gebunden sind, bedeutet das mehr Flexibilität bei der Wahl des Zugangswegs, ohne dass sich Preis oder Modellverhalten unterscheiden sollten.

Marktauswirkung: Was der Start für Unternehmen bedeutet

Die Umstellung auf reine Token-Abrechnung macht Kosten planbarer, aber auch volatiler als beim alten Multiplikator-System. Unternehmen, die größere Codebasen mit vielen Kontext-Token verarbeiten, überschreiten schneller die 200.000-Token-Schwelle und zahlen dann automatisch den doppelten Satz. Finance-Teams müssen also nicht nur die Zahl der Anfragen überwachen, sondern auch deren durchschnittliche Prompt-Länge.

Was Einkauf und Finance jetzt konkret prüfen sollten

  • Durchschnittliche Prompt-Länge je Team ermitteln, um abzuschätzen, wie oft die 200.000-Token-Schwelle gerissen wird.
  • Bestehende Enterprise-Verträge auf AI-Credit-Kontingente statt alte Premium-Request-Pakete prüfen.
  • Einen Testzeitraum mit begrenztem Budget festlegen, bevor Grok 4.7 zum Standardmodell für ein ganzes Team wird.
  • Monatliche Auswertung der Modellnutzung einführen, da sich Copilots Modellangebot weiterhin häufig ändert.

Der Zeitpunkt des Starts fällt zudem in eine Phase branchenweiten Preisdrucks. Nur wenige Tage vor Grok 4.7 senkte Anthropic die Preise für sein kleines Modell Haiku 5.5 um bis zu 90 Prozent gegenüber dem Vorgänger, wie SiliconANGLE berichtete. In diesem Umfeld wirkt xAIs Entscheidung, den Grok-Preis über drei Generationen stabil zu halten, fast schon konservativ. Gleichzeitig zeigt es, dass xAI offenbar nicht gezwungen ist, über den Preis zu konkurrieren, solange die Benchmark-Werte steigen.

Wettbewerbsvergleich: Grok 4.7 gegen Gemini, Claude und MAI-Code

Im direkten Preisvergleich liegt Grok 4.7 im Mittelfeld der Copilot-Modellpalette. Googles Gemini 3.8 Flash kostet nur gut ein Drittel des Grok-Preises und zielt klar auf hohes Anfragevolumen bei einfacheren Aufgaben. Microsofts MAI-Code-1.1-Flash unterbietet beide nochmals deutlich und positioniert sich als Einstiegsmodell für Routineaufgaben wie Codevervollständigung.

Bei den teureren Powerful-Modellen von Anthropic gilt ein anderes Preisgefüge, das eher mit Kimi K3 aus der gleichen Kategorie vergleichbar ist als mit Grok. Entscheidend für Teams ist deshalb weniger die absolute Modellwahl, sondern die Zuordnung von Aufgabentypen zu Preisklassen: einfache, repetitive Anfragen zu günstigen Lightweight-Modellen, komplexe mehrstufige Refactorings zu Versatile-Modellen wie Grok 4.7, und nur die anspruchsvollsten Fälle zu den teuren Powerful-Modellen. Wie dieses Zusammenspiel in der Praxis funktioniert, hat die Redaktion bereits im Zusammenhang mit Copilots Multi-Modell-Strategie beleuchtet.

Lightweight, Versatile, Powerful: Was die Kategorien bedeuten

Die drei Preisklassen im Copilot-Modellwähler sind kein reines Marketinglabel, sie spiegeln sich direkt in der Preistabelle wider. Lightweight-Modelle wie MAI-Code-1.1-Flash kosten einen Bruchteil pro Million Token und eignen sich für hochfrequente, einfache Anfragen. Versatile-Modelle wie Grok 4.7 oder Gemini 3.8 Flash liegen preislich und funktional in der Mitte. Powerful-Modelle wie Kimi K3 oder die aktuellen Claude-Modelle von Anthropic kosten ein Vielfaches und richten sich an Aufgaben, bei denen Qualität wichtiger ist als Kosten pro Anfrage.

Historischer Kontext: Drei Grok-Generationen in wenigen Monaten

Grok 4.5, Grok 4.6 und Grok 4.7 teilen sich dieselbe Preisstruktur und dieselben Copilot-Tarifstufen. Das deutet darauf hin, dass xAI diese drei Versionen als eine fortlaufende Produktlinie behandelt statt als drei eigenständige Produkteinführungen. Jede neue Version brachte vor allem Verbesserungen bei Benchmark-Werten und Reasoning-Fähigkeiten, nicht bei Preis oder Kontextgröße. Wie der Vorgänger in Copilot startete, lässt sich im direkten Rückblick gut nachvollziehen.

Der Grok-4.7-Start steht außerdem nicht isoliert. Im selben Zeitraum veröffentlichte Anthropic am 28. September 2026 Claude Sonnet 5.5, OpenAI zog einen Tag später mit GPT-6.1 Sol nach. Drei große Anbieter brachten also innerhalb von nur zwei Tagen neue Coding-Modelle auf den Markt, bevor xAI rund drei Wochen später mit Grok 4.7 die nächste Runde einleitete. Diese Dichte an Veröffentlichungen innerhalb eines einzigen Quartals ist historisch beispiellos für den Markt der KI-Programmierassistenten.

Diese Taktung von wenigen Wochen zwischen den Generationen ist kein Einzelfall. Auch bei anderen Anbietern im Copilot-Modellwähler folgt auf eine Veröffentlichung oft innerhalb eines Monats die nächste Iteration. Für Entwickler bedeutet das einen ständigen Abgleich: Welches Modell ist aktuell das beste für die eigene Aufgabe, und lohnt sich der Wechsel von einer Woche auf die nächste überhaupt noch?

Die Modellrotation als neue Normalität bei Copilot

GitHub hat sein Copilot-Produkt in den vergangenen Monaten konsequent zu einem Marktplatz aus vielen konkurrierenden Modellen umgebaut. Statt eines einzelnen Standardmodells wählen Entwickler heute aus einer zweistelligen Zahl an Optionen, die regelmäßig ergänzt, aber auch wieder abgeschaltet werden. Grok 4.7 ersetzt dabei nicht automatisch Grok 4.6, beide bleiben zunächst parallel im Modellwähler sichtbar, bis GitHub ältere Versionen offiziell einstellt.

Für Teams mit vielen Entwicklern bringt das einen Koordinationsaufwand mit sich. Welches Modell für welchen Anwendungsfall als Standard gilt, muss intern dokumentiert und regelmäßig überarbeitet werden, sonst verwässert die Modellwahl zu einem Flickenteppich individueller Vorlieben. Genau an diesem Punkt setzen GitHubs eigene Mehrmodell-Strategien an, die automatisiert zwischen Modellen je Aufgabentyp wechseln sollen, wie etwa bei der Copilot-Modellwahl in Stufen bereits dokumentiert.

Kritikpunkte: Uneinheitliche Benchmarks und ungleicher Rollout

Die größte Schwäche der aktuellen Berichterstattung zu Grok 4.7 liegt in der fehlenden Vergleichbarkeit der Benchmark-Daten. Zwei unabhängige Quellen kommen für denselben Terminal-Bench-Test zu Werten, die um fast zehn Prozentpunkte voneinander abweichen, 28,3 Prozent gegenüber 37,6 Prozent für Grok 4.7. Ohne eine standardisierte, von xAI offiziell veröffentlichte Benchmark-Tabelle bleibt jede einzelne Zahl nur eine Momentaufnahme eines bestimmten Testaufbaus.

Zweiter Kritikpunkt ist der gestaffelte Rollout. Obwohl GitHub den Start für alle fünf Copilot-Tarife gleichzeitig ankündigte, berichteten mehrere Quellen von Nutzern, die das Modell erst Tage später in ihrer Umgebung sahen. Für Unternehmen, die eine Einführung zeitlich planen wollen, ist diese Unsicherheit ein praktisches Problem: Ein offiziell verfügbares Modell ist nicht gleichbedeutend mit einem für alle Teammitglieder sofort nutzbaren Modell.

Ein dritter, oft übersehener Punkt betrifft die automatische Modellauswahl bei Copilots Code-Review-Funktion. Dort wählt das System das eingesetzte Modell selbst aus, ohne es offenzulegen. Ob Grok 4.7 in diesem Kontext überhaupt zum Einsatz kommt, lässt sich von außen nicht nachvollziehen, was die Kostenschätzung für Teams zusätzlich erschwert, die Code-Reviews stark automatisiert haben.

Bedeutung für Entwickler und Unternehmen in Österreich

Für österreichische Entwicklungsteams gilt zunächst dieselbe Preistabelle wie global, da GitHub seine Copilot-Modelle durchgängig in US-Dollar abrechnet. Unternehmen mit Enterprise-Vertrag sollten bei der Budgetplanung den Wechselkurs und mögliche Schwankungen über das Abrechnungsjahr einkalkulieren, statt nur mit einer fixen Umrechnung zu planen.

Praktisch lohnt sich für heimische Teams ein kurzer interner Test, bevor Grok 4.7 zum Standardmodell für bestimmte Aufgaben erklärt wird. Da der Preis gegenüber Grok 4.6 unverändert bleibt, entsteht beim Wechsel kein zusätzliches Budgetrisiko, wohl aber ein Testaufwand, um zu prüfen, ob die gemeldeten Terminal-Bench-Verbesserungen sich im eigenen Code-Stack bestätigen. Teams, die im direkten Vergleich zwischen Copilot und Cursor stehen, sollten Grok 4.7 risikoarm parallel zu bestehenden Modellen testen, bevor sie eine Empfehlung aussprechen.

Prognosen: Wie geht es mit Grok in Copilot weiter?

Erstens: Die Taktung von Grok-Updates dürfte sich nicht verlangsamen. Nach drei Versionen in wenigen Monaten ist mit Grok 4.8 realistischerweise binnen weniger weiterer Monate zu rechnen, zumal bereits jetzt in Fachkreisen offen über den nächsten Schritt diskutiert wird.

Zweitens: Der stabile Preis dürfte nicht ewig halten. Angesichts des Preisdrucks durch Gemini 3.8 Flash und MAI-Code-1.1-Flash sowie durch Anthropics jüngste Preissenkungen bei Haiku 5.5 wird xAI mittelfristig entweder nachziehen oder den Mehrwert von Grok stärker über Benchmark-Ergebnisse statt über den Preis rechtfertigen müssen.

Drittens: Die Diskrepanz bei Terminal-Bench-Werten wird mittelfristig zu mehr Druck auf standardisierte, offizielle Benchmark-Veröffentlichungen führen, da Unternehmen zunehmend belastbare Vergleichsdaten für Kaufentscheidungen verlangen.

Viertens: Ein Kontextfenster von 500.000 Token wird sich als neuer Mindeststandard für Versatile-Modelle in Copilot etablieren, da konkurrierende Anbieter kaum mit kleineren Fenstern werben werden, sobald ein Wettbewerber diese Marke erreicht hat.

Fünftens: GitHub wird die automatisierte Modellauswahl je Aufgabentyp weiter ausbauen, damit einzelne Entwickler nicht mehr manuell zwischen einer wachsenden Zahl an Modellen wie Grok 4.7, Gemini 3.8 Flash oder Kimi K3 entscheiden müssen.

Häufig gestellte Fragen zu Grok 4.7 in GitHub Copilot

Seit wann ist Grok 4.7 in GitHub Copilot verfügbar?
Seit dem 21. September 2026, dem Tag der offiziellen Veröffentlichung durch xAI. GitHub nahm das Modell laut eigenem Changelog am selben Tag in den Modellwähler auf.

Welche Copilot-Tarife unterstützen Grok 4.7?
Pro, Pro+, Max, Business und Enterprise. Der Rollout erfolgte laut mehreren Berichten gestaffelt, einzelne Konten erhielten den Zugriff erst mit einigen Tagen Verzögerung.

Wie viel kostet Grok 4.7 pro Million Token?
Bis 200.000 Input-Token verlangt GitHub 2 Dollar pro Million Input-Token, 0,50 Dollar für zwischengespeicherte Token und 6 Dollar pro Million Output-Token. Oberhalb dieser Schwelle verdoppeln sich Input- und Cache-Preis, der Output-Preis steigt auf 12 Dollar.

Ist Grok 4.7 teurer als Grok 4.6?
Nein. Beide Modelle teilen sich laut der offiziellen GitHub-Preistabelle exakt dieselbe Preisstruktur, ebenso wie der Vorgänger Grok 4.5.

Wie groß ist das Kontextfenster von Grok 4.7?
500.000 Token. Das reicht für größere Code-Repositories und lange Konversationsverläufe innerhalb einer einzelnen Anfrage.

In welchen Entwicklungsumgebungen steht Grok 4.7 zur Verfügung?
Laut Branchenberichten in VS Code, Visual Studio, der Copilot CLI, Copilot Cloud Agents, der Copilot-App, JetBrains-IDEs, Xcode und Eclipse, zusätzlich über die xAI-API, Cursor und Gateways wie Vercel AI Gateway.

Wie schneidet Grok 4.7 bei Benchmarks ab?
Die Werte schwanken je nach Quelle. Ein Verzeichnis nennt 58,6 Prozent SWE-bench Verified und 28,3 Prozent Terminal-Bench 4.0, ein anderer Vergleich zeigt einen Anstieg von 20,3 auf 37,6 Prozent Terminal-Bench 4.0 gegenüber Grok 4.6. Eine offizielle, einheitliche Benchmark-Tabelle von xAI liegt für diesen direkten Generationsvergleich nicht vor.

Lohnt sich der Wechsel zu Grok 4.7 für österreichische Teams?
Da der Preis gegenüber Grok 4.6 unverändert bleibt, entsteht kein zusätzliches Kostenrisiko. Ein interner Test auf den eigenen Code-Stack empfiehlt sich trotzdem, bevor das Modell zum Standard für bestimmte Aufgaben wird.