Cognition, das Unternehmen hinter dem KI-Coding-Agenten Devin, hat am 10. September 2026 sein bisher leistungsfähigstes Modell veröffentlicht: SWE-2. Die Ankündigung kam ohne große Vorlaufzeit, aber mit einer klaren Botschaft an die Konkurrenz aus Anthropic, OpenAI und xAI: Frontier-Leistung muss nicht mehr Frontier-Preise kosten. Cognition selbst schreibt, SWE-2 sei “unser fähigstes Modell für Software-Engineering-Aufgaben – bei gleichzeitig marktführender Preis-Leistung” (Cognition, X-Post vom 10. September 2026). Für die Softwarebranche ist das mehr als eine Randnotiz, denn SWE-2 ist das erste öffentlich dokumentierte Beispiel dafür, dass ein spezialisierter Coding-Anbieter ein bestehendes Open-Weight-Basismodell so nachtrainiert, dass es mit proprietären Flaggschiffen mithalten kann, ohne deren Rechenkosten zu übernehmen.

Die Veröffentlichung reiht sich in eine Woche ein, in der sich in der KI-Coding-Branche ungewöhnlich viel bewegt hat: GitHub erweiterte sein Copilot-Modellportfolio um gleich mehrere neue Modelle, Google brachte Gemini 3.8 Flash, und OpenAI schickte mit GPT-6 Sol und GPT-6 Luna zwei günstigere Varianten seines Astra-Flaggschiffs ins Rennen. SWE-2 positioniert sich mitten in diesem Umfeld als Kampfansage eines kleineren, fokussierten Anbieters gegen die Preisstrukturen der großen Labore.

Was ist SWE-2 und warum ist die Nachricht relevant

SWE-2 ist kein von Grund auf neu trainiertes Basismodell, sondern ein proprietär nachtrainiertes Coding-Modell, das auf Moonshot AIs Kimi K3 aufbaut. Cognition beschreibt den Trainingsprozess als Single-Run-Reinforcement-Learning-Nachtraining, also einen einzigen durchgehenden RL-Lauf statt mehrerer iterativer Trainingsrunden. Die Gewichte selbst bleiben proprietär, ein offener Download ist nicht vorgesehen. Damit unterscheidet sich SWE-2 klar von reinen Open-Source-Modellen wie DeepSeek oder Qwen: Es handelt sich um ein geschlossenes Produkt, das ausschließlich innerhalb von Cognitions eigenem Ökosystem läuft.

Verfügbar ist SWE-2 seit dem Start-Tag in Devin Desktop und der Devin-CLI. Cognition kündigte gleichzeitig an, das Modell auch auf Devin Web und in Fusion auszurollen. Wörtlich hieß es dazu im offiziellen Blogbeitrag: “SWE-2 ist ab heute in Devin Desktop und CLI verfügbar” (Cognition-Blog, 10. September 2026). Für alle Pro-, Max- und Teams-Abonnenten war der Zugang im ersten Monat kostenlos, ein klassischer Einführungsrabatt, um schnelle Adoption zu erzeugen und Nutzungsdaten zu sammeln, bevor die regulären Kontingente wieder greifen.

Die eigentliche Neuigkeit liegt aber nicht im Zugriffsmodell, sondern im Verhalten des Modells selbst. Laut Berichterstattung von Techtimes beginnt SWE-2 im Gegensatz zu seinem Vorgänger SWE-1.7 direkt mit dem Bearbeiten von Code, statt zunächst lange Planungsschleifen zu durchlaufen. Das reduziert die Zahl der Zwischenschritte, die Devin für eine Aufgabe braucht, was sich unmittelbar auf die Rechenkosten pro gelöster Aufgabe auswirkt, selbst wenn der reine Modellpreis pro Token vergleichbar bliebe.

Die Benchmark-Zahlen im Detail

Cognition stützt seine Leistungsansprüche nicht auf SWE-bench Verified, den in der Branche etablierten Referenzwert, sondern auf einen eigenen Benchmark namens FrontierCode 1.1 Main sowie auf Terminal-Bench 2.1 und Terminal-Bench 4. Das ist bemerkenswert, weil es Außenstehenden erschwert, die Zahlen unabhängig gegen die üblichen Vergleichswerte der Konkurrenz zu prüfen. Trotzdem geben die veröffentlichten Tabellen ein klares Bild der relativen Positionierung.

ModellFrontierCode 1.1 MainTerminal-Bench 2.1Terminal-Bench 4
GPT-6 Astra53,3 %89,9 %57,9 %
Claude Fable 5.150,9 %91,4 %55,8 %
SWE-2 (Cognition)50,0 %92,8 %27,3 %
Grok 4.648,0 %88,4 %20,3 %
GPT-5.6 Sol47,5 %88,8 %37,3 %
Kimi K3 (Basismodell)44,2 %88,3 %21,5 %
SWE-1.7 (Vorgänger)42,0 %81,5 %7,6 %

Die Tabelle zeigt zwei gegenläufige Trends. Auf FrontierCode 1.1 Main liegt SWE-2 mit 50,0 Prozent nur knapp unter Claude Fable 5.1 (50,9 Prozent) und deutlich näher an GPT-6 Astra (53,3 Prozent), als es sein Vorgänger je war. Beim Terminal-Bench-2.1-Test übertrifft SWE-2 mit 92,8 Prozent sogar alle genannten Konkurrenzmodelle. Bei Terminal-Bench 4, einem anspruchsvolleren Nachfolgetest, bricht die Leistung dagegen auf 27,3 Prozent ein und landet damit klar hinter GPT-6 Astra (57,9 Prozent) und Claude Fable 5.1 (55,8 Prozent). Diese Schwäche bei komplexeren, mehrstufigen Terminal-Aufgaben ist der auffälligste Kritikpunkt an SWE-2 und wurde von mehreren unabhängigen Auswertungen unabhängig bestätigt.

Zusätzlich berichtete Cognition von einem DeepSWE-Wert von rund 73 Prozent für SWE-2, verglichen mit rund 74 Prozent für GPT-6 Astra, also einem Abstand von nur einem Prozentpunkt bei diesem spezifischen Test. Eine verifizierte SWE-bench-Verified-Punktzahl für SWE-2 wurde bislang nicht veröffentlicht, was den direkten Vergleich mit älteren Marktstandards erschwert.

Der Kostenvorteil: 64 bis 70 Prozent günstiger

Der zentrale Verkaufsschlager von SWE-2 ist nicht die absolute Spitzenleistung, sondern das Preis-Leistungs-Verhältnis. Cognition beziffert den Kostenvorteil gegenüber Claude Fable 5.1 bei identischem FrontierCode-Vergleichspunkt auf 64 Prozent. In einem separaten Social-Media-Post sprach das Unternehmen von bis zu 70 Prozent niedrigeren Kosten gegenüber Frontier-Modellen insgesamt: “Bei führenden Evaluierungen erreicht es Werte auf Höhe aktueller Frontier-Modelle – bei bis zu 70 Prozent geringeren Kosten” (Cognition, X-Post). Als Referenzpunkt für diese Berechnung nannten Branchenbeobachter einen Preis von 3,28 US-Dollar pro FrontierCode-Aufgabe für Claude Fable 5.1 im mittleren Aufwandsmodus.

Ein offizieller Preis pro Million Token wurde für SWE-2 bislang nicht veröffentlicht. Cognition kommuniziert den Kostenvorteil ausschließlich relativ, nicht als absolute Tarifliste. Das ist ein bewusster Unterschied zur Preispolitik von OpenAI oder Anthropic, die für ihre neuesten Modelle klare Dollarbeträge pro Million Input- und Output-Token nennen. Für Entwickler, die Kosten pro abgeschlossener Aufgabe statt pro Token budgetieren, mag das ausreichen, für eine seriöse Kostenkalkulation über größere Codebasen hinweg bleibt jedoch eine Lücke an Transparenz.

Anbieter/ModellRelease-DatumUngefährer PreisBesonderheit
Cognition SWE-210.09.2026kein offizieller Token-Preis, relativ 64–70 % günstigerNachtrainiert auf Kimi K3, exklusiv in Devin
Anthropic Claude Opus 5.522.09.20264 $ / 20 $ pro Mio. Token (Input/Output)1 Mio. Token Kontextfenster
OpenAI GPT-6 Sol22.09.20262 $ / 10 $ pro Mio. Token1,05 Mio. Token Kontextfenster
OpenAI GPT-6 Luna22.09.20260,10 $ / 0,50 $ pro Mio. TokenGünstigstes Modell der Runde
OpenAI GPT-6 Astra03.09.2026Provider-Listenpreis, nutzungsbasiertSeit 14.09. auch auf Amazon Bedrock GA
Moonshot AI Kimi K3vor Sept. 2026separat, als Basismodell für SWE-2 genutztBerichten zufolge bis zu 2,8 Billionen Parameter

Für Devin-Nutzer bedeutet der Umstieg auf SWE-2 in der Praxis: mehr Anfragen pro Kontingent, weil pro Aufgabe weniger Rechenzeit verbraucht wird. Für Cognition als Unternehmen bedeutet es eine strategische Wette, dass die Marge auf ein nachtrainiertes Modell mit gemieteter Basis besser skaliert als der Einkauf von API-Zugriff auf fremde Frontier-Modelle für die eigene Agenten-Plattform.

Integration in Devin und die Rolle von Windsurf

Cognition hat SWE-2 von Anfang an in seinen Coding-Agenten Devin eingebettet, nicht als eigenständiges Modell zur freien Auswahl präsentiert. Der Rollout erfolgte gestaffelt: zunächst Devin Desktop und die Kommandozeilen-Version, danach Devin Web und die kollaborative Fusion-Umgebung. Diese Reihenfolge deutet darauf hin, dass Cognition die stabilsten und am stärksten von Power-Usern genutzten Oberflächen zuerst mit dem neuen Modell ausstattet, bevor breitere, webbasierte Zugänge folgen.

Offen bleibt die genaue Rolle von Windsurf, dem Code-Editor, den Cognition im Sommer 2025 übernommen hatte. Aus den verfügbaren Quellen lässt sich kein bestätigtes SWE-2-Launchdatum für Windsurf ableiten, ebenso wenig eine Aussage darüber, ob das Modell die Windsurf-Cascade-Funktion antreibt oder ob Windsurf-Nutzer ein separates Kontingent erhalten. Ein Preisdetail ist jedoch dokumentiert: Bestehende Windsurf- und Devin-Pro-Kunden mit einem Alttarif von 15 US-Dollar wurden bei bisherigen Umstellungen mit Bestandsschutz behandelt. Ob dieser Bestandsschutz auch für den SWE-2-Zugang gilt, ist derzeit nicht öffentlich bestätigt.

Die Unklarheit rund um Windsurf zeigt ein generelles Muster bei Cognition: Das Unternehmen kommuniziert Modell-Releases sehr schnell und mit klaren Benchmark-Behauptungen, lässt aber Produktintegrationsfragen für Randprodukte länger offen. Für ein Unternehmen, das gleichzeitig einen Agenten (Devin), einen Editor (Windsurf) und jetzt ein eigenes nachtrainiertes Modell (SWE-2) betreibt, ist das eine nicht triviale Koordinationsaufgabe.

Wettbewerbsvergleich: SWE-2 gegen die Modellwelle der Großen

Die SWE-2-Veröffentlichung fällt in eine besonders dichte Phase neuer Coding-Modelle. In derselben Woche brachte GitHub Copilot mehrere neue Modelle in seinen Modellauswahl-Dialog: Claude Opus 5.5 für Pro+-, Max-, Business- und Enterprise-Kunden, GPT-6 Sol für dieselben höheren Stufen, GPT-6 Luna zusätzlich auch für einfache Pro-Abonnenten, sowie Grok 4.7, das ab dem 21. September 2026 schrittweise über VS Code, Visual Studio, die Copilot-CLI, Cloud-Agenten, JetBrains, Xcode und Eclipse ausgerollt wurde, wie GitHubs eigener Changelog-Eintrag dokumentiert.

Der entscheidende Unterschied zwischen Cognitions Ansatz und dem von GitHub Copilot liegt im Geschäftsmodell. Copilot fungiert zunehmend als modellunabhängige Auswahlschicht: Nutzer wählen aus einem Portfolio verschiedener Anbieter, die Preise und Verfügbarkeiten variieren je nach Abonnementstufe und Editor. Cognition dagegen verfolgt die entgegengesetzte Strategie und baut sich ein eigenes, exklusives Modell, das ausschließlich innerhalb der eigenen Produktfamilie läuft. Das ist eine Vertikalisierungswette, ähnlich der Strategie, die auch Anthropic mit Claude Code oder OpenAI mit Codex verfolgen: Wer das Modell selbst kontrolliert, ist nicht von den Preis- und Verfügbarkeitsentscheidungen fremder Anbieter abhängig.

Im direkten Leistungsvergleich schneidet SWE-2 bei den einfacheren, kürzeren Terminal-Aufgaben (Terminal-Bench 2.1) sogar besser ab als alle genannten Frontier-Modelle. Bei komplexeren, längeren Aufgabenketten (Terminal-Bench 4) fällt es dagegen deutlich zurück. Diese Diskrepanz deutet darauf hin, dass das Nachtraining von Kimi K3 gezielt auf häufige, alltägliche Coding-Muster optimiert wurde, während die Fähigkeit zu langem, mehrstufigem Reasoning nicht im gleichen Maß mitgewachsen ist wie bei den ressourcenintensiveren Trainingsprozessen von GPT-6 Astra oder Claude Fable 5.1.

Historischer Kontext: Von SWE-1.7 zu SWE-2

Um die Bedeutung von SWE-2 richtig einzuordnen, hilft ein Blick auf die Vorgängerversion. SWE-1.7 erreichte auf FrontierCode 1.1 Main nur 42,0 Prozent und auf Terminal-Bench 4 gerade einmal 7,6 Prozent. SWE-2 verbessert beide Werte drastisch: um 8 Prozentpunkte bei FrontierCode und um mehr als das Dreifache bei Terminal-Bench 4 (27,3 Prozent statt 7,6 Prozent). Das ist der größte Einzelsprung, den Cognition zwischen zwei Modellgenerationen bislang dokumentiert hat.

Cognition selbst ist seit der Gründung 2023 für aggressive Produkttakte bekannt. Devin wurde ursprünglich als vollautonomer Software-Ingenieur vermarktet, musste diesen Anspruch aber im Alltag relativieren, nachdem frühe unabhängige Tests die reale Erfolgsquote deutlich niedriger einstuften als die Marketingaussagen. Die Übernahme von Windsurf im Sommer 2025 folgte auf eine turbulente Phase, in der ein Großteil des ursprünglichen Windsurf-Teams zu Google gewechselt war. SWE-2 lässt sich als Versuch lesen, nach diesen Umbrüchen wieder eine technische Erzählung aufzubauen, die auf verifizierbaren Benchmark-Zahlen statt auf reinen Produktversprechen basiert.

Die Wahl, ein fremdes Basismodell wie Kimi K3 nachzutrainieren, statt ein eigenes von Grund auf zu entwickeln, ist ebenfalls eine Fortsetzung eines Branchentrends. Immer mehr Anwendungsanbieter verzichten auf die enormen Vortrainingskosten eines Frontier-Basismodells und konzentrieren ihre Ressourcen stattdessen auf das Post-Training für ihren spezifischen Anwendungsfall. Das senkt die Eintrittsbarriere für spezialisierte Agenten-Anbieter erheblich, führt aber auch dazu, dass die grundlegenden Fähigkeitsgrenzen des Basismodells durchschlagen, wie die Schwäche bei Terminal-Bench 4 zeigt.

Marktreaktion und was in den Quellen fehlt

Anders als bei größeren Finanzierungsrunden oder Bewertungssprüngen gibt es zur SWE-2-Veröffentlichung selbst keine dokumentierte Investorenreaktion und keine verifizierte neue Bewertungszahl. Die verfügbare Berichterstattung, etwa von MarkTechPost und Techtimes, wiederholt im Wesentlichen die von Cognition selbst veröffentlichten Benchmark- und Kostenaussagen, ohne dass unabhängige dritte Stellen die FrontierCode- oder Terminal-Bench-Werte eigenständig reproduziert hätten. Diese Abhängigkeit von Eigenangaben ist ein branchenweites Problem bei firmeneigenen Benchmarks: Ohne standardisierte, von Dritten kontrollierte Testsuiten bleibt jede Prozentzahl eine Behauptung des Anbieters, auch wenn sie plausibel klingt.

Gleichzeitig ist bemerkenswert, dass Cognition selbst offen kommuniziert, wo SWE-2 schwächelt. Die Terminal-Bench-4-Werte wurden nicht verschwiegen, sondern in derselben Vergleichstabelle wie die starken Terminal-Bench-2.1-Werte veröffentlicht. Das spricht für ein gewisses Maß an Transparenz, das in einer Branche, die regelmäßig mit selektiv ausgewählten Benchmarks wirbt, nicht selbstverständlich ist.

Was Entwickler und Unternehmen jetzt wissen müssen

Für Teams, die Devin bereits im Einsatz haben, lohnt sich der Umstieg auf SWE-2 bei den meisten alltäglichen Coding-Aufgaben, insbesondere bei kurzen bis mittleren Terminal- und Editier-Aufgaben, wo das Modell laut den vorliegenden Zahlen sogar vor GPT-6 Astra und Claude Fable 5.1 liegt. Bei sehr langen, mehrstufigen Agenten-Workflows mit vielen aufeinander aufbauenden Schritten sollten Teams dagegen mit Leistungseinbußen rechnen und im Einzelfall prüfen, ob ein teureres Frontier-Modell die zuverlässigere Wahl bleibt.

Wichtig ist auch die fehlende Preistransparenz. Wer Kosten über größere Projekte hinweg kalkulieren muss, kann sich derzeit nicht auf eine öffentliche Tarifliste stützen, sondern nur auf die relativen Prozentangaben von Cognition selbst. Unternehmen mit strengen Compliance- oder Budgetvorgaben sollten vor einer breiten Einführung eigene Kostenmessungen über reale Workloads durchführen, statt sich allein auf die Herstellerangaben zu verlassen.

Cognition als Unternehmen: Der Kontext hinter dem Release

Cognition wurde 2023 gegründet und positionierte Devin von Beginn an als einen der ambitioniertesten KI-Coding-Agenten am Markt. Über die vergangenen Jahre wuchs das Unternehmen sowohl durch eigene Produktentwicklung als auch durch die Übernahme von Windsurf zu einem Anbieter, der heute gleich drei Ebenen kontrolliert: einen Editor, einen autonomen Agenten und nun ein eigenes nachtrainiertes Modell. Diese Konsolidierung deckt sich mit einer allgemeinen Bewegung in der Branche, bei der Anbieter versuchen, möglichst viele Schichten des Coding-Stacks selbst zu besitzen, statt auf fremde API-Anbieter angewiesen zu sein.

Wie stark diese Strategie von Investoren goutiert wird, zeigt sich an Cognitions Finanzierungsgeschichte, die zuletzt eine deutlich höhere Bewertung erreichte als noch vor wenigen Monaten. SWE-2 selbst löste zwar keine neue, öffentlich dokumentierte Finanzierungsrunde aus, es fällt aber in eine Phase, in der Cognition erkennbar versucht, seine technische Substanz zu untermauern, statt allein auf Bewertungssprünge zu setzen. Für ein Unternehmen, dessen früherer Anspruch eines vollautonomen Software-Ingenieurs im Praxistest relativiert werden musste, ist eine Reihe nachvollziehbarer, offen kommunizierter Benchmark-Ergebnisse ein naheliegender Weg, verlorenes Vertrauen zurückzugewinnen.

Kritische Stimmen und offene technische Fragen

Trotz der positiven Kostenbilanz bleiben mehrere technische Fragen unbeantwortet. Cognition hat weder die genaue Aufteilung zwischen Gesamt- und aktiven Parametern von SWE-2 veröffentlicht, noch die Größe des Kontextfensters, den Tokenizer oder Details zur Inferenz-Architektur. Auch ist unklar, ob und in welchem Umfang Cognition dem Basismodell Kimi K3 einen zusätzlichen Planungs- oder Werkzeugnutzungs-Layer aufgesetzt hat, oder ob die beobachteten Verbesserungen ausschließlich aus dem Reinforcement-Learning-Nachtraining stammen. Diese Lücken sind für ein proprietäres Produkt nicht unüblich, schränken aber die Möglichkeit ein, SWE-2 wissenschaftlich fundiert mit offenen Modellen zu vergleichen.

Hinzu kommt die bereits erwähnte Schwäche bei Terminal-Bench 4. Ein Rückgang von 92,8 Prozent auf 27,3 Prozent zwischen zwei verwandten Testreihen ist ein außergewöhnlich großer Abfall und deutet darauf hin, dass SWE-2 bei Aufgaben, die viele aufeinanderfolgende Entscheidungen und eine konsistente Zustandsverfolgung über lange Zeiträume erfordern, an Grenzen stößt. Für einfache Bugfixes oder klar umrissene Feature-Implementierungen dürfte das kaum ein Problem sein. Bei umfassenden Refactorings oder Migrationen über mehrere Dateien und Abhängigkeiten hinweg sollten Teams die Ergebnisse von SWE-2 dagegen stichprobenartig genauer prüfen, bevor sie sie ungesehen übernehmen.

Fünf Prognosen für die kommenden Monate

  • Preistransparenz kommt nachträglich. Sobald Wettbewerbsdruck von Anbietern mit klaren Token-Preisen wie OpenAI oder Anthropic zunimmt, wird Cognition mit hoher Wahrscheinlichkeit doch noch eine offizielle Preisliste pro Million Token veröffentlichen, um API-Kunden außerhalb von Devin zu gewinnen.
  • Windsurf erhält SWE-2 innerhalb des vierten Quartals 2026. Da Cognition sowohl Devin als auch Windsurf betreibt, ist eine getrennte Modellstrategie langfristig ineffizient. Ein gemeinsamer Modell-Layer für beide Produkte ist die naheliegende nächste Konsolidierung.
  • Die Terminal-Bench-4-Lücke wird zum zentralen Kritikpunkt in unabhängigen Reviews. Je mehr Drittanbieter SWE-2 gegen komplexe, mehrstufige reale Projekte testen, desto stärker wird die Schwäche bei langen Agenten-Ketten in Fachpublikationen thematisiert werden.
  • Weitere Anbieter folgen dem Nachtrainings-Modell. Der Ansatz, ein fremdes Open-Weight-Modell wie Kimi K3 kostengünstig nachzutrainieren statt ein eigenes Basismodell zu bauen, wird 2027 von weiteren spezialisierten Coding-Startups kopiert werden, da die Kosten dafür deutlich unter denen eines vollständigen Frontier-Trainings liegen.
  • Der Kostenkrieg zwischen Copilot-Modellportfolio und vertikalisierten Anbietern wie Cognition verschärft sich. GitHub wird voraussichtlich weitere günstige Modelle wie GPT-6 Luna oder Gemini 3.8 Flash in den Vordergrund rücken, um dem Preisdruck spezialisierter Agenten-Anbieter wie Devin/SWE-2 entgegenzuwirken.

Einordnung für den DACH-Markt

Für österreichische und deutsche Softwareunternehmen ist die Entwicklung aus zwei Gründen relevant. Erstens verschärft jedes neue, günstigere Coding-Modell den Preisdruck auf etablierte Enterprise-Lizenzen, was Einkaufsabteilungen bei der nächsten Vertragsverhandlung mit GitHub, Anthropic oder Cognition als Argument nutzen können. Zweitens zeigt der Fall SWE-2 exemplarisch, wie schnell sich die Bewertungsgrundlage für KI-Coding-Tools verschiebt: Ein Modell, das im Frühjahr 2026 noch als Nischenprodukt eines einzelnen Agenten-Anbieters galt, konkurriert im Herbst desselben Jahres bereits auf Augenhöhe mit den Flaggschiffen der größten KI-Labore, zumindest bei bestimmten Aufgabentypen. Für Compliance- und Budgetverantwortliche in Unternehmen mit NIS2- oder DSGVO-Anforderungen bleibt zusätzlich relevant, dass Cognition als US-Unternehmen firmiert und Datenverarbeitung entsprechend außerhalb der EU erfolgen kann, was bei der Auswahl für regulierte Branchen geprüft werden sollte.

Häufig gestellte Fragen zu Cognition SWE-2

Was ist Cognition SWE-2 genau?

SWE-2 ist ein proprietäres Coding-Modell von Cognition, dem Unternehmen hinter dem KI-Agenten Devin. Es basiert auf einem Nachtraining von Moonshot AIs Kimi-K3-Modell und wurde am 10. September 2026 veröffentlicht.

Kann ich SWE-2 außerhalb von Devin nutzen?

Nach aktuellem Stand ist SWE-2 exklusiv in Devin integriert, verfügbar über Devin Desktop, die Devin-CLI sowie im Rollout für Devin Web und Fusion. Ein eigenständiger API-Zugang oder Open-Weight-Download ist nicht dokumentiert.

Wie viel kostet SWE-2?

Cognition hat keinen offiziellen Preis pro Million Token veröffentlicht. Das Unternehmen kommuniziert stattdessen relative Kostenvorteile von 64 bis 70 Prozent gegenüber vergleichbaren Frontier-Modellen wie Claude Fable 5.1. Neue Nutzer erhielten im ersten Monat kostenlosen Zugang über bestehende Pro-, Max- und Teams-Abonnements.

Ist SWE-2 besser als Claude Opus 5.5 oder GPT-6 Astra?

Das hängt von der Aufgabe ab. Bei kurzen Terminal-Aufgaben (Terminal-Bench 2.1) liegt SWE-2 mit 92,8 Prozent sogar vor den genannten Modellen. Bei komplexeren, mehrstufigen Aufgaben (Terminal-Bench 4) fällt SWE-2 mit 27,3 Prozent deutlich hinter GPT-6 Astra (57,9 Prozent) und Claude Fable 5.1 (55,8 Prozent) zurück. Ein direkter Vergleich mit Claude Opus 5.5 wurde in den verfügbaren Benchmark-Tabellen nicht veröffentlicht.

Läuft SWE-2 auch in Windsurf?

Ein bestätigtes Launchdatum für Windsurf, den von Cognition übernommenen Code-Editor, liegt derzeit nicht vor. Die bisherige Kommunikation von Cognition konzentriert sich ausschließlich auf die Devin-Produktfamilie.

Was ist FrontierCode 1.1 Main?

FrontierCode 1.1 Main ist ein von Cognition selbst verwendeter Benchmark zur Bewertung von Coding-Modellen. Er ist nicht mit dem in der Branche etablierten SWE-bench Verified identisch, weshalb ein direkter Vergleich mit älteren, auf SWE-bench basierenden Herstellerangaben nur eingeschränkt möglich ist.

Welches Basismodell steckt hinter SWE-2?

SWE-2 wurde aus Moonshot AIs Kimi K3 post-trainiert, einem Modell, das Berichten zufolge bis zu 2,8 Billionen Parameter umfasst. Die exakte Aufteilung zwischen Gesamt- und aktiven Parametern für die spezifische SWE-2-Konfiguration ist nicht öffentlich dokumentiert.

Wie reagiert der Markt auf die Veröffentlichung?

Eine unabhängig verifizierte Investoren- oder Bewertungsreaktion auf die SWE-2-Veröffentlichung selbst liegt nicht vor. Die Berichterstattung konzentriert sich überwiegend auf die von Cognition veröffentlichten Benchmark- und Kostenzahlen, ohne dass diese bislang durch unabhängige Dritte reproduziert wurden.