Zum Inhalt springen
Tech & Tacheles„Klartext zu KI, Security und Crypto"
← Alle Beiträge
Künstliche Intelligenz September 14, 2026

Cognition SWE-2: Coding-Modell auf Kimi-K3-Basis erreicht fast Frontier-Niveau – zu 64 Prozent geringeren Kosten

Cognition SWE-2 erreicht 50,0 % auf FrontierCode – knapp unter Fable 5.1 bei 64 % weniger Kosten. Basis ist das offene Kimi K3. Was die Zahlen taugen und wie du Coding-Agenten selbst bewertest.

Cognition SWE-2: Coding-Modell auf Kimi-K3-Basis erreicht fast Frontier-Niveau – zu 64 Prozent geringeren Kosten

Cognition SWE-2 ist das neue Coding-Modell hinter dem KI-Agenten Devin – und ein weiterer Beleg dafür, dass die Frontier-Modelle Konkurrenz von unten bekommen. Cognition hat SWE-2 am 10. September 2026 vorgestellt und meldet 50,0 Prozent auf dem eigenen Benchmark FrontierCode 1.1 Main. Das liegt weniger als einen Punkt unter Anthropics Fable 5.1 – bei laut Hersteller 64 Prozent geringeren Kosten. Was hinter den Zahlen steckt und wo die Grenzen liegen.

Was Cognition vorgestellt hat

SWE-2 ist kein von Grund auf neu trainiertes Modell. Basis ist Kimi K3, das offene Modell von Moonshot AI mit 2,8 Billionen Parametern, das bereits stark auf agentisches Programmieren optimiert war. Cognition hat darauf per Reinforcement Learning nachtrainiert – nach demselben Rezept wie beim Vorgänger SWE-1.7, der auf Kimi K2.7 aufsetzte. Laut Cognition holt das RL-Training noch einmal fünf bis sechs Punkte auf mehreren Benchmarks heraus.

Newsletter

Klartext ins Postfach

KI, Security & Crypto – die wichtigsten Analysen, kein Spam. Jederzeit abbestellbar.

Die technische Neuerung: Statt die Reasoning-Stufen („medium”, „high”, „max”) getrennt zu trainieren und anschließend zusammenzuführen – so macht es Moonshot bei Kimi K3 –, trainiert Cognition alle drei Stufen in einem einzigen RL-Durchgang. Jede Stufe bekommt eine eigene lineare Kostenstrafe, die an die Steigung der Kosten-Leistungs-Kurve des Basismodells angepasst ist. Das Ergebnis ist ein Modell, das auf einfachen Aufgaben schnell zur Sache kommt – SWE-2 medium braucht auf FrontierCode 58 Prozent weniger Schritte und kostet 81 Prozent weniger als SWE-1.7 – und auf komplexen Aufgaben mehr plant und verifiziert.

Die von Cognition veröffentlichten Zahlen im Überblick: FrontierCode 1.1 Main 50,0 Prozent (Fable 5.1: 50,9, GPT-6 Astra: 53,3), DeepSWE 1.1 73,0 Prozent, Terminal-Bench 2.1 92,8 Prozent – dort führt SWE-2 das Feld an. Der klare Schwachpunkt ist Terminal-Bench 4: 27,3 Prozent gegenüber 55,8 (Fable 5.1) und 57,9 (GPT-6 Astra), also rund 30 Punkte Rückstand.

Verfügbar ist SWE-2 ab sofort in Devin Desktop und der Devin-CLI; Devin Web und Fusion folgen. Offene Gewichte veröffentlicht Cognition nicht; eine eigenständige Modell-API gibt es laut Berichten ebenfalls nicht – SWE-2 ist nur innerhalb von Devin nutzbar.

Was das für dich bedeutet

Zuerst die Quellenkritik, die bei Benchmark-Meldungen Pflicht ist: FrontierCode ist Cognitions eigener Benchmark, und die Vergleichswerte der Konkurrenz stammen – wo keine öffentlichen Zahlen existieren – aus Cognitions eigener Messung im jeweils nativen Harness. Das ist transparent dokumentiert, aber es bleibt eine Hersteller-Evaluation. Die 30 Punkte Rückstand auf Terminal-Bench 4 zeigen außerdem, dass „innerhalb eines Punktes” nur für einen Ausschnitt gilt. Wer Coding-Agenten evaluiert, sollte mit dem eigenen Repository testen, nicht mit der Tabelle.

Interessanter als die Zahl ist das Muster. Ein offenes chinesisches Modell wird von einem US-Anbieter per RL veredelt und landet auf drei von vier Coding-Benchmarks auf Augenhöhe mit den teuersten geschlossenen Modellen. Das ist derselbe Mechanismus, den OpenAIs Kündigung des Cursor-Zugangs Ende August sichtbar gemacht hat: Wer als Tool-Anbieter von einem Frontier-Modell abhängt, ist erpressbar. Cognition baut sich mit SWE-2 genau diese Unabhängigkeit.

Für Unternehmen mit Compliance-Anforderungen ist der zweite Blick wichtig: Offenes Basismodell heißt nicht offenes Produkt. Das Modell selbst läuft ausschließlich in Cognitions Cloud – auch bei den Enterprise-Varianten mit dediziertem Single-Tenant-Deployment oder kundenverwalteten Schlüsseln bleibt das „Brain” bei Cognition. Dein Code wird also dort verarbeitet; Enterprise-Kunden sichert Cognition laut Dokumentation zu, ohne schriftliche Zustimmung nicht darauf zu trainieren. Cognition hat immerhin eine eigene Trustworthiness-Prüfung veröffentlicht (Zensur-Test mit 145 politisch sensiblen Fragen zu China, SWE-2 besteht 98 Prozent), was ich bei einem Kimi-Derivat für angemessen halte – als Selbstauskunft, nicht als Audit.

Konkrete Handlungsempfehlung

  • Effort-Stufen bewusst nutzen: Wenn dein Coding-Agent Reasoning-Stufen anbietet, stell für Routineaufgaben (Tests ergänzen, kleine Refactorings) die niedrigste Stufe ein. Cognitions Zahlen zeigen, dass die niedrigste Stufe deutlich weniger Schritte braucht (im Mittel 53 gegenüber 80 bei „high” und 98 bei „max”) und dass SWE-2 medium den Vorgänger bei 81 Prozent geringeren Kosten schlägt. Einen genauen Kostenabstand zwischen den Stufen nennt Cognition nicht. Das gilt sinngemäß auch für andere Anbieter.
  • Eigener Mini-Benchmark: Nimm zehn abgeschlossene Tickets aus deinem Backlog, deren Lösung du kennst, und lass Kandidaten-Modelle daran arbeiten. Miss Kosten pro gelöstem Ticket, nicht Kosten pro Token. Das ist die Kennzahl, die Cognition selbst optimiert.
  • Datenfluss klären: Vor dem Einsatz eines gehosteten Coding-Agenten prüfen, ob Repository-Inhalte zu Trainingszwecken verwendet werden dürfen und wo sie verarbeitet werden. Bei SWE-2 gibt es keine On-Premises-Option, nur von Cognition gehostete Deployments (auch als dedizierter Tenant) – für manche Branchen ein K.-o.-Kriterium.

Wie OpenAI auf denselben Markt zielt, habe ich beim Start der Agents API beschrieben. Der Wettbewerb um den Coding-Agenten findet gerade nicht bei der Modellgröße statt, sondern beim Preis pro gelöster Aufgabe.

Quellen

Dranbleiben

Diese Analysen als Newsletter

Ein Mal pro Woche Klartext zu KI, Security & Crypto – direkt in dein Postfach.

Jetzt anmelden