İçeriğe geç / Skip to content / Zum Inhalt

Gemini 4 Argon vs. Claude Opus 5.5 vs. GPT-6 Astra

Ahmet Balaman

5 Min. Lesezeit

Vibe CodingGemini 4 ArgonClaude Opus 5.5GPT-6 AstraBenchmarkKI
Gemini 4 Argon vs. Claude Opus 5.5 vs. GPT-6 Astra

Gemini 4 Argon ist nicht in allem das beste Modell. Die Tabellen aus Googles Ankündigung und aus unabhängigen Zusammenstellungen zeigen ein gemischtes Bild: Das Modell liegt bei langen Softwareaufgaben und bei Arbeit in Recht und Finanzen vorn, bei Aufgaben im Terminal und bei wissenschaftlich geprägten Aufgaben aber hinter Claude Opus 5.5 und GPT-6 Astra. Auf die Frage „Welches ist das beste?" gibt es keine einzelne Antwort; auf die Frage „Welches passt zu meiner Arbeit?" schon.

Dieser Artikel stellt die Modelle nebeneinander. Falls Sie Gemini 4 Argon selbst noch nicht kennen, lesen Sie zuerst Was ist Gemini 4 Pro (Argon)?.

Dieser Artikel ist eine Zusammenstellung; ich habe die drei Modelle nicht selbst an denselben Aufgaben getestet. Die Zahlen stammen aus Googles Ankündigung und der Zusammenstellung von DataCamp, eine unabhängige Reproduktion gab es am Veröffentlichungstag nicht. Die Quellen stehen am Ende.

Die Tabelle nebeneinander

Messung Gemini 4 Argon Claude Opus 5.5 GPT-6 Astra
DeepSWE v1.1 (lange Softwareaufgaben) 77,9 % 74,2 % 74,1 %
Vals Index (allgemeine Arbeitsaufgaben) 68,9 % 67,0 % 63,1 %
Terminal-Bench 4.0 57,4 % 66,4 % n/a
FrontierSWE v2 55,0 % n/a 65,5 %
CWE-bench v1 (Schwachstellenbehebung) 68 % n/a 68 %
GraphWalks (256.000 bis 1 Mio. Tokens) 84,2 % n/a 71,8 %

„n/a" bedeutet, dass die Zusammenstellung für dieses Modell keinen Wert übernommen hat, nicht dass das Modell nicht gemessen wurde.

Was bedeutet jede Messung?

DeepSWE und Vals. In beiden Messungen liegt Argon vorn. Der Abstand beträgt bei DeepSWE etwa drei Punkte, bei Vals gegenüber Claude Opus 5.5 etwa eineinhalb Punkte. Dieser Abstand ist klein; Messrauschen kann ihn auslöschen. Die Richtung ist aber konsistent.

GraphWalks. Hier liegt der deutlichste Vorteil: Im langen Kontext zwischen 256.000 und 1 Million Tokens kommt Argon auf 84,2 %, GPT-6 Astra auf 71,8 %. Wenn Sie mit sehr langen Dokumenten oder Codebasen arbeiten, ist dies die aussagekräftigste Zeile.

Terminal-Bench. Hier liegt Argon deutlich zurück: 57,4 % gegenüber 66,4 % bei Claude Opus 5.5. In Arbeitsabläufen, in denen ein Agent im Terminal Befehle ausführt, den Fehler liest und ihn behebt, also in dem, was Agenten wie Claude Code oder Hermes täglich tun, kann dieser Abstand wichtig sein.

FrontierSWE. Bei schwierigen Aufgaben aus einer Mischung von Wissenschaft und Programmierung liegt GPT-6 Astra mit 65,5 % zehn Punkte vor Argon mit 55,0 %.

Harvey-Rechtsagent. Argon 19,6 %, Fable 5.1 6,7 %, GPT-6 Astra 5,4 %. Die Zahlen sind niedrig, weil die Messung schwer ist; der relative Abstand ist aber groß. Wenn Sie juristisch arbeiten, ist dies der aussagekräftigste Vergleich.

Die Preisseite

Der Einführungspreis von Gemini 4 Argon beträgt 2 $ Eingabe und 10 $ Ausgabe pro Million Tokens, nach der Einführung 4 $ und 20 $. Für zwischengespeicherte Eingabe gibt es 95 % Rabatt. Laut einer der Zusammenstellungen lagen die Kosten pro Aufgabe im selben Aufgabenpaket während der Einführungsphase bei Argon bei etwa 1,99 $ und bei GPT-6 Astra bei 3,26 $. Lesen Sie das als Wert, den nur eine einzige Quelle meldet.

Die Preise von Claude Opus 5.5 und GPT-6 Astra nenne ich in diesem Artikel nicht: Für den Vergleich habe ich in meinen Quellen keine verlässliche Zahl, und statt etwas zu erfinden, empfehle ich einen Blick auf die offiziellen Preisseiten.

Wann welches Modell wählen?

Dieser Teil ist meine Interpretation; es sind allgemeine Schlüsse aus den Zahlen der Tabelle.

  • Sehr lange Dokumente, juristische oder finanzielle Texte, eine große Codebasis in einem Durchgang lesen: Das sind die Stärken von Argon.
  • Agentenschleifen, die im Terminal arbeiten, Befehle ausführen und Fehler suchen: Nach den aktuellen Zahlen liegt Claude Opus 5.5 vorn.
  • Schwierige wissenschaftliche und gemischte Programmieraufgaben: GPT-6 Astra.
  • Behebung von Sicherheitslücken: Argon und Astra liegen gleichauf.

Eine Tatsache steht aber im Raum: Argon können derzeit die meisten nicht nutzen. Wer Zugriff hat und wann er geöffnet wird, habe ich in einem eigenen Artikel beschrieben. Wenn Sie heute wählen, stehen Claude Opus 5.5 und GPT-6 Astra zur Auswahl. Wie Sie Werkzeuge an Ihrer eigenen Arbeit vergleichen, steht im Vergleich der Vibe-Coding-Werkzeuge.

Wie sollte man Benchmarks lesen?

Achten Sie auf drei Dinge:

  1. Die Zahlen am Veröffentlichungstag sind meist vom Hersteller ausgewählte Messungen. Google hebt in der Ankündigung die Messungen hervor, bei denen Argon vorn liegt; Terminal-Bench und FrontierSWE, wo es zurückliegt, tauchen in den Zusammenstellungen auf.
  2. Das Agenten-Framework verändert das Ergebnis. Dasselbe Modell erzielt in einem anderen Harness andere Werte. Das habe ich im Artikel zum Harness erklärt.
  3. Messen Sie Ihre eigene Aufgabe. Laut The Next Web sollen einige Google-Mitarbeiter bezweifelt haben, dass das Modell in realer Arbeit so gut ist wie in den Benchmarks. Fünf eigene Aufgaben sind lehrreicher als fünfzig fremde.

Häufige Fragen

Ist Gemini 4 Argon besser als Claude Opus 5.5?

Nach den angekündigten Zahlen liegt es bei DeepSWE und Vals leicht vorn und bei Terminal-Bench deutlich zurück. „Besser" hängt von der Art der Arbeit ab.

Welches ist besser zum Programmieren?

Bei langen Softwareaufgaben scheint Argon vorn zu liegen, bei Agenten-Arbeitsabläufen im Terminal Claude Opus 5.5. Wenn Sie aber keinen Zugriff auf Argon haben, ist die Frage vorerst theoretisch.

Kann ich Gemini 4 Argon zusammen mit Claude Opus 5.5 nutzen?

Argon hat noch keinen allgemeinen Zugang. Sobald er geöffnet ist, können Sie in Agentenwerkzeugen, die verschiedene Modelle über ein einziges Framework aufrufen, beide auswählen; das ist derzeit noch nicht testbar.

Welches ist günstiger?

Der Einführungspreis von Argon beträgt 2 $ / 10 $. Prüfen Sie die Preise der anderen Modelle auf den offiziellen Seiten; dieser Artikel nennt dafür keine Zahlen.

Quellen

Kommentare