xAIs Grok 4.7 übertrifft die Modelle von Anthropic und OpenAI bei der Arbeit als Rechtsagent für weniger
Grok 4.7 wurde am Montag von xAI veröffentlicht. Es übertraf Anthropics Fable 5.1 und OpenAIs GPT-5.6 Sol in einem Benchmark für Rechtsagenten und verlangte dabei nur ein Fünftel des Preises von Fable pro Input-Token.
Der Output liegt bei 6 US-Dollar pro Million Token gegenüber 50 US-Dollar bei Anthropic
Laut einer Pressemitteilung von xAI erzielte Grok 4.7 im Harvey Legal Agent Benchmark 19,6 %. Fable 5.1 erreichte im selben Test 6,7 % und GPT-5.6 Sol 2,5 %.
Damit liegt Grok 4.7 etwa dreimal so hoch wie Anthropic und fast achtmal so hoch wie Sol. Cryptopolitan berichtete letzten Monat, dass Grok 4.6 die beiden mit 15,8 % bereits überholt habe.
Im juristischen Bereich ist Grok 4.7 einer der wenigen Anwendungsbereiche, in denen es beide Konkurrenten deutlich übertrifft. Auch im EEBench-Test für Elektrotechnik ist es Fable 5.1 überlegen und schlägt es im DeepSWE-Codierungstest sogar knapp.
Die Preisgestaltung von Grok 4.7 beträgt 2 US-Dollar pro Million Input-Token und 6 US-Dollar pro Million Output-Token, genau wie bei Grok 4.6. Dieser Input-Preis beträgt die Hälfte von GPT-5.6 Sols 4 US-Dollar und ein Fünftel von Fable 5.1s 10 US-Dollar.
Output liegt bei 6 $ gegenüber 20 $ bei Sol und 50 $ bei Fable, also etwa einem Achtel des Wertes von Anthropic.
xAI hat die CursorBench 4.0-Ergebnisse den durchschnittlichen Kosten pro abgeschlossener Aufgabe gegenübergestellt und behauptet, das Modell liege an der Preis-Leistungs-Grenze. Grok 4.7 erreicht in dieser Grafik etwa 46 % bei rund 6 US-Dollar pro Aufgabe, während Claude Opus 5 für ein vergleichbares Ergebnis fast doppelt so viel ausgeben muss.
Fable 5.1 erzielt bei höheren Budgets bessere Ergebnisse und erreicht bis zu 51,8 % Effizienz bei etwa 17 US-Dollar pro Aufgabe. Die Veröffentlichung sei „einetronKombination aus Intelligenz, Geschwindigkeit und niedrigen Kosten“, sagte Musk auf X.

Terminal-Bench 4.0 verschafft Anthropic einen Vorsprung von 57,9 % zu 38,0 %
Grok 4.7 belegte im GDPval-Test und im AA Briefcase-Büroarbeitstest den zweiten Platz hinter Fable 5.1. Das Modell von Anthropic führt weiterhin deutlich bei längeren Programmieraufgaben und Terminal-Benchmarks.
Den größten Unterschied zeigt sich bei Terminal-Bench 4.0, wo Fable 5.1 mit 57,9 % gegenüber Grok 4.7 mit 38,0 % punktete – ein Unterschied von rund 20 Punkten.
Fable ist auch führend bei CursorBench und HealthBench Professional im Bereich des klinischen Denkens, wo GPT-5.6 Sol ebenfalls Grok schlägt.
Grok 4.7 erreichte auf GDPval, einem Benchmark, der Modelle anhand von Aufgaben bewertet, die von Anwälten, Krankenschwestern und Finanzanalysten ausgeführt werden, 1.695 Elo-Punkte. Das ist ein Anstieg gegenüber den 1.605 Punkten von Grok 4.6. Damit liegt Grok 4.7 hinter Fable 5.1 mit 1.735 Punkten, aber vor den 1.542 Punkten, die OpenAIs neueres GPT-6 Astra auf derselben Skala erzielte.
Grok 4.7 liegt in fünf von sieben Benchmarks vor GPT-5.6 Sol. Lediglich bei DeepSWE und im klinischen Test muss es sich geschlagen geben.
Grok 4.7 arbeitet mit 2,1 Billionen Parametern, 40 % mehr als die 1,5 Billionen Parameter von Grok 4.6. xAI hat zusätzliche Trainingsdaten von SpaceX einbezogen, darunter Telemetriedaten des Starlink-Satelliten und Produktionsdatensätze.
Das Unternehmen gibt an, dass das Modell eher dazu neigt, sich länger mit schwierigen Problemen zu beschäftigen und seine eigenen Antworten zu überprüfen als Grok 4.6.
Das Modell wurde ohne Warteliste in der Grok-App, Cursor, Grok Build und der xAI-API veröffentlicht.
Alle hier angegebenen Zahlen stammen aus den eigenen Tests von xAI. CursorBench, der von xAI als erstes Testprogramm verwendet wird, wird von Cursor entwickelt, das SpaceX im letzten Monat übernommen hat.
xAI wurde mit GPT-5.6 Sol verglichen, und OpenAIs neueres GPT-6 Astra erscheint nur in den GDPval-, AA Briefcase- und EEBench-Charts.
Lesen Sie Krypto-News nicht nur, sondern verstehen Sie sie. Abonnieren Sie unseren Newsletter. Er ist kostenlos.
Empfohlene Artikel










Kommentare (0)
Klicken Sie auf die $-Schaltfläche, geben Sie das Symbol ein und wählen Sie eine Aktie, einen ETF oder einen anderen Ticker zum Verlinken aus.