tradingkey.logo
tradingkey.logo
Suchen

SpaceX AI stellt Grok 4.7 vor: Flaggschiff-Generation für Coding und Wissensarbeit zum gleichen Preis wie Grok 4.6

TradingKeySep 21, 2026 5:43 PM

KI-Podcasts

facebooktwitterlinkedin
Alle Kommentare anzeigen0

SpaceXAI hat am 21. September Grok 4.7 veröffentlicht, sein bisher leistungsfähigstes Modell für Programmierung und Wissensarbeit. Bei unveränderten Preisen von 2 US-Dollar pro Million Input- und 6 US-Dollar pro Million Output-Tokens bietet das Modell signifikante Leistungssteigerungen, insbesondere bei langlaufenden Aufgaben und Dokumentenerstellung. Benchmarks wie CursorBench 4.0 und Terminal-Bench 4.0 zeigen deutliche Zuwächse bei verbesserter Kosteneffizienz. Ein neu geschriebener Sicherheits-Stack erhöht die Jailbreak-Resistenz, während das Modell ab sofort über gängige Plattformen verfügbar ist.

Von der KI erstellte Zusammenfassung

TradingKey – SpaceXAI (die KI-Sparte von SPXC, ehemals xAI) hat am 21. September Grok 4.7 veröffentlicht und positioniert es offiziell als seine bislang leistungsfähigste Modellgeneration für Programmierung und Wissensarbeit. Die Preise bleiben im Vergleich zu Grok 4.6 unverändert: 2 US-Dollar pro Million Input-Token und 6 US-Dollar pro Million Output-Token. Bei CursorBench 4.0, das speziell langlaufende Programmieraufgaben bewertet, erzielte Grok 4.7 ein Ergebnis von 46,3 % – 5,9 Prozentpunkte mehr als Grok 4.6. Nach offiziellen Angaben liegt es bei diesem Benchmark an der Spitze des Preis-Leistungs-Verhältnisses innerhalb seiner Preisklasse.

In den vergangenen zwei Jahren führten Leistungssteigerungen bei Spitzenmodellen typischerweise zu höheren Token-Stückpreisen: Generationen-Upgrades, Preiserhöhungen und das anschließende Warten darauf, dass die Branche die Inferenzkosten allmählich absorbiert. Grok 4.7 schlägt einen anderen Weg ein: Während die Leistungsfähigkeit weiter gesteigert wird, bleiben Preisgestaltung und Inferenzgeschwindigkeit auf dem Niveau von Grok 4.6, zusammen mit einer zusätzlichen schnellen Version, die die Ausgabegeschwindigkeit verdoppelt.

Die offiziell bekannt gegebenen Details konzentrieren sich auf vier Aspekte: Änderungen beim Basismodell und beim Reinforcement-Learning-Training, horizontale und vertikale Vergleiche über sieben Benchmarks hinweg, Kostenstrukturen bei langlaufenden Aufgaben sowie ein vollständig neu geschriebener Sicherheits-Guardrail-Stack. Darüber hinaus ist das Modell ab sofort gleichzeitig über Cursor, Grok Build, die Grok-API sowie Programmier-Frameworks von Drittanbietern und Modell-Routing-Plattformen verfügbar.

Das zentrale Leistungsversprechen von Grok 4.7 konzentriert sich auf drei Fähigkeiten: die Programmierung langlaufender Aufgaben, die Erstellung professioneller Dokumente und Sicherheits-Guardrails. Alle drei teilen dieselbe Preisstruktur – mit dem gleichen Preis und der gleichen Geschwindigkeit wie die Vorgängergeneration –, während eine schnelle Version genutzt wird, um latenzempfindliche Szenarien abzudecken.

Offizielle Benchmarks zeigen, dass die Fortschritte in dieser Modellgeneration kontinuierlich sind: CursorBench 4.0 verbesserte sich um 5,9 Prozentpunkte, Terminal-Bench 4.0 hat sich nahezu verdoppelt, AA Briefcase legte um 111 Punkte zu und das Modell erzielte das bisher höchste Ergebnis des Unternehmens bei Biosicherheits-Benchmarks. Zugleich verdeutlichen das absolute Niveau von 19,6 % bei juristischen Benchmarks und der Vorsprung von Fable 5.1 in vier Benchmarks, dass dies weiterhin eine Wettbewerbsrunde mit Gewinnen und Verlusten auf beiden Seiten ist und keine einseitige Ablösung.

Preise und Geschwindigkeit bleiben unverändert

Grok 4.7 startet bei 2 US-Dollar pro Million Input-Tokens und 6 US-Dollar pro Million Output-Tokens, identisch mit Grok 4.6, bei unveränderter Inferenzgeschwindigkeit. Eine offizielle Fast-Version ist ebenfalls verfügbar, die die doppelte Ausgabegeschwindigkeit der Standardversion zum doppelten Preis bietet.

Diese Preisgestaltung liegt im Vergleich zu ähnlichen Modellen am unteren Ende. Zum Vergleich: GPT-5.6 Sol kostet in der höchsten Stufe 4 US-Dollar für den Input und 20 US-Dollar für den Output, während Fable 5.1 in der höchsten Stufe 10 US-Dollar für den Input und 50 US-Dollar für den Output verlangt. Vergleicht man allein die Einzelpreise für den Output, liegt Grok 4.7 bei etwa einem Drittel des erstgenannten und rund einem Achtel des letztgenannten Modells.

Die praktische Auswirkung der unveränderten Preise sind überschaubare Migrationskosten. Teams, die bereits Grok 4.6 nutzen, können das Modell direkt in Cursor oder Grok Build wechseln und einen Vergleichstest mit ihren bestehenden Aufgaben-Suites durchführen, ohne dass Anpassungen an APIs oder Aufrufmethoden erforderlich sind.

Modellverbesserungen

Die Reinforcement-Learning-Phase für Grok 4.7 zeichnete sich zudem durch längere Trainingszeiten aus, wobei sich der Gesamtschwierigkeitsgrad der Trainingsaufgaben nach oben verschob und die Gewichtung stärker auf Probleme verlagert wurde, deren Bearbeitung Stunden erfordert. Das offizielle direkte Ergebnis ist, dass das Modell seine eigenen Ausgaben besser überprüfen und lange Kontexte besser verarbeiten kann.

Eine weitere Änderung betraf die Trainingsziele. Grok 4.7 wurde darauf trainiert, das Grok-Bot-Harness nativ zu verstehen, was eine bessere Leistung bei Dialogaufgaben und allgemeiner Wissensarbeit ermöglicht. SpaceXAI brachte Grok Bot am 11. August auf den Markt und beschrieb das System als eine Reihe kontinuierlich laufender Agenten, die jeweils mit einem eigenen Computer ausgestattet und in der Lage sind, innerhalb von Tools und Anwendungen zu arbeiten.

Die Fähigkeiten zur Erstellung von Dokumenten und Präsentationen wurden separat hervorgehoben. Offiziell zeigt Grok 4.7 in beiden Ausgabekategorien deutliche Verbesserungen gegenüber Grok 4.6 und agiert auf Augenhöhe mit anderen Frontier-Modellen.

Scorecard für sieben Benchmarks

Grok 4.7 schneidet bei der Erstellung von Dokumenten und Präsentationen besser ab. In den Tests GDPval und AA Briefcase ist die KI gefordert, die Arbeit von Fachkräften wie Juristen, Pflegekräften und Finanzanalysten zu übernehmen. Grok 4.7 übertraf Grok 4.6 in beiden Benchmark-Tests und erzielte eine Leistung auf Augenhöhe mit anderen Frontier-Modellen.

4-f85d422bc90543a498f2bd733762b144

[Offizielle Vergleichstabelle zu Programmierung, Terminal-Operationen, Elektrotechnik, Recht, klinischer Urteilsfähigkeit und Büroaufgaben. Quelle: x.ai]

Die größten Fortschritte zeigten sich in den Bereichen Recht und Terminal-Operationen. Beim Harvey Legal Agent Benchmark erzielte Grok 4.7 mit 19,6 % den höchsten Wert in dieser Gruppe, während GPT-5.6 Sol lediglich 2,5 % erreichte; beim Terminal-Bench 4.0 sprang Grok 4.7 von 20,3 % bei Grok 4.6 auf 38,0 % und verdoppelte sich damit nahezu. Die klinische Urteilsfähigkeit verbesserte sich um 8,2 Prozentpunkte, und die Ergebnisse bei Büroaufgaben stiegen um 111 Punkte.

Die Kostenkurve bei langen Aufgaben

Die offizielle Seite für CursorBench 4.0 zeigt drei Diagramme nebeneinander: durchschnittliche Kosten pro Aufgabe, durchschnittliche Output-Tokens und durchschnittliche Schritte, wobei die vertikale Achse auf dieselbe Punkteskala standardisiert ist. Der Referenzpunkt in den Diagrammen ist bei Sonnet 5 (Voreinstellung „High“) markiert: eine Punktzahl von 30,8 %, 3,48 US-Dollar pro Aufgabe, etwa 61.000 Output-Tokens und 85 Schritte, was als Baseline für den Kosteneffizienzvergleich dient.

5-7db9b361e8984e1f905267db471081e0

[Quelle: X.ai]

Beim Blick auf die Kostenkurve erreicht Fable 5.1 die höchste Punktzahl bei Kosten von fast 18 US-Dollar pro Aufgabe; GPT-5.6 Sol liegt auf der kostengünstigen Seite, wobei seine Punktzahl mit sinkenden Kosten deutlicher abfällt. Grok 4.7 ordnet sich zwischen den beiden ein, wobei offizielle Angaben das Modell an der Preis-Leistungs-Effizienzgrenze dieses Benchmarks sehen. Die Verläufe der Diagramme für Output-Tokens und Schrittanzahl spiegeln das Kostendiagramm wider, was darauf hindeutet, dass Kostenunterschiede in erster Linie auf die zur Aufgabenerfüllung erforderliche Reasoning-Länge und nicht auf den Einzelpreis selbst zurückzuführen sind.

Stellen Sie sich ein sechsköpfiges Backend-Team vor, das einen Dienst mit 400.000 Zeilen Code von einem alten Framework auf ein neues migriert. Eine solche Aufgabe in Einzelschritt-Commits zu zerlegen macht keinen Sinn; das Modell muss stundenlang kontinuierlich arbeiten und die Ergebnisse vorheriger Schritte laufend selbst überprüfen – genau das Szenario, das CursorBench 4.0 und Terminal-Bench 4.0 messen sollen. Erst wenn die Kosten pro Aufgabe von über zehn US-Dollar auf wenige US-Dollar sinken, wird ein Team dies voraussichtlich in den täglichen Arbeitsablauf einbinden, anstatt mit der Stapelverarbeitung bis zum Wochenende zu warten.

Sicherheit und Cybersicherheit

Grok 4.7 nutzt einen völlig neuen Sicherheits-Stack. Offiziell wird es als das bislang stärkste vom Unternehmen getestete Modell beschrieben, sowohl bei der Verweigerungsrate als auch bei der Jailbreak-Resistenz.

In Dual-Use-Bereichen wie Cybersicherheit und Biosicherheit decken die offiziellen Daten beide Seiten ab: Die Nutzbarkeit für legitime Aufgaben bleibt erhalten, während gefährliche Anfragen abgelehnt werden. Im Bereich Biosicherheit erzielte Grok 4.7 beim LatchBio-Biosicherheits-Benchmark 62,4 % – das höchste Ergebnis in diesem Benchmark. In der Cybersicherheit zeigte der hauseigene Benchmark HackerBench v0.3, dass das Modell nur 3,3 % der risikoreichen Dual-Use-Prompts zuließ, während legitime Sicherheitsforschung nur selten blockiert wurde.

SpaceXAI gab zudem bekannt, dass das Unternehmen begonnen hat, ausgewählten Cybersicherheitspartnern Zugang auf Einladung zu den Red-Teaming-Funktionen von Grok 4.7 für defensive Forschung anzubieten.

Dieser Inhalt wurde KI-übersetzt und von Menschen überprüft. Er dient nur zu Referenz- und Informationszwecken und stellt keine Anlageberatung dar.

Original lesen
Haftungsausschluss: Der Inhalt dieses Artikels stellt ausschließlich die persönlichen Meinungen des Autors dar und spiegelt nicht die offizielle Haltung von Tradingkey wider. Er sollte nicht als Anlageberatung betrachtet werden. Der Artikel dient nur zu Referenzzwecken, und Leser sollten keine Anlageentscheidungen ausschließlich auf dessen Inhalt basieren. Tradingkey übernimmt keine Verantwortung für Handelsergebnisse, die sich aus dem Vertrauen auf diesen Artikel ergeben. Darüber hinaus kann Tradingkey die Genauigkeit des Inhalts des Artikels nicht garantieren. Bevor Sie Anlageentscheidungen treffen, ist es ratsam, einen unabhängigen Finanzberater zu konsultieren, um die damit verbundenen Risiken vollständig zu verstehen.

Kommentare (0)

Klicken Sie auf die $-Schaltfläche, geben Sie das Symbol ein und wählen Sie eine Aktie, einen ETF oder einen anderen Ticker zum Verlinken aus.

0/500
Richtlinien für Kommentare
Wird geladen...

Empfohlene Artikel

tradingkey.logo
Risikohinweis: Unsere Website und mobile App bieten lediglich allgemeine Informationen zu bestimmten Anlageprodukten. Finsights stellt keine Finanzberatung oder Empfehlung für ein Anlageprodukt bereit, und die Bereitstellung solcher Informationen darf nicht als Finanzberatung durch Finsights ausgelegt werden.
Anlageprodukte unterliegen erheblichen Anlagerisiken, einschließlich des möglichen Verlusts des investierten Kapitals und sind möglicherweise nicht für jeden geeignet. Die vergangene Wertentwicklung von Anlageprodukten ist nicht unbedingt ein Hinweis auf deren zukünftige Wertentwicklung.
Finsights kann Drittanbietern oder Partnern erlauben, Werbung auf unserer Website oder in unserer mobilen App oder in Teilen davon zu platzieren oder bereitzustellen. Finsights kann für diese Anzeigenvergütung erhalten, basierend auf Ihrer Interaktion mit den Werbeanzeigen.
© Urheberrecht: FINSIGHTS MEDIA PTE. LTD. Alle Rechte vorbehalten.