tradingkey.logo
tradingkey.logo
Pesquisar

O Grok 4.7 da xAI supera os modelos da Anthropic e da OpenAI no trabalho dos agentes jurídicos por menos

Cryptopolitan22 de set de 2026 às 11:50
facebooktwitterlinkedin
Ver todos os comentários0

A xAI lançou o Grok 4.7 na segunda-feira. Superou o Fable 5.1 da Anthropic e o GPT-5.6 Sol da OpenAI num teste de benchmark de agentes legais, cobrando um quinto do preço do Fable por token de entrada.

A produção ronda os 6 dólares por milhão de tokens, contra os 50 dólares na Anthropic

O comunicado da xAI informou que o Grok 4.7 obteve 19,6% no teste Harvey Legal Agent Benchmark. O Fable 5.1 alcançou 6,7% no mesmo teste e o GPT-5.6 Sol, 2,5%.

Isto coloca o Grok 4.7 com cerca de três vezes a pontuação do Anthropic e quase oito vezes a do Sol. Cryptopolitan noticiou no mês passado que o Grok 4.6 já liderava esta dupla com 15,8%.

O trabalho jurídico é um dos poucos domínios em que o Grok 4.7 supera completamente os seus dois concorrentes. Também supera o Fable 5.1 no teste de engenharia elétrica do EEBench e ultrapassa-o ligeiramente no teste de programação DeepSWE.

O preço do Grok 4.7 é de 2 dólares por milhão de tokens de entrada e 6 dólares por milhão de tokens de saída, o mesmo que o do Grok 4.6. Esta taxa de entrada é metade da taxa de 4 dólares do GPT-5.6 Sol e um quinto da taxa de 10 dólares do Fable 5.1.

O preço de saída é de 6 dólares, contra 20 dólares para Sol e 50 dólares para Fable, cerca de um oitavo do valor cobrado por Anthropic.

A xAI comparou os resultados do CursorBench 4.0 com o custo médio por tarefa concluída e afirma que o modelo se encontra na fronteira entre o custo e o desempenho. O Grok 4.7 atinge cerca de 46% neste gráfico a um custo de aproximadamente 6 dólares por tarefa, enquanto o Claude Opus 5 exige um investimento quase duas vezes superior para um resultado semelhante.

O Fable 5.1 tem um melhor desempenho com orçamentos mais elevados, atingindo os 51,8% com cerca de 17 dólares por tarefa. O lançamento foi "uma combinaçãotronde inteligência, velocidade e baixo custo", disse Musk no X.

O Grok 4.7 supera o Fable 5.1 e o GPT-5.6 Sol no teste de agente legal da Harvey com um quinto do custo de entrada do Fable.
Preços dos tokens e pontuações de referência da publicação sobre o lançamento do Grok 4.7 da SpaceXAI , publicada a 21 de setembro de 2026.

O Terminal-Bench 4.0 dá à Anthropic uma vantagem de 57,9% contra 38,0%

O Grok 4.7 ficou em segundo lugar, atrás do Fable 5.1, no GDPval e no teste de trabalho de escritório AA Briefcase. O modelo da Anthropic mantém uma clara vantagem em testes de codificação mais longos e benchmarks de terminal.

A margem mais elevada foi observada no Terminal-Bench 4.0, onde o Fable 5.1 obteve 57,9% contra 38,0% no Grok 4.7, uma diferença de cerca de 20 pontos percentuais.

O Fable também lidera no CursorBench e no raciocínio clínico do HealthBench Professional, onde o GPT-5.6 Sol também supera o Grok.

O Grok 4.7 alcançou 1.695 pontos Elo no GDPval, que avalia modelos em tarefas realizadas por advogados, enfermeiros e analistas financeiros, um aumento face aos 1.605 pontos do Grok 4.6. Este resultado fica atrás dos 1.735 pontos do Fable 5.1, mas à frente dos 1.542 pontos obtidos pelo GPT-6 Astra, da OpenAI, na mesma avaliação.

O Grok 4.7 supera o GPT-5.6 Sol em cinco dos sete benchmarks. Perde apenas no DeepSWE e no ensaio clínico.

O Grok 4.7 utiliza 2,1 triliões de parâmetros, mais 40% do que os 1,5 triliões do Grok 4.6. A xAI incluiu dados de treino suplementares da SpaceX, incluindo telemetria do satélite Starlink e registos de fabrico.

A empresa afirma que o modelo tem maior probabilidade de dedicar tempo extra a problemas complexos e de verificar as suas próprias respostas do que o Grok 4.6.

O modelo foi lançado na aplicação Grok, Cursor, Grok Build e na API xAI, sem lista de espera.

Todos os números aqui apresentados são provenientes dos testes realizados pela própria xAI. O CursorBench, o teste principal da xAI, é desenvolvido pela Cursor, empresa que a SpaceX concluiu a aquisição no mês passado.

O xAI foi comparado com o GPT-5.6 Sol, e o GPT-6 Astra, mais recente da OpenAI, apenas aparece nos gráficos GDPval, AA Briefcase e EEBench.

Não se limite a ler notícias sobre criptomoedas. Compreenda-as. Assine nossa newsletter. É grátis.

Aviso legal: as informações fornecidas neste site são apenas para fins educacionais e informativos e não devem ser consideradas consultoria financeira ou de investimento.

Comentários (0)

Clique no botão $, digite o código do ativo e selecione para vincular uma ação, ETF ou outro ticker.

0/500
Diretrizes de comentários
Carregando...

Artigos recomendados

tradingkey.logo
Aviso de risco: Nosso site e aplicativo móvel fornecem apenas informações gerais sobre determinados produtos de investimento. A Finsights não oferece, e o fornecimento de tais informações não deve ser interpretado como se a Finsights estivesse oferecendo, aconselhamento financeiro ou recomendação para qualquer produto de investimento.
Os produtos de investimento estão sujeitos a riscos significativos, incluindo a possível perda do valor investido e podem não ser adequados para todos. O desempenho passado dos produtos de investimento não é indicativo de seu desempenho futuro.
A Finsights pode permitir que anunciantes ou afiliados realizem, ou forneçam anúncios em nosso site, ou aplicativo móvel, ou em qualquer parte deles e pode ser compensada por eles com base em sua interação com os anúncios.
 © Copyright: FINSIGHTS MEDIA PTE. LTD. Todos os direitos reservados.