Radar

radar · IA & agentes

Did Elon catch up? (Grok 4.7 is here)

a tese

Matthew Berman avalia o lançamento do Grok 4.7 contra a previsão de Elon Musk de que ele igualaria o Opus 5 e conclui que ficou perto, não à frente: é um modelo um passo atrás da fronteira, muito barato pelo desempenho, com seleção conveniente de benchmarks no material de divulgação.

aprofundar

não

É cobertura de lançamento com boa dose de patrocínio, útil apenas como panorama de preço e posição relativa dos modelos nesta semana, e envelhece no próximo lançamento.

O que foi dito

  • Musk havia previsto que o 4.7 ficaria “mais ou menos no nível do Opus 5, não do 5.1”, e antes disso, em agosto, que superaria todos os modelos existentes; Berman conclui que a primeira previsão se confirmou e a segunda não.
  • No Cursorbench (lembrando que a xAI comprou a Cursor, o que ele pede ao espectador para levar em conta), o Grok 4.7 fica logo atrás do Opus 5 no esforço máximo de raciocínio, mas a metade do custo; o salto entre esforço baixo (33%) e esforço extra-alto (46,3%) é um dos maiores da tabela.
  • Aponta a seleção de benchmarks: o GPT-6 Astra aparece em algumas tabelas do blog e some justamente naquela em que perderia; Berman pediu ao próprio Astra que refizesse a tabela incluindo-se, e no SWE-bench o resultado fica Grok 71%, Fable 5.1 70%, GPT-5.6 Soul 72,7% e Astra Max 74,1%.
  • No Terminal-bench, que ele considera decisivo para codificação agêntica, o Grok fica bem atrás, 38% contra 57,9% do Fable e 58,2% do Astra; em trabalho jurídico, ao contrário, o Grok domina todos os modelos grandes com 19,6%, mas é batido por um modelo menos conhecido, o Muse Spark, com 42%.
  • O argumento de preço: 2 dólares por milhão de tokens de entrada e 6 de saída, contra mais que o dobro no GPT-5.6 Soul e cinco vezes mais no Fable 5.1 e no Astra; ele atribui isso em parte ao excesso de capacidade computacional que a xAI comprou sem ter modelo de fronteira para justificar a demanda.
  • A métrica que ele defende como a que realmente importa não é a pontuação, e sim o custo por tarefa concluída, combinação de preço por token com quantos tokens o modelo gasta para chegar ao fim; nesse critério o Fable 5.1 pontua mais alto mas sai muito mais caro, e a Artificial Analysis observa que os ganhos do Grok 4.7 vieram com maior consumo de tokens.
  • Cita um tuíte de Gavin Baker segundo o qual 62% dos tokens usados por empresas já vão para modelos de pesos abertos contra 38% de fechados, enquanto o valor econômico continua concentrado em OpenAI e Anthropic, e formula a regra: não se cobra preço de fronteira sem entregar a melhor resposta.
  • No índice da Artificial Analysis, o Grok 4.7 em esforço extra-alto aparece em quinto, com Fable 5.1 e Astra empatados no topo, Opus 5 em terceiro e o Muse Spark 1.3 Max, de pesos abertos, em quarto, o que ele destaca como prova de que um modelo quase de fronteira pode ser aberto.
  • Registra duas limitações práticas: a janela de contexto do Grok é de 500 mil tokens contra o milhão dos demais modelos de fronteira, e um teste independente comparando o Grok 4.7 ao Kimi K3 saiu bastante desfavorável ao primeiro, ressalvando que não sabe as configurações usadas.
  • Musk explicou o adiamento do lançamento dizendo que talvez tenham “penalizado demais o comprimento da resposta ou algo assim” no aprendizado por reforço, e que o modelo desistia cedo de tarefas difíceis e não verificava bem o próprio trabalho; depois comemorou que o 4.7 coloca a xAI em terceiro lugar em codificação agêntica, atrás de Anthropic e OpenAI.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →