Radar

radar · IA & agentes

AI News: ChatGPT Ultrafast, Grok 4.6, 3 New Open-Source Models, and more!

a tese

Boletim semanal de IA de Matthew Berman cobrindo modo ultrarrápido no ChatGPT via Cerebras, a marca d'água que a Anthropic passará a embutir na saída do Claude por exigência regulatória europeia, o Grok 4.6 com o produto Grokbot, e três lançamentos de peso em código aberto.

aprofundar

talvez

o vídeo é o formato de sempre (tom empolgado, benchmark desfilado sem crítica, e a alegação sobre a Cursor merece checagem), mas dois itens tocam o que você usa todo dia: a marca d'água nas saídas do Claude, com efeito potencial sobre texto longo redigido pelo modelo, e o Grokbot como concorrente direto do experimento OpenClaw.

O que foi dito

  • Abre com o tuíte de Paul Graham (acelerar o modelo é jogada esperta quando o cliente paga por token) e mostra o GPT 5.6 Soul rodando na infraestrutura da Cerebras, provedora de inferência com chips próprios, a cerca de 14 a 15 vezes a velocidade normal, cobrando a mais por isso.
  • Demonstra com um painel de terminal financeiro gerado em 1 minuto e 50 segundos contra 12 minutos e 20 na versão comum, e conclui que isso muda o modo de trabalhar: em vez de disparar dez agentes em paralelo e pagar o custo de alternar contexto entre eles, passa a fazer sentido manter dois ou três.
  • Observa que o gargalo deixou de ser o raciocínio do modelo e passou a ser chamada de ferramenta, código tradicional e CPU, o que empurra ainda mais o fluxo para agentes na nuvem.
  • Trata a marca d’água da Anthropic com desconfiança explícita, perguntando por que só ela faz isso, e atribui a decisão ao artigo 52 do AI Act europeu e ao código de prática sobre transparência de conteúdo gerado por IA.
  • O editor insere um bloco posterior com o esclarecimento publicado pela própria Anthropic: a marca d’água aproveita as escolhas de baixo risco entre palavras candidatas, trocando o gerador aleatório por uma função da chave e das palavras anteriores, de modo que o padrão é indetectável ao leitor e detectável a quem tem a chave.
  • Registra as ressalvas do documento: a marca só se prende ao que o Claude escreve, quase nada resta dela quando o modelo apenas revisa texto humano, e em código ela se aloja em escolhas arbitrárias como comentários, com efeito desprezível sobre o programa; Berman contrapõe que, se a fonte da aleatoriedade muda, a saída muda, e que isso valerá para os modelos futuros.
  • Afirma que a Cursor passou a integrar formalmente a SpaceX e apresenta o Grok 4.6 como salto grande em relação a seis meses atrás, próximo mas ainda abaixo do GPT 5.6 Soul e do Fable 5, a 2 dólares por milhão de tokens de entrada e 6 de saída.
  • Elogia o Grokbot como interface nova: esconde código, raciocínio e escolha de modelo, cada thread é um agente próprio, tem plugins para Slack, Google Docs e e-mail, e permite que agentes conversem entre si e deleguem, guardando essas conversas; descreve o produto como um OpenClaw mais simples e polido para público amplo.
  • Nos modelos abertos, apresenta o GLM 5.3 (salto claro sobre o 5.2 no Terminal Bench, superando o Kimi K3, mas abaixo de Fable e Soul), o DeepSeek V4 Pro (87,9 no Terminal Bench, quase empatado com Kimi K3 e Fable 5) com preços que caem pela metade fora do horário de pico e chegam a 2 centavos por milhão de tokens de entrada quando há acerto de cache, e o Muse Glimmer da Meta, modelo aberto de 30 bilhões de parâmetros pensado para rodar em GPU de desktop, com 51 no mesmo teste.
  • Fecha com o lançamento discreto do “computer history” da OpenAI, que grava o uso do computador para sugerir automações, com adesão opcional e controle por aplicativo; compara ao Recall da Microsoft, que foi destruído na estreia por questões de privacidade, e assume que gostava do recurso e provavelmente vai testar este também.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →