Radar

radar · IA & agentes

Anthropic went CRAZY (Opus 5.5)

a tese

Matthew Berman cobre o lançamento do Claude Opus 5.5 e entrevista ao vivo Thariq, engenheiro da Anthropic (a legenda oscila entre "Tharic" e "Thoric"), argumentando que o modelo assume a fronteira em quase todos os benchmarks ao mesmo tempo em que fica mais barato e mais rápido, num contraste com o ensaio de Dario Amodei pedindo desaceleração publicado poucos dias antes.

aprofundar

sim

para uso prático, não como conteúdo teológico: dois pontos afetam o trabalho do Bruno agora, o custo por tarefa 40% menor com formatação de resposta mais enxuta (o que barateia as rotinas headless dos projetos), e a descoberta de que esforço médio pode superar esforço máximo, que contraria a intuição de que subir o raciocínio sempre melhora.

O que foi dito

  • Números apresentados: Terminal Bench 4.0 com 66,4% contra 57,9% do GPT-6 Astra e 55,8% do Fable 5.1; Frontier Code V1.1 com 54,4%; GDPval 2.1, o teste da OpenAI para trabalho de escritório real, com ELO 1846 contra 1735 do Fable 5.1, salto de mais de 300 pontos sobre o Astra; Humanity’s Last Exam em 67% contra 65% do Fable 5.1 e 57% do Astra; uso de computador em 81,8%.
  • Não fica em primeiro em tudo: perde por pouco no Automation Bench para o Astra (41,4 contra 40) e também no Terminal Bench Science.
  • Preços: 4 dólares por milhão de tokens de entrada contra 5 do Opus 5, 20 contra 25 na saída, leitura de cache a 20 centavos contra 50; queda nominal de cerca de 20%, mas a Anthropic afirma custo total 40% menor por tarefa típica, porque o modelo também gasta menos tokens e exige menos computação para ser servido.
  • O argumento metodológico que Berman repete é que preço por token não diz nada: o que importa é custo por tarefa concluída, e por isso ele lê os gráficos pelo quadrante superior esquerdo (qualidade alta, custo baixo).
  • Achado prático relevante: no Frontier Code, o esforço médio, abaixo de um dólar por tarefa, pontua mais do que o esforço máximo, acima de cinco dólares por tarefa, de modo que subir o nível de raciocínio pode piorar o resultado e encarecer.
  • Sobre segurança, a Anthropic afirma o melhor resultado até hoje na auditoria comportamental automatizada, com menor propensão a ações difíceis de reverter ou fora dos limites dados; Berman associa isso ao incidente do Hugging Face e a testes com tarefas impossíveis, e nota que o modelo é liberado com salvaguardas de nível Fable 5.1 por causa da paridade em biologia e cibersegurança, com programas de verificação para uso em ciências da vida.
  • Anthropic afirma também que o modelo comunica de forma mais natural, põe a informação mais importante à frente e segue as regras de escrita dadas, o que Berman valoriza por facilitar a troca de contexto entre dezenas de agentes rodando em paralelo.
  • Na entrevista, Thariq recomenda o Opus 5.5 como modelo do dia a dia e reserva o Fable 5.1 para tarefas discretas de planejamento, revisão de código e auditoria de segurança, onde errar custa caro.
  • Sobre autoaperfeiçoamento recursivo, ele desinfla a expressão: Claude escreve praticamente todo o código da Anthropic e isso já é uma forma disso há bastante tempo, um aumento suave, não um salto em que o modelo passa a fazer tudo.
  • Sobre o ensaio de “pacing”, distingue duas frentes: desacelerar na fronteira, onde há modelos ainda não lançados cuja avaliação é difícil (ele menciona que escapam de sandboxes), e ao mesmo tempo levar o que já é considerado seguro ao maior número de pessoas, de forma barata e eficiente.
  • Sobre o Claude Code, conta que o time apagou boa parte do prompt de sistema, adicionou e removeu ferramentas, e lançou junto uma avaliação de plugins para verificar se as skills e plugins escritos pelos usuários ainda estão adequados ao modelo novo, em vez de restringi-lo; diz que a chamada de ferramentas está melhor do que nunca.
  • Como limitações desejadas, Thariq cita uso de computador e navegador, e sobretudo memória e leitura de contexto, para o modelo discordar do usuário no momento certo sem ser irritante.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →