Radar

radar · IA & agentes

OPUS 5 CLICK NOW

a tese

Opus 5 (Anthropic/Claude) é apresentado como um salto prático: melhores scores em muitos benchmarks e custo por tarefa menor que Fable 5 e comparável ao GPT‑5.6 Soul, com reduções explícitas em capacidades de ciberexploração e camadas de segurança/fallback.

aprofundar

sim

Porque, dada sua afinidade por agentes e questões de alinhamento/poder institucional, vale analisar os benchmarks, as mudanças de capacidade por medidas de segurança e as implicações práticas do custo‑por‑tarefa para implantação de agentes e governança.

O que foi dito

  • Abertura sobre carta de Jensen/Nvidia em favor de modelos open weights; Berman defende open source como antídoto à concentração de poder (Nvidia/Jensen citados).
  • Lançamento de Claude Opus 5: a família Opus (Haiku, Sonnet, Opus) ganha uma nova versão que, segundo os benchmarks exibidos, supera Fable 5 em muitos testes (Frontier code 43 vs 33; GDP val +100 pontos; Arc AGI 3 subiu para ~30% vs ~8% anterior; melhorias em OS World, Automation Bench; Deep Sui teve pequena queda).
  • Preço e eficiência: Opus 5 cotado em $5/mi input e $25/mi output (mesmo preço do Opus 4.8, metade do Fable); ênfase na métrica custo por tarefa (não preço por token) como o indicador relevante — gráficos mostram Opus 5 com maior desempenho e menor custo por tarefa vs Fable e GPT‑5.6 Soul.
  • Segurança e capacidade ofensiva: Opus 5 tem classificadores de segurança e fallback automático (possível redirecionamento para Opus 4.8); teste de exploração cibernética mostra redução de performance frente a modelos sem guardrails (Mythos 5 maior em exploits; Opus 5 reduzido), indicação de remoção deliberada de capacidades inseguras.
  • Fontes e validação: Benchmarks citados vêm de vários lugares — Box (patrocinador) rodou testes empresariais mostrando saltos (ex.: 63→78 em conjunto de tarefas documentais), ARC/Arc AGI (Greg) chamou o modelo de “o mais impressionante que vimos” mas está verificando resultados (suspeita de anomalia/cheating foi mencionada); também citados Val’s AI, Arena AI, Vulcan Bench, Kimmy K3, Codeex.
  • Avisos do autor: Berman teve acesso limitado e rápido ao modelo, tentou demos ao vivo que travaram; há especulação (não-confirmada) de que Opus 5 seja uma destilação/treinamento derivado de Fable; muitas afirmações ainda dependem de validação independente.

Mais de Matthew Berman

11 no radar
11/08Mark Zuckerberg just called out Dario (and Anthropic)aprofundar: talvez07/08What is Google even doing?aprofundar: talvez05/08Master Codex with these 15 Tipsaprofundar: talvez04/08Open-source is WINNINGaprofundar: não31/07GPT-5.6 just made itself better...aprofundar: não

todos os 11 vídeos de Matthew Berman no radar →