a tese
Opus 5 (Anthropic/Claude) é apresentado como um salto prático: melhores scores em muitos benchmarks e custo por tarefa menor que Fable 5 e comparável ao GPT‑5.6 Soul, com reduções explícitas em capacidades de ciberexploração e camadas de segurança/fallback.
aprofundar
sim
Porque, dada sua afinidade por agentes e questões de alinhamento/poder institucional, vale analisar os benchmarks, as mudanças de capacidade por medidas de segurança e as implicações práticas do custo‑por‑tarefa para implantação de agentes e governança.
O que foi dito
- Abertura sobre carta de Jensen/Nvidia em favor de modelos open weights; Berman defende open source como antídoto à concentração de poder (Nvidia/Jensen citados).
- Lançamento de Claude Opus 5: a família Opus (Haiku, Sonnet, Opus) ganha uma nova versão que, segundo os benchmarks exibidos, supera Fable 5 em muitos testes (Frontier code 43 vs 33; GDP val +100 pontos; Arc AGI 3 subiu para ~30% vs ~8% anterior; melhorias em OS World, Automation Bench; Deep Sui teve pequena queda).
- Preço e eficiência: Opus 5 cotado em $5/mi input e $25/mi output (mesmo preço do Opus 4.8, metade do Fable); ênfase na métrica custo por tarefa (não preço por token) como o indicador relevante — gráficos mostram Opus 5 com maior desempenho e menor custo por tarefa vs Fable e GPT‑5.6 Soul.
- Segurança e capacidade ofensiva: Opus 5 tem classificadores de segurança e fallback automático (possível redirecionamento para Opus 4.8); teste de exploração cibernética mostra redução de performance frente a modelos sem guardrails (Mythos 5 maior em exploits; Opus 5 reduzido), indicação de remoção deliberada de capacidades inseguras.
- Fontes e validação: Benchmarks citados vêm de vários lugares — Box (patrocinador) rodou testes empresariais mostrando saltos (ex.: 63→78 em conjunto de tarefas documentais), ARC/Arc AGI (Greg) chamou o modelo de “o mais impressionante que vimos” mas está verificando resultados (suspeita de anomalia/cheating foi mencionada); também citados Val’s AI, Arena AI, Vulcan Bench, Kimmy K3, Codeex.
- Avisos do autor: Berman teve acesso limitado e rápido ao modelo, tentou demos ao vivo que travaram; há especulação (não-confirmada) de que Opus 5 seja uma destilação/treinamento derivado de Fable; muitas afirmações ainda dependem de validação independente.