Radar

radar · IA & agentes

What did Anthropic do?! (Opus 5)

a tese

Anthropic lançou Claude Opus 5, que segundo o vídeo supera Fable 5 em grande parte dos benchmarks e reduz custo por tarefa; ganhou desempenho prático sem aumentar preço (mesmo preço do Opus 4.8, metade do Fable).

aprofundar

sim

— relevante para você porque trata de trade-offs cruciais para agentes: custo por tarefa, fallback/safety classifiers e mitigação de capacidades (guardrails) — aspectos práticos e éticos úteis para projetar e avaliar agentes em contextos teológicos/filosóficos e aplicações críticas.

O que foi dito

  • Claude Opus 5 anunciado por Anthropic; afirmação central: bate Fable 5 em quase todos os benchmarks e é mais eficiente em custo por tarefa; preço informado $5/ milhão input e $25/ milhão output (igual ao Opus 4.8, metade do Fable).
  • Benchmarks citados: Frontier Bench, GDP val (OpenAI), ARC AGI 3 (salto para ~30% no vídeo), browse comp, Humanity’s Last Exam, OS World (controle de computador), Deep Sui (leve queda), Automation Bench (+9 pontos), legal (- de 13.3 para 11.7), Healthbench Professional (queda), BioM Mystery Bench (similar); Box tests de trabalho documental mostram ganho geral 63→78, due diligence 65→76, report drafting 67→69, data analysis +6.
  • Eficiência destacada: gráfico cost-per-task coloca Opus 5 mais à esquerda e mais alto (melhor e mais barato) que Fable 5, Opus 4.8 e comparável ou inferior em custo ao GPT 5.6 Soul em muitos cenários; ênfase do comentarista: custo por tarefa é a métrica chave, não preço por token.
  • Segurança/guardrails: Opus 5 aparenta reduzir capacidades ofensivas de cibersegurança (exploitation success 4 para Opus 5 vs 13 em Mythos 5; Opus 4.8 zero), e a API tem fallback automático para modelos mais antigos quando os classificadores de segurança disparam (custo do fallback ainda cobrado).
  • Demos e integrações: demonstração citada de túnel de vento / simulação fluida e capacidade de controlar interface (OS World); integração com Box AI (patrocinador) e uso em agentes via Box CLI; recomendação prática do canal: emparelhar Opus 5 com Fable para planejamento/brainstorming/bugs.
  • Concorrentes e contexto: comparações feitas com GPT 5.6 Soul, Mythos 5 (cyber), e Kimmy K3 (modelo open-source citado); o canal especula que Anthropic otimizou Opus a partir do trabalho em Fable.
  • Tom e ressalvas: vídeo é empolgado, dependente de benchmarks públicos e visualizações de custo; há especulação sobre revisão/compartilhamento com governo e sobre razões internas das melhorias (o autor admite suposições).

Mais de Matthew Berman

11 no radar
11/08Mark Zuckerberg just called out Dario (and Anthropic)aprofundar: talvez07/08What is Google even doing?aprofundar: talvez05/08Master Codex with these 15 Tipsaprofundar: talvez04/08Open-source is WINNINGaprofundar: não31/07GPT-5.6 just made itself better...aprofundar: não

todos os 11 vídeos de Matthew Berman no radar →