a tese
Anthropic lançou Claude Opus 5, que segundo o vídeo supera Fable 5 em grande parte dos benchmarks e reduz custo por tarefa; ganhou desempenho prático sem aumentar preço (mesmo preço do Opus 4.8, metade do Fable).
aprofundar
sim
— relevante para você porque trata de trade-offs cruciais para agentes: custo por tarefa, fallback/safety classifiers e mitigação de capacidades (guardrails) — aspectos práticos e éticos úteis para projetar e avaliar agentes em contextos teológicos/filosóficos e aplicações críticas.
O que foi dito
- Claude Opus 5 anunciado por Anthropic; afirmação central: bate Fable 5 em quase todos os benchmarks e é mais eficiente em custo por tarefa; preço informado $5/ milhão input e $25/ milhão output (igual ao Opus 4.8, metade do Fable).
- Benchmarks citados: Frontier Bench, GDP val (OpenAI), ARC AGI 3 (salto para ~30% no vídeo), browse comp, Humanity’s Last Exam, OS World (controle de computador), Deep Sui (leve queda), Automation Bench (+9 pontos), legal (- de 13.3 para 11.7), Healthbench Professional (queda), BioM Mystery Bench (similar); Box tests de trabalho documental mostram ganho geral 63→78, due diligence 65→76, report drafting 67→69, data analysis +6.
- Eficiência destacada: gráfico cost-per-task coloca Opus 5 mais à esquerda e mais alto (melhor e mais barato) que Fable 5, Opus 4.8 e comparável ou inferior em custo ao GPT 5.6 Soul em muitos cenários; ênfase do comentarista: custo por tarefa é a métrica chave, não preço por token.
- Segurança/guardrails: Opus 5 aparenta reduzir capacidades ofensivas de cibersegurança (exploitation success 4 para Opus 5 vs 13 em Mythos 5; Opus 4.8 zero), e a API tem fallback automático para modelos mais antigos quando os classificadores de segurança disparam (custo do fallback ainda cobrado).
- Demos e integrações: demonstração citada de túnel de vento / simulação fluida e capacidade de controlar interface (OS World); integração com Box AI (patrocinador) e uso em agentes via Box CLI; recomendação prática do canal: emparelhar Opus 5 com Fable para planejamento/brainstorming/bugs.
- Concorrentes e contexto: comparações feitas com GPT 5.6 Soul, Mythos 5 (cyber), e Kimmy K3 (modelo open-source citado); o canal especula que Anthropic otimizou Opus a partir do trabalho em Fable.
- Tom e ressalvas: vídeo é empolgado, dependente de benchmarks públicos e visualizações de custo; há especulação sobre revisão/compartilhamento com governo e sobre razões internas das melhorias (o autor admite suposições).