a tese
Índices agregados de benchmark (o Artificial Analysis 4.3) escondem informação que decide escolha de modelo; Dan propõe cinco benchmarks específicos (Terminal Bench, APEX Agents, Automation Bench, Omniscience e DeepSWE) escolhidos porque todos medem o que importa para agentes rodando sem supervisão humana, sempre no triângulo desempenho, custo e velocidade.
aprofundar
talvez
O critério de variância e a leitura de custo por tarefa são úteis para quem escolhe modelo com orçamento apertado, mas os números envelhecem em semanas e o vídeo tem bastante autopromoção de canal.
O que foi dito
- O critério de seleção de um benchmark, para ele, é variância: se o gráfico é linha reta (caso do AA Long Context Retrieval v1.1), o benchmark está saturado e não informa nada; sem queda de curva não há vantagem em pagar pelo modelo de ponta.
- Terminal Bench (mais de 60 tarefas de engenharia, ML, operações, segurança e mídia num contêiner com verificador de estado) é a escolha número um: GPT-6 Astra lidera em desempenho, Claude Fable 5.1 vem atrás, e há queda acentuada na faixa de 40 a 42 por cento.
- O argumento de custo é o mais forte do vídeo: Astra gasta cerca de 2,7 vezes menos tokens que o Fable 5 e 2,5 vezes menos que o Fable 5.1, e sai aproximadamente quatro vezes mais barato por tarefa, o que desfaz o empate aparente no índice agregado.
- APEX Agents é a escolha dois porque sai do software: tarefas validadas por profissionais de McKinsey, BCG, Deloitte, Goldman Sachs, Morgan Stanley e JP Morgan em banca de investimento, consultoria e advocacia corporativa, servindo de proxy para outros domínios de trabalho intelectual; falta ali informação de custo e tempo.
- Automation Bench (mais de 600 tarefas em finanças, RH, marketing, operações, vendas e suporte) é a três e traz o dado que quase nenhum outro captura: violação de guarda-corpo conta como falha, então completar a tarefa quebrando algo pelo caminho não pontua.
- Nesse recorte Fable e Opus sobem bastante quando se ignoram as violações e caem quando elas contam, o que Dan lê como aviso prático: para fluxo que exige seguir instrução à risca, talvez nenhum dos dois seja a escolha.
- Omniscience, a quatro, é o benchmark de alucinação, e o detalhe que ele destaca é a nota neutra para “não sei”: premia acerto, penaliza alucinação e não penaliza recusa, o que ele liga ao incidente do enxame Astra da OpenAI que acabou atacando a Hugging Face por não ter saída de desistência.
- DeepSWE, a cinco, mede tarefas longas de engenharia a partir de prompts curtos e realistas, e ele usa isso contra o “vibe coding”: se o agente vai bem com prompt ruim, vai melhor com plano detalhado, e o alvo dele é o teto da capacidade, não o piso.
- A moral repetida é pilha de modelos em vez de modelo único, “combine compute, don’t select compute”, com Gemini 3.8 Flash e GLM 5.3 Flash como cavalos de carga que baixam o custo em 10 a 20 vezes, e a frase de efeito “AGI que você não pode pagar é irrelevante”.