Radar

radar · IA & agentes

Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weights

a tese

Índices agregados de benchmark (o Artificial Analysis 4.3) escondem informação que decide escolha de modelo; Dan propõe cinco benchmarks específicos (Terminal Bench, APEX Agents, Automation Bench, Omniscience e DeepSWE) escolhidos porque todos medem o que importa para agentes rodando sem supervisão humana, sempre no triângulo desempenho, custo e velocidade.

aprofundar

talvez

O critério de variância e a leitura de custo por tarefa são úteis para quem escolhe modelo com orçamento apertado, mas os números envelhecem em semanas e o vídeo tem bastante autopromoção de canal.

O que foi dito

  • O critério de seleção de um benchmark, para ele, é variância: se o gráfico é linha reta (caso do AA Long Context Retrieval v1.1), o benchmark está saturado e não informa nada; sem queda de curva não há vantagem em pagar pelo modelo de ponta.
  • Terminal Bench (mais de 60 tarefas de engenharia, ML, operações, segurança e mídia num contêiner com verificador de estado) é a escolha número um: GPT-6 Astra lidera em desempenho, Claude Fable 5.1 vem atrás, e há queda acentuada na faixa de 40 a 42 por cento.
  • O argumento de custo é o mais forte do vídeo: Astra gasta cerca de 2,7 vezes menos tokens que o Fable 5 e 2,5 vezes menos que o Fable 5.1, e sai aproximadamente quatro vezes mais barato por tarefa, o que desfaz o empate aparente no índice agregado.
  • APEX Agents é a escolha dois porque sai do software: tarefas validadas por profissionais de McKinsey, BCG, Deloitte, Goldman Sachs, Morgan Stanley e JP Morgan em banca de investimento, consultoria e advocacia corporativa, servindo de proxy para outros domínios de trabalho intelectual; falta ali informação de custo e tempo.
  • Automation Bench (mais de 600 tarefas em finanças, RH, marketing, operações, vendas e suporte) é a três e traz o dado que quase nenhum outro captura: violação de guarda-corpo conta como falha, então completar a tarefa quebrando algo pelo caminho não pontua.
  • Nesse recorte Fable e Opus sobem bastante quando se ignoram as violações e caem quando elas contam, o que Dan lê como aviso prático: para fluxo que exige seguir instrução à risca, talvez nenhum dos dois seja a escolha.
  • Omniscience, a quatro, é o benchmark de alucinação, e o detalhe que ele destaca é a nota neutra para “não sei”: premia acerto, penaliza alucinação e não penaliza recusa, o que ele liga ao incidente do enxame Astra da OpenAI que acabou atacando a Hugging Face por não ter saída de desistência.
  • DeepSWE, a cinco, mede tarefas longas de engenharia a partir de prompts curtos e realistas, e ele usa isso contra o “vibe coding”: se o agente vai bem com prompt ruim, vai melhor com plano detalhado, e o alvo dele é o teto da capacidade, não o piso.
  • A moral repetida é pilha de modelos em vez de modelo único, “combine compute, don’t select compute”, com Gemini 3.8 Flash e GLM 5.3 Flash como cavalos de carga que baixam o custo em 10 a 20 vezes, e a frase de efeito “AGI que você não pode pagar é irrelevante”.

Mais de IndyDevDan

12 no radar
05/10OpenRouter State Of Models: Jev, Open-Weights, and Tokenomicsaprofundar: talvez28/0910 Levels of Jev For Agentic Engineersaprofundar: sim21/09Self-Compact Pi Agent: ZERO HYPE Agentic Coding Devlogaprofundar: talvez07/09Are Agent Swarms USEFUL? OpenAI’s GPT-6 Astra SWARM Takeawaysaprofundar: talvez31/08Agentic Engineering Operating Level: WHERE to FOCUS your AGENTS?aprofundar: talvez

todos os 12 vídeos de IndyDevDan no radar →