Radar

radar · IA & agentes

10 Levels of Jev For Agentic Engineers

a tese

IndyDevDan apresenta dez níveis de uso do Jev (grafia da legenda, classificador da Typesafe) para engenharia de agentes e defende que ele é uma classe nova de modelo, não um LLM: decisão inteligente programável por JSON, barata o bastante para rodar milhões de vezes dentro do arnês do agente.

aprofundar

sim

o padrão do nível 6 (classificador barato como guarda no hook de pré-execução do bash) e o do nível 9 (perguntar sobre arquivos sem lê-los) se aplicam direto às tuas rotinas do Agentes e do radar, onde o custo por chamada e o risco de comando destrutivo são problemas reais.

O que foi dito

  • Nível 1, decisão booleana: um “if inteligente e barato” para detectar injeção de prompt, com intervalo de confiança que vai de 99% no caso óbvio a 64% nos casos ambíguos, o que obriga o engenheiro a definir o limiar aceitável.
  • Nível 2, múltipla escolha: triagem de chamados de suporte classificando tipo e prioridade, com comparação de preço em que o concorrente mais próximo custa 4 vezes mais e o modelo de ponta chega a 600 vezes; o argumento é escala, um milhão de chamadas por cerca de 20 dólares contra 11 mil.
  • Nível 3, pontuação composta: notas em escalas definidas pelo engenheiro (risco de segurança, qualidade do commit, aderência a padrões), com os pesos ajustados no código, de modo que calibrar vira mudar um número, não reescrever o prompt.
  • Nível 4, portão por confiança: usar quando errar custa mais que perguntar a um humano, com o exemplo do gate do bash, que classifica “git push –force origin main” como irreversível e “rm -rf node_modules” como reversível.
  • Ele insiste que o bash é a ferramenta mais perigosa de qualquer agente, e que a vantagem do classificador é ser genérico o bastante para bloquear comandos destrutivos que o engenheiro nem sabe que existem.
  • Nível 5, roteamento de intenção e de modelo: uma decisão barata na frente de várias caras, escolhendo o agente certo (navegador, rápido, desktop) para a tarefa, passo que ele liga ao seu projeto de “outloop agentic coding”, agentes rodando em pipeline sem supervisão.
  • Nível 6, o classificador dentro do agente: demonstra um agente em Python com hook de pré-execução que bloqueia comandos destrutivos e escrita em arquivos sensíveis, argumentando que alinhamento é tornar impossível o que não se quer, não confiar na boa vontade do modelo.
  • Nível 7, decidir quando compactar contexto: limiares de aviso, recomendação e requisição por volume de tokens, com o classificador avaliando se a tarefa atual difere da anterior; ele generaliza a ideia como “modelos dentro de modelos” e rejeita a expectativa de um modelo único acima de todos.
  • Nível 8, leitura barata: uma ferramenta que pergunta sobre um arquivo sem carregá-lo no contexto do agente, respondendo se o arquivo valida tokens ou contém credenciais reais, com economia direta de janela de contexto.
  • Nível 9, arquivos em escala: a mesma pergunta sobre dezenas de arquivos em paralelo por glob recursivo, para achar bugs, pendências ou arquivos relevantes a um plano, com resposta em frações de segundo e centavos; é o exemplo que ele diz estar reprogramando o modo como pensa arquitetura de agentes.
  • Nível 10, uso agêntico: o próprio agente decide quando chamar o classificador, usando-o para diagnosticar falha de teste, validar a hipótese de correção e conferir o resultado, o que ele descreve como auto-validação barata.
  • Tese de fundo, repetida: é “e”, não “ou”; não substitui o agente, é uma terceira primitiva entre código determinístico e modelo de linguagem, e a aposta é a proliferação de espécies de modelos especializados em vez de um martelo geral.
  • Avisos finais: não serve para tarefas longas, operar interface, jogar ou pilotar drone; e a habilidade decisiva continua sendo engenharia de prompt, agora aplicada aos blocos JSON.

Mais de IndyDevDan

12 no radar
05/10OpenRouter State Of Models: Jev, Open-Weights, and Tokenomicsaprofundar: talvez21/09Self-Compact Pi Agent: ZERO HYPE Agentic Coding Devlogaprofundar: talvez14/09Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weightsaprofundar: talvez07/09Are Agent Swarms USEFUL? OpenAI’s GPT-6 Astra SWARM Takeawaysaprofundar: talvez31/08Agentic Engineering Operating Level: WHERE to FOCUS your AGENTS?aprofundar: talvez

todos os 12 vídeos de IndyDevDan no radar →