Radar

radar · IA & agentes

Self-Compact Pi Agent: ZERO HYPE Agentic Coding Devlog

a tese

Devlog em que IndyDevDan constrói, do plano ao teste, um agente de codificação capaz de decidir sozinho quando compactar o próprio contexto, com três limiares (aviso, alerta e compactação forçada) e uma ferramenta dedicada que ainda deixa o agente escrever um bilhete para si mesmo antes de resumir; a tese é que a janela de contexto é o gargalo permanente dos agentes de longa duração e que controlá-la é trabalho de engenharia do arcabouço, não de escolher a melhor ferramenta.

aprofundar

talvez

e com utilidade prática direta: a ideia de dar ao agente uma ferramenta própria de compactação com bilhete para si mesmo, e de calibrar os limiares pelo degrau de preço do modelo, é aplicável de imediato às rotinas headless e às frotas que o Bruno roda; a comparação entre modelos é anedótica (uma execução por modelo) e não serve como benchmark.

O que foi dito

  • O problema declarado: agentes que rodam por horas sem humano no circuito estouram o contexto, perdem desempenho por “apodrecimento de contexto” e queimam dinheiro; a compactação automática existe nas ferramentas prontas, mas o momento é escolhido por um limiar fixo, e o agente já é capaz de escolher melhor.
  • Ele começa escrevendo à mão um plano em markdown, sem agentes, e defende que a vantagem do engenheiro hoje é justamente traduzir expertise em detalhe verificável: “qualquer um escreve código, o que diferencia é pedir exatamente o que se quer”.
  • Duas seções que ele diz usar em todo prompt: “definição de pronto” (como o agente sabe que terminou) e “como você é avaliado”, esta última explorando o fato de que os modelos são treinados sob avaliação, de modo que dar a eles uma rubrica faz com que a sigam; ele usa a rubrica inclusive para isolar agentes (falha imediata se um deles ler ou escrever fora do próprio diretório).
  • A ferramenta de autocompactação faz duas coisas: dispara a compactação e permite ao agente deixar um bilhete próprio, que entra como prompt adicional na sumarização, além de substituir o prompt padrão de compactação da ferramenta, coisa que ele afirma ser possível no Pi e no Codex, mas não no Claude Code.
  • Os limiares default foram calibrados por custo, não por capacidade: como o preço do modelo da OpenAI dobra ao passar de 270 mil tokens, ele põe aviso em 225 mil, alerta em 250 mil e compactação forçada em 270 mil, dando folga ao agente para fechar o que está fazendo antes de o custo dobrar.
  • Roda o mesmo plano em três arcabouços e três modelos em paralelo para comparar: o GLM 5.2 estourou o contexto em 98% e não entregou nada (o que ele apresenta como prova viva do problema que está resolvendo), o Fable 5.1 levou 50 minutos e cerca de 500 mil tokens, e o Codex com GPT-6 Astra levou 21 minutos e 136 mil, metade do tempo e fração dos tokens.
  • Na comparação qualitativa, observa que o Fable escreveu prompts de compactação melhores que o Astra, ou seja, é melhor engenheiro de prompt para outros agentes, ainda que mais lento e mais caro.
  • A demonstração funciona ao vivo: o agente recebe o aviso suave, continua, recebe o alerta, decide compactar, escreve o bilhete com objetivo, estado e próxima ação, e retoma com o contexto reduzido.
  • A recomendação prática de calibragem: deixar um intervalo grande entre o aviso e o alerta, para o agente escolher o momento, e um intervalo curto entre o alerta e a compactação forçada, quando o arcabouço passa a bloquear qualquer outra chamada de ferramenta.
  • A moldura geral do canal: não escolher ferramenta vencedora, usar várias em paralelo, dominar o que ele chama de núcleo de quatro (contexto, modelo, prompt e ferramenta), e migrar do trabalho com humano no circuito para trabalho fora do circuito, de longo horizonte.

Mais de IndyDevDan

12 no radar
05/10OpenRouter State Of Models: Jev, Open-Weights, and Tokenomicsaprofundar: talvez28/0910 Levels of Jev For Agentic Engineersaprofundar: sim14/09Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weightsaprofundar: talvez07/09Are Agent Swarms USEFUL? OpenAI’s GPT-6 Astra SWARM Takeawaysaprofundar: talvez31/08Agentic Engineering Operating Level: WHERE to FOCUS your AGENTS?aprofundar: talvez

todos os 12 vídeos de IndyDevDan no radar →