Devlog em que IndyDevDan constrói, do plano ao teste, um agente de codificação capaz de decidir sozinho quando compactar o próprio contexto, com três limiares (aviso, alerta e compactação forçada) e uma ferramenta dedicada que ainda deixa o agente escrever um bilhete para si mesmo antes de resumir; a tese é que a janela de contexto é o gargalo permanente dos agentes de longa duração e que controlá-la é trabalho de engenharia do arcabouço, não de escolher a melhor ferramenta.
talvez
e com utilidade prática direta: a ideia de dar ao agente uma ferramenta própria de compactação com bilhete para si mesmo, e de calibrar os limiares pelo degrau de preço do modelo, é aplicável de imediato às rotinas headless e às frotas que o Bruno roda; a comparação entre modelos é anedótica (uma execução por modelo) e não serve como benchmark.
O que foi dito
- O problema declarado: agentes que rodam por horas sem humano no circuito estouram o contexto, perdem desempenho por “apodrecimento de contexto” e queimam dinheiro; a compactação automática existe nas ferramentas prontas, mas o momento é escolhido por um limiar fixo, e o agente já é capaz de escolher melhor.
- Ele começa escrevendo à mão um plano em markdown, sem agentes, e defende que a vantagem do engenheiro hoje é justamente traduzir expertise em detalhe verificável: “qualquer um escreve código, o que diferencia é pedir exatamente o que se quer”.
- Duas seções que ele diz usar em todo prompt: “definição de pronto” (como o agente sabe que terminou) e “como você é avaliado”, esta última explorando o fato de que os modelos são treinados sob avaliação, de modo que dar a eles uma rubrica faz com que a sigam; ele usa a rubrica inclusive para isolar agentes (falha imediata se um deles ler ou escrever fora do próprio diretório).
- A ferramenta de autocompactação faz duas coisas: dispara a compactação e permite ao agente deixar um bilhete próprio, que entra como prompt adicional na sumarização, além de substituir o prompt padrão de compactação da ferramenta, coisa que ele afirma ser possível no Pi e no Codex, mas não no Claude Code.
- Os limiares default foram calibrados por custo, não por capacidade: como o preço do modelo da OpenAI dobra ao passar de 270 mil tokens, ele põe aviso em 225 mil, alerta em 250 mil e compactação forçada em 270 mil, dando folga ao agente para fechar o que está fazendo antes de o custo dobrar.
- Roda o mesmo plano em três arcabouços e três modelos em paralelo para comparar: o GLM 5.2 estourou o contexto em 98% e não entregou nada (o que ele apresenta como prova viva do problema que está resolvendo), o Fable 5.1 levou 50 minutos e cerca de 500 mil tokens, e o Codex com GPT-6 Astra levou 21 minutos e 136 mil, metade do tempo e fração dos tokens.
- Na comparação qualitativa, observa que o Fable escreveu prompts de compactação melhores que o Astra, ou seja, é melhor engenheiro de prompt para outros agentes, ainda que mais lento e mais caro.
- A demonstração funciona ao vivo: o agente recebe o aviso suave, continua, recebe o alerta, decide compactar, escreve o bilhete com objetivo, estado e próxima ação, e retoma com o contexto reduzido.
- A recomendação prática de calibragem: deixar um intervalo grande entre o aviso e o alerta, para o agente escolher o momento, e um intervalo curto entre o alerta e a compactação forçada, quando o arcabouço passa a bloquear qualquer outra chamada de ferramenta.
- A moldura geral do canal: não escolher ferramenta vencedora, usar várias em paralelo, dominar o que ele chama de núcleo de quatro (contexto, modelo, prompt e ferramenta), e migrar do trabalho com humano no circuito para trabalho fora do circuito, de longo horizonte.