Radar

radar · IA & agentes

Intelligence EXPLOSION: Harness Engineering with Pi Agent, Deepseek, and Gemini

a tese

IndyDevDan argumenta que, diante de uma "explosão de inteligência" (dezenas de modelos de IA lançados em poucos dias, com guerra de preços entre laboratórios), a vantagem do engenheiro não está em escolher um modelo, mas em construir e possuir seu próprio "harness" flexível que combina vários modelos ao mesmo tempo. Demonstra isso com a "fusion harness" V2 sobre o Pi Agent, rodando Fable 5, Gemini 3.7 Flash e Deepseek V4 Pro lado a lado.

aprofundar

talvez

O método (frota de modelos que debatem/colaboram com nomes ocultos e um architect integrando) espelha o jeito que o Bruno já usa frota de subagentes e vale como referência de padrão; mas o vídeo mistura muito hype e nomes de modelos possivelmente fictícios, então serve mais como ideia de arquitetura do que como fonte técnica confiável.

O que foi dito

  • “Harness engineering” significa projetar a camada de ferramentas e fluxos ao redor do agente de IA (o “arnês”), em vez de só usar um produto pronto; a tese central é “combine compute, don’t select compute” (junte a potência de vários modelos, não escolha um só), porque o sistema mais flexível vence quando os modelos mudam rápido.
  • O Pi Agent é um agente de código customizável e extensível (alternativa ao Claude Code) sobre o qual ele montou a “fusion harness”, um conjunto de comandos que dispara o mesmo pedido para N modelos simultaneamente e compara desempenho, velocidade e custo.
  • Usa Deepseek V4 Pro (modelo de pesos abertos, que dá para hospedar você mesmo, e que ele nota “pensar muito”) e Gemini 3.7 Flash (que ele elege o modelo mais rápido e barato disponível) contra o Fable 5 da Anthropic (o mais potente e caro, uma ordem de grandeza acima no custo).
  • Demonstra três comandos: /fh opinion (cada modelo opina isolado sobre uma questão), /fh debate (três a cinco modelos debatem uma tese em rodadas, compartilhando respostas até convergirem) e /fh collaborate (os modelos planejam e constroem juntos, com dois “builders” e um “architect”).
  • Técnica notável: os nomes reais dos modelos são escondidos por apelidos (rune, flux, drift agent), porque, ao saberem contra quem competem, os modelos passam a emitir comportamento estranho e a sabotar uns aos outros, algo que emerge naturalmente e ele não sabe explicar.
  • No padrão “collaborate” há sempre um “architect”, onde entra o modelo mais forte e caro, que integra os planos dos demais e faz a validação final; o fluxo usa listas de tarefas com donos, modos e dependências, mais pontos de referência T1/T2/T3 e R (riscos) no system prompt.
  • Ferramentas citadas: DuckDB v2 (banco analítico em memória) como objeto de estudo, scripts Python autocontidos (Astral UV) como formato do demo, Fireworks e Open Router como provedores para acessar modelos de pesos abertos a fração do preço da fronteira.
  • Alertas de custo: preços de fronteira (Fable, Opus 5, GPT 5.6) são cerca de 10x mais caros que o tier “A” (Gemini Flash, Deepseek); ele afirma que Opus 5 é “faminto” e problemático, prefere Fable 5 para orquestrar, e recomenda benchmarks próprios (“private benchmarks”) em vez de confiar em públicos.
  • Conclusão prática: o próximo nível além do harness é a “software factory”, combinar agentes e código para trabalhar sozinhos (“outloop agentic coding”), que ele aponta como onde está o “alpha” real hoje.

Mais de IndyDevDan

12 no radar
05/10OpenRouter State Of Models: Jev, Open-Weights, and Tokenomicsaprofundar: talvez28/0910 Levels of Jev For Agentic Engineersaprofundar: sim21/09Self-Compact Pi Agent: ZERO HYPE Agentic Coding Devlogaprofundar: talvez14/09Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weightsaprofundar: talvez07/09Are Agent Swarms USEFUL? OpenAI’s GPT-6 Astra SWARM Takeawaysaprofundar: talvez

todos os 12 vídeos de IndyDevDan no radar →