Radar

radar · IA & agentes

AI researchers debate how close we are to recursive self-improvement

a tese

Dwarkesh Patel debate com três pesquisadores de IA (Baron Militch, da Zyra; John Schulman, da Thinking Machines e ex-OpenAI; Charlie O'Neal, da Base10) quão perto estamos da automelhoria recursiva, e o consenso é que ela provavelmente chega em poucos anos, mas esbarra em gargalos de especificação de objetivo, eficiência amostral e aprendizado contínuo.

aprofundar

talvez

Conteúdo denso e de fronteira sobre IA/agentes que interessa ao Bruno; rende análise avulsa se ele quiser um mapa do estado do debate sobre RSI, mas é técnico e longo.

O que foi dito

  • A pergunta de abertura (por que em 2036 poderíamos não ter superinteligência) leva ao “paradoxo de Moravec”: a IA fica ótima em tudo que vira benchmark, mas pode faltar a generalização verdadeira, ou o progresso pode bater num teto assintótico antes de cruzar o ELO humano.
  • Discutem que cada salto (pré-treino, depois RL) exigiu descontinuidades para manter a curva reta, e questionam se escalar o paradigma atual (transformer mais RL) basta para descobrir a próxima descontinuidade ou se seria preciso jogar fora gradiente descendente e redes neurais.
  • Identificam o último trabalho humano como a definição do objetivo: decidir o que queremos, redigir constituições e model specs; alinhamento é “o trabalho final”, decomposto em especificar o objetivo e otimizá-lo, e a especificação não vai embora tão cedo.
  • Sobre por que não há consolidação total entre provedores: a destilação combate a centralização, pois o que se aprende via RL são poucos bits fáceis de destilar, e serviços de roteamento na China coletam a distribuição de prompts reais que facilita copiar modelos de fronteira.
  • Levantam o enigma de Opus 5 e GPT 5.6 parecerem piores que modelos chineses open source (GLM 5.3, Kimi K3), e hipóteses: a distribuição de prompts realista importa mais que os ambientes de RL, ou erros de pós-treino que não aparecem em benchmark.
  • Aprendizado a partir do deploy (o sonho da “mente colmeia”): já acontece de forma indireta, jogando dados de deploy no mid-training da geração seguinte, mas atualização de peso contínua esbarra em esquecimento catastrófico e degradação, forçando retreinar do zero.
  • Distinguem tarefas cumulativas (como a própria pesquisa de IA, onde cada descoberta é uma linha permanente no stack) de tarefas não estacionárias (como um paralegal num escritório, com relações e contexto sempre mudando), e ironizam que é infeliz que a automelhoria recursiva seja mais fácil que ser paralegal.
  • Discutem por que o RL funcionou melhor que o previsto (mid-training forte leva o modelo a 80% do caminho; o RL só ajusta a política com poucos bits de alto sinal), e que houve generalização de horizonte (trabalhar por mais tempo) mais do que generalização horizontal de raciocínio entre domínios.
  • Nas previsões finais: trabalhador remoto genérico de colarinho branco por um mês em cerca de um a três anos; 10x de produtividade dos próprios pesquisadores de IA em dois a dez anos; e uma IA que domine especialistas humanos em todo trabalho cognitivo (essencialmente ASI) em torno de três a dez anos, tratando automatizar pesquisa de IA como quase ASI-completo.

Mais de Dwarkesh Patel

10 no radar
01/10How did a few hundred Spanish soldiers topple two empires? – Si Sheppardaprofundar: sim25/09Sarah Paine — Why wars are so difficult to endaprofundar: talvez17/09OpenAI researcher on agent swarms & recursive self-improvementaprofundar: sim01/09Ajeya Cotra – Inside the OpenAI agent swarm that hacked Hugging Faceaprofundar: sim31/08The OpenAI/Hugging Face attack, clearly explainedaprofundar: sim

todos os 10 vídeos de Dwarkesh Patel no radar →