a tese
O apresentador do All About AI mostra três experimentos feitos com o Claude Opus 5.5 nos dois dias seguintes ao lançamento: caçar contrato mal precificado na Kalshi, um pregão por voz na Hyperliquid e um laboratório autônomo de aprendizado de máquina que tenta precificar melhor que o mercado no Polymarket.
aprofundar
talvez
e não pelo trade: o desenho do laço autônomo (avaliador lacrado, hipótese escrita antes do resultado, promoção só após bootstrap e semana de confirmação) é o antídoto contra autoengano que serve direto ao laboratório de investimentos dele, e vale ler junto do auto research original.
O que foi dito
- Abre exibindo as posições para provar que o título não é isca: contratos comprados entre 6 e 11 centavos negociando a 65 a 85, com ganhos de 455% a 900%, obtidos em um único dia.
- Explica o achado: em 24 de setembro, com o rendimento do Treasury de 30 anos fechando a 5,4%, o maior desde 2004, a escada de contratos da Kalshi quebrava entre “acima de 5,49” (a 88 centavos) e “acima de 5,51” (a 5 centavos), dois pontos-base de diferença e oitenta centavos de preço.
- Descreve como tentou refutar a si mesmo antes de entrar: os mesmos contratos haviam negociado entre 46 e 72 centavos na véspera, e o livro de ofertas mostrava que o preço vinha de uma única ordem de 100 contratos parada, não de uma visão de mercado, com leitura literal das regras de liquidação e ordem de teste antes das 444 unidades a cerca de 10 centavos.
- Conta que o scanner que encontrou isso foi construído pelo próprio Opus, e insiste que o ponto crítico é tratar a semântica do contrato (o que exatamente cada enunciado pergunta), não apenas o preço.
- Segundo experimento, o pregão por voz na Hyperliquid: um daemon que escuta comandos (“go long”, “close”), executa a ordem e registra as sugestões do assistente para aprendizado, demonstrado ao vivo com entradas perdidas e uma posição alavancada em 20 vezes.
- É honesto sobre o resultado desse segundo caso: diz não achar que seja lucrativo, que o objetivo era testar a velocidade e que o mérito foi do Opus ter construído o aplicativo.
- Terceiro experimento, o laboratório autônomo inspirado no auto research de Andrej Karpathy: dar ao agente um script de treino, orçamento fixo de cinco minutos e um número a melhorar, num laço que edita, treina, mantém o que ajuda e nunca para.
- O desenho metodológico é a parte substantiva: como em mercado ruído se parece com progresso, a máquina foi partida em duas, um pesquisador que propõe e um avaliador lacrado que ele pode ler mas nunca tocar, com 42 mil mercados, livros de ofertas e os preços da Chainlink que liquidam, sem look-ahead, sem rótulos e sem internet.
- Promoção exige sobreviver a novas sementes, bootstrap entre dias, todos os períodos de teste e uma semana de confirmação lacrada, e o primeiro campeão foi o próprio mercado: o primeiro desafiante a vencê-lo apenas recalibrou a subconfiança do mercado nos 90 segundos finais, baixando o log loss de 0,1278 para 0,1262.
- Reconhece que a maioria das ideias falha e que isso é o ponto (das cinco seguintes, quatro rejeitadas e uma que o bootstrap atribuiu à sorte), que lucro após taxas ainda não está provado, e que até o experimento 14 não houve melhoria consolidada.