Radar

radar · IA & agentes

Claude Opus 5.5 Is About to DOMINATE Kalshi & Polymarket

a tese

O apresentador do All About AI mostra três experimentos feitos com o Claude Opus 5.5 nos dois dias seguintes ao lançamento: caçar contrato mal precificado na Kalshi, um pregão por voz na Hyperliquid e um laboratório autônomo de aprendizado de máquina que tenta precificar melhor que o mercado no Polymarket.

aprofundar

talvez

e não pelo trade: o desenho do laço autônomo (avaliador lacrado, hipótese escrita antes do resultado, promoção só após bootstrap e semana de confirmação) é o antídoto contra autoengano que serve direto ao laboratório de investimentos dele, e vale ler junto do auto research original.

O que foi dito

  • Abre exibindo as posições para provar que o título não é isca: contratos comprados entre 6 e 11 centavos negociando a 65 a 85, com ganhos de 455% a 900%, obtidos em um único dia.
  • Explica o achado: em 24 de setembro, com o rendimento do Treasury de 30 anos fechando a 5,4%, o maior desde 2004, a escada de contratos da Kalshi quebrava entre “acima de 5,49” (a 88 centavos) e “acima de 5,51” (a 5 centavos), dois pontos-base de diferença e oitenta centavos de preço.
  • Descreve como tentou refutar a si mesmo antes de entrar: os mesmos contratos haviam negociado entre 46 e 72 centavos na véspera, e o livro de ofertas mostrava que o preço vinha de uma única ordem de 100 contratos parada, não de uma visão de mercado, com leitura literal das regras de liquidação e ordem de teste antes das 444 unidades a cerca de 10 centavos.
  • Conta que o scanner que encontrou isso foi construído pelo próprio Opus, e insiste que o ponto crítico é tratar a semântica do contrato (o que exatamente cada enunciado pergunta), não apenas o preço.
  • Segundo experimento, o pregão por voz na Hyperliquid: um daemon que escuta comandos (“go long”, “close”), executa a ordem e registra as sugestões do assistente para aprendizado, demonstrado ao vivo com entradas perdidas e uma posição alavancada em 20 vezes.
  • É honesto sobre o resultado desse segundo caso: diz não achar que seja lucrativo, que o objetivo era testar a velocidade e que o mérito foi do Opus ter construído o aplicativo.
  • Terceiro experimento, o laboratório autônomo inspirado no auto research de Andrej Karpathy: dar ao agente um script de treino, orçamento fixo de cinco minutos e um número a melhorar, num laço que edita, treina, mantém o que ajuda e nunca para.
  • O desenho metodológico é a parte substantiva: como em mercado ruído se parece com progresso, a máquina foi partida em duas, um pesquisador que propõe e um avaliador lacrado que ele pode ler mas nunca tocar, com 42 mil mercados, livros de ofertas e os preços da Chainlink que liquidam, sem look-ahead, sem rótulos e sem internet.
  • Promoção exige sobreviver a novas sementes, bootstrap entre dias, todos os períodos de teste e uma semana de confirmação lacrada, e o primeiro campeão foi o próprio mercado: o primeiro desafiante a vencê-lo apenas recalibrou a subconfiança do mercado nos 90 segundos finais, baixando o log loss de 0,1278 para 0,1262.
  • Reconhece que a maioria das ideias falha e que isso é o ponto (das cinco seguintes, quatro rejeitadas e uma que o bootstrap atribuiu à sorte), que lucro após taxas ainda não está provado, e que até o experimento 14 não houve melhoria consolidada.

Mais de All About AI

19 no radar
06/10Start Using AI Predictions To Beat The Market Today (beginner's guide)aprofundar: sim02/10Opus 5.5 Is INSANE: Day Trader Tycoon (with real money)aprofundar: talvez29/09Can AI Predict The Future? - Sikt Intelligence (my new startup)aprofundar: talvez22/09I Gave GPT-6 & Claude $1,000 Each to Trade on Kalshiaprofundar: talvez18/09JEV - Can This NEW Type of AI Help Us Win on Kalshi?aprofundar: talvez

todos os 19 vídeos de All About AI no radar →