a tese
Demonstração prática de uma disputa de previsões entre Opus 5 e GPT-5.6 usando agentes que acessam a web via SER API, com preços de mercado obfuscados e saída probabilística para comparação e aposta simbólica em Polymarket.
aprofundar
talvez
Método interessante para quem estuda agentes e avaliação empírica; vale aprofundar em desenho experimental, métricas de calibração/proper scoring e falhas de obfuscação se você quiser reproduzir ou adaptar para pesquisas.
O que foi dito
- Objetivo: comparar previsões de Opus 5 e GPT-5.6 em dois eventos de curto prazo e acompanhar quem acerta melhor; apostas de US$10 como experimento.
- Eventos testados: menor temperatura em “SE” em 29 de julho (bins de temperatura) e número de dissidentes no Fed na reunião de julho (0 a 6+).
- Ferramentas e rationale: uso do patrocinador SER API para dar acesso de pesquisa estruturada (JSON) aos agentes; vantagens citadas: choke point neutro, formato idêntico para todos os modelos, fácil filtragem.
- Scaffolding experimental: remover menções a Polymarket/Kalshi dos resultados, obfuscar preços mostrando só opções/bins predefinidos, obrigar envio de distribuição de probabilidade para cada resultado, rodar modelos sequencialmente e limpar cache para evitar contaminação.
- Fontes consultadas durante as pesquisas: AcuWeather, site meteorológico norueguês (yr/sem nome exato no áudio) e buscas multilíngues via SER API; menção a codeex e cloud code como alternativas de pesquisa.
- Resultados do round: Opus 5 submeteu preferência pelo bin 26°C como favorito e 2 dissidentes no Fed; GPT-5.6 favoreceu o bin 25°C (~52%) e 0 dissidentes; o criador colocou as apostas correspondentes em Polymarket.
- Crítica do autor: preocupação de que Opus tenha seguido o favorito de mercado, indicando que a obfuscação de preços pode não ter sido 100% eficaz; pretende iterar no scaffolding e fazer séries futuras.