a tese
Berman testa o Sonnet 5.5 com acesso antecipado e conclui que ele é praticamente indistinguível do Opus 5.5 na prática e nos benchmarks, pela metade do preço, o que o torna a escolha padrão; o limite que ele encontra é som e música, que continuam ruins.
aprofundar
talvez
a parte de demonstração é vitrine, mas duas coisas valem direto para o Bruno: a regra de mandar o modelo verificar o próprio trabalho por captura de tela ou execução, que é a política de verificador mecânico dele em outra roupa, e a tabela de preço e desempenho, que responde qual modelo deve rodar nas rotinas headless do Teologia e do Agentes.
O que foi dito
- Primeira demonstração, feita a partir de um único prompt: oceano 3D em tempo real no navegador, com simulação de ondas, estados de mar do espelhado ao tempestuoso, cristas quebrando, céu e nuvens que sombreiam a água, ciclo de luz até noite de lua, chuva e raios, iate à vela com esteira e vista submersa com feixes de luz e peixes.
- Detalha os controles gerados (swell, direção, agitação, altura de onda, cobertura de nuvens, posição do sol) e observa que o próprio modelo abriu cada demo, gravou, cortou e editou os vídeos de apresentação.
- Segunda demonstração: clone de Fall Guys em Three.js, com 59 bots, cinco rodadas e cerimônia final, cerca de cinquenta níveis gerados. Ele extrai daí a regra prática que considera decisiva, é preciso mandar explicitamente o modelo conferir o próprio trabalho, por captura de tela, vídeo ou jogando o jogo.
- Diz que a versão feita pelo Sonnet ficou mais divertida que a feita pelo Opus, à medida que ele foi melhorando o prompt.
- Terceira: criador de Lego por linguagem natural, com prompt longo que impõe restrições de engenharia (o modelo descreve formas, um programa converte em peças reais, e a checagem de que o modelo é uma peça única conectada volta para a IA corrigir), com instruções passo a passo, no máximo quatro peças por etapa, e exportação para PDF, lista do BrickLink, CSV do Rebrickable, LDraw ou JSON.
- Quarta: São Francisco hiper-realista na Unreal Engine 5.8, em escala real com dados reais da cidade, 120 mil pessoas e 2400 veículos, usando o Jev para decidir o comportamento de cada pessoa com regras simples como fallback, e caixa de texto para injetar eventos como incêndio na Pirâmide Transamerica. Levou vários dias e milhões de tokens; ele aponta cintilação em janelas e sombras estranhas.
- Mostra ainda jogos feitos pela equipe dele: Crownfall, no molde de Age of Empires, uma cidade estilo Batman Arkham Knight, um Mario realista na Unreal e um jogo de corrida no molde do Forza.
- Aponta a falha transversal: som e música continuam ruins em todas as demonstrações.
- Benchmarks: o Sonnet 5.5 supera o Opus 5.5 no Terminal Bench 4.0, e fica praticamente empatado no resto (Frontier Code 1.1 em esforço extra alto, 52,1 contra 54,4; Cursor Bench 55,5 contra 57,8; GDPval 1844 contra 1846; Humanity’s Last Exam 64,5 contra 67,7; OSWorld 80,1% contra 81%), com a ressalva de que ele considera os modelos da OpenAI melhores em controle de navegador.
- Registra uma esquisitice: o Sonnet 5.5 tende a escrever com ortografia britânica, e basta pedir para mudar.
- Preço: 2 dólares por milhão de tokens de entrada e 10 de saída, metade do Opus 5.5 (4 e 20), com a observação de que em vários benchmarks o Sonnet 5.5 em esforço baixo ou médio supera o melhor resultado do Sonnet 5 por um décimo do custo.