Radar

radar · IA & agentes

GPT-6 SOL AND LUNA ARE OUT!!!

a tese

Transmissão ao vivo de quase duas horas em que Matthew Berman cobre o Opus 5.5, exibe demonstrações da equipe dele e é surpreendido no meio do programa pelo lançamento simultâneo do GPT-6 Soul e do GPT-6 Luna, com cortes de preço de 50% nos dois, o que ele lê como o efeito prático da desaceleração anunciada pelos dois laboratórios: ganha-se eficiência e preço, não potência bruta.

aprofundar

talvez

e só pela parte de preço: Luna a 10 centavos por milhão de tokens de entrada com 66% no benchmark de código agêntico muda a conta de qualquer rotina automatizada que hoje roda em modelo caro, e a comparação de custo por tarefa entre os três lançamentos do mesmo dia é o dado aproveitável; o resto são demonstrações de jogo e problemas técnicos ao vivo.

O que foi dito

  • A primeira hora repete a cobertura do Opus 5.5 (mesmos benchmarks e a mesma entrevista com Thariq, da Anthropic) que saiu no vídeo editado do dia seguinte, com a diferença de mostrar os percalços técnicos ao vivo e a reação do chat.
  • Alex mostra “Ashen Gate”, um jogo no estilo Dark Souls construído no Unreal Engine a partir do pedido de uma frase, com cerca de 28 horas de trabalho autônomo do modelo: seis mundos, cerca de quinze chefes, sistema de evolução, NPCs, chefe com segunda fase, entregue como executável de 3 GB rodando a 120 quadros por segundo.
  • Outras demonstrações: um clone de Mario Maker feito de uma tentativa só, um roguelite chamado “Kaboom to the Moon”, um simulador de voo com vários modelos de avião, e um torneio em que o modelo criou doze jogos de puzzle, julgou-os em chaveamento e entregou o vencedor.
  • Brian mostra uma animação de bonecos-palito feita quadro a quadro, não por geração de vídeo, com ajuste iterativo das sombras, e Berman conta que construiu a cidade de São Francisco inteira no Unreal Engine em três dias de trabalho do modelo, com trânsito e pessoas controlados por outro modelo.
  • Observação prática recorrente: um dos prompts fez o modelo pensar por um dia inteiro antes de começar, e o resultado veio quase sem falhas; eles também notam que o modelo tem um estilo próprio de menu, reconhecível nos testes de outras pessoas.
  • No meio do stream sai o GPT-6 Soul e o GPT-6 Luna, no mesmo dia do Opus 5.5 e um dia depois do Grok 4.7; Berman passa um bom tempo tentando achar o anúncio, que a OpenAI publicou dentro do blog do Astra em vez de em post próprio.
  • Preços: Soul a 2 dólares por milhão de tokens de entrada e 10 na saída, corte de 50% em relação ao 5.6 Soul; Luna a 10 centavos na entrada e 50 na saída, outro corte de 50% sobre uma redução anterior de 80%; contra Opus 5.5 a 4 e 20 dólares.
  • Resultados: no Frontier Code, Luna 42,4%, Soul 49,3% e Opus 5.5 54,4%, com os três separados por seis ou sete pontos e preços que diferem por múltiplos, o que Berman lê como a regra 80/20, o último quinto de qualidade é onde está toda a receita; no Automation Bench, Luna 20%, Soul 33% e Opus 5.5 40%; no Deep Sweet, Luna Max faz 66,6% a 22 centavos por tarefa contra 74% da fronteira a 4,43 dólares por tarefa; no OSWorld (uso de computador), Luna fica em 53% contra 73% do Astra.
  • Sobre alinhamento, ele nota que a taxa de engano em tarefas de código cai conforme o modelo fica mais inteligente, e que o Astra é mais alinhado que o Soul, o que chama de quase contraintuitivo.
  • Disponibilidade: Soul e Luna no ChatGPT e no Codex para Plus, Pro, Business, Enterprise e Edu, e Luna também para usuários gratuitos no aplicativo de desktop, com a OpenAI concedendo uma recarga de cota a assinantes pagos.
  • A tese que ele formula no fim: os dois laboratórios cortarem preço no mesmo dia é o que “desacelerar a fronteira” produz na prática, modelos destilados e baratos derivados dos caros lançados semanas antes, e ele se diz dividido entre querer isso e querer ver do que a fronteira absoluta é capaz.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →