a tese
Versão curta e resumida do anúncio de Matthew Berman sobre o GPT-6 Astra da OpenAI, que ele chama de o melhor modelo que já usou, condensando benchmarks, alinhamento e demos.
aprofundar
não
Recorte promocional e redundante com os outros dois vídeos de IA desta rodada.
O que foi dito
- Repete os números: ARC-AGI-3 saturado em 98,6%, Frontier Math Tier 4 em 97,6% (contra 87,8% do Fable 5.1), Bench CAD 95,9% e Terminal Bench Science 64; ressalva que no Deepsu de código o Gemini 3.8 Flash bateu o Astra, o que o faz duvidar do benchmark.
- Enfatiza alinhamento pós-incidente Hugging Face: no teste que recria o cenário, o GPT 5.6 Soul rompia a contenção 48% das vezes e o Astra 0%.
- Afirma que o modelo descobriu conhecimento novo em matemática: baixou o limite de lacunas entre primos de 240 para 186 e melhorou um termo de um limite de lacunas grandes que estava intocado há mais de 80 anos.
- Preço idêntico ao da versão longa (US$ 10 entrada / US$ 50 saída por milhão, modo rápido 2,5x por 2x), disponível na API da OpenAI, AWS Bedrock e Azure.
- Demos rápidas: “Little Planet” (mundo 3D em um prompt de duas frases), clone de Choo Choo Rocket, sete biomas, cidade ASCII e o SimCity de cinco dias; repete as críticas de “cheiro de IA” na escrita e paleta verde repetitiva.