Radar

radar · IA & agentes

Cancel your subscriptions, Ox-Alpha is here! (GLM 5.3 Flash)

a tese

O GLM 5.3 Flash, modelo open-weights da ZAI (laboratório chinês), apareceu no OpenRouter disfarçado como "Ox-Alpha" e impressionou benchmarks antes de ser identificado; a revelação é que inteligência próxima ao topo da fronteira agora custa cerca de 9 centavos por tarefa concluída, rodando inteiramente em chips chineses sem nenhuma GPU da Nvidia.

aprofundar

não

o vídeo entrega os números reais (preço, benchmarks, arquitetura, chips chineses) de forma verificável, mas o ângulo estratégico sobre chips chineses e independência de infraestrutura já está resumido acima, e o Bruno provavelmente não vai integrar o GLM 5.3 Flash em nenhum pipeline do projeto Teologia dado o custo já irrisório dos modelos que usa.

O que foi dito

  • O modelo tem 320 bilhões de parâmetros com 18 bilhões ativos (arquitetura mixture-of-experts), o que permite eficiência de inferência alta sem sacrificar capacidade.
  • No índice de inteligência da Artificial Analysis, o GLM 5.3 Flash marca 57; o Claude Fable 5 marca 62. A diferença de 5 pontos custa aproximadamente 34 vezes mais: Fable 5 sai a US$ 3,14 por tarefa, o GLM Flash a US$ 0,09.
  • O modelo usa em média 47.000 tokens de saída por tarefa, quase o dobro do GPT 5.6 Luna Max (20.000 tokens). Isso explica parte do preço ainda baixo: o token unitário é muito mais barato, mas o volume por tarefa é alto.
  • No benchmark GDP-val (conhecimento de trabalho real, da OpenAI), o GLM 5.3 Flash ficou em primeiro lugar com margem ampla sobre os concorrentes de tamanho comparable, incluindo GPT 5.6 Terra e Gemini 3.7 Flash.
  • Benchmarks de código e agentes mostram desempenho se aproximando do Claude Opus 4.8, notável para um modelo flash de sua classe de tamanho.
  • A ZAI reportou, via Semi Analysis, que serviu 100 trilhões de tokens por dia usando exclusivamente chips de IA chineses, com eficiência e custo por token comparáveis às GPUs Nvidia. É a primeira demonstração pública de capacidade de inferência de fronteira fora do ecossistema Nvidia em escala real.
  • Nos testes práticos de geração de sites, o GLM 5.3 Flash superou o GPT 5.6 Soul em design em alguns casos; em geração de cenas 3D complexas, o Soul foi claramente superior.
  • O modelo está disponível via OpenRouter e via z.ai (servido da China); como é open-weights, qualquer provedor de inferência pode hospedá-lo e competir em preço.
  • Contexto de 1 milhão de tokens, saída máxima de 131.000 tokens e raciocínio ativado por padrão; preço de entrada em cache a US$ 0,01 por milhão de tokens.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →