O GLM 5.3 Flash, modelo open-weights da ZAI (laboratório chinês), apareceu no OpenRouter disfarçado como "Ox-Alpha" e impressionou benchmarks antes de ser identificado; a revelação é que inteligência próxima ao topo da fronteira agora custa cerca de 9 centavos por tarefa concluída, rodando inteiramente em chips chineses sem nenhuma GPU da Nvidia.
não
o vídeo entrega os números reais (preço, benchmarks, arquitetura, chips chineses) de forma verificável, mas o ângulo estratégico sobre chips chineses e independência de infraestrutura já está resumido acima, e o Bruno provavelmente não vai integrar o GLM 5.3 Flash em nenhum pipeline do projeto Teologia dado o custo já irrisório dos modelos que usa.
O que foi dito
- O modelo tem 320 bilhões de parâmetros com 18 bilhões ativos (arquitetura mixture-of-experts), o que permite eficiência de inferência alta sem sacrificar capacidade.
- No índice de inteligência da Artificial Analysis, o GLM 5.3 Flash marca 57; o Claude Fable 5 marca 62. A diferença de 5 pontos custa aproximadamente 34 vezes mais: Fable 5 sai a US$ 3,14 por tarefa, o GLM Flash a US$ 0,09.
- O modelo usa em média 47.000 tokens de saída por tarefa, quase o dobro do GPT 5.6 Luna Max (20.000 tokens). Isso explica parte do preço ainda baixo: o token unitário é muito mais barato, mas o volume por tarefa é alto.
- No benchmark GDP-val (conhecimento de trabalho real, da OpenAI), o GLM 5.3 Flash ficou em primeiro lugar com margem ampla sobre os concorrentes de tamanho comparable, incluindo GPT 5.6 Terra e Gemini 3.7 Flash.
- Benchmarks de código e agentes mostram desempenho se aproximando do Claude Opus 4.8, notável para um modelo flash de sua classe de tamanho.
- A ZAI reportou, via Semi Analysis, que serviu 100 trilhões de tokens por dia usando exclusivamente chips de IA chineses, com eficiência e custo por token comparáveis às GPUs Nvidia. É a primeira demonstração pública de capacidade de inferência de fronteira fora do ecossistema Nvidia em escala real.
- Nos testes práticos de geração de sites, o GLM 5.3 Flash superou o GPT 5.6 Soul em design em alguns casos; em geração de cenas 3D complexas, o Soul foi claramente superior.
- O modelo está disponível via OpenRouter e via z.ai (servido da China); como é open-weights, qualquer provedor de inferência pode hospedá-lo e competir em preço.
- Contexto de 1 milhão de tokens, saída máxima de 131.000 tokens e raciocínio ativado por padrão; preço de entrada em cache a US$ 0,01 por milhão de tokens.