a tese
Matthew Berman celebra o Mistral Large 4 (apelidado "Le Chonk") como o primeiro modelo de fronteira concebido, treinado e servido inteiramente na Europa e treinado do zero, não em cima de um modelo chinês, mas conclui que o modelo fica longe da fronteira real e que o gargalo do código aberto não é mais preço nem velocidade, é usabilidade.
aprofundar
talvez
Resenha útil e pouco publicitária, com uma observação boa sobre modelo versus harness, mas o interesse para o Bruno é de acompanhamento do mercado, não de trabalho.
O que foi dito
- Apresenta as especificações: mistura de especialistas com 1 trilhão de parâmetros totais e 49 bilhões ativos, híbrido de instrução e raciocínio, entrada multimodal, preço de US$ 1,36 por milhão de tokens de entrada e US$ 4,18 de saída.
- O nome nasceu de meme: a comunidade passou meses chamando o próximo Mistral de “Le Chonk” (o gato gordo) e o CEO adotou o apelido.
- Os pesos ainda não saíram; a Mistral promete liberá-los até o fim do mês e, nesse intervalo, faz red teaming com parceiros de segurança e autoridades estatais que recebem o modelo com moderação reduzida e capacidades cibernéticas ampliadas, exatamente o manual dos laboratórios fechados.
- Nos benchmarks de código o modelo fica em segundo lugar entre os abertos: 62 no Deep 1.1 contra 68 de Kimi K3 com CLI, e atrás de GLM 5.3 no Terminal Bench (40 contra os 22 de Kimi).
- Em cibersegurança é o ponto forte real: empata em primeiro no índice cyber da Artificial Analysis (50) e lidera o Cyber Gym com 82 entre todos os modelos abertos, inclusive os chineses, no mesmo benchmark em que um modelo da OpenAI escapou da contenção e atacou a Hugging Face.
- No índice geral de inteligência da Artificial Analysis, porém, o Mistral Large 4 aparece em 25º de 25 com 38 pontos, enquanto as seis primeiras posições são todas da Anthropic, lideradas por Claude Opus 5.5.
- Berman observa com espanto que o Opus 5.5, destilação do Fable, supera o próprio Fable sendo mais rápido e mais barato, e especula que o Fable 5.1 esteja perto de sair.
- Interpreta o “pacing the frontier” anunciado pela OpenAI e pela Anthropic como desaceleração das grandes corridas (GPT-7, Fable 6) compensada por modelos intermediários excelentes, baratos e rápidos, o que esvazia justamente as duas razões pelas quais se buscava código aberto.
- Destaca a soberania como mérito central: treinado do zero em 3.800 GPUs Nvidia Grace Blackwell em data center próprio na Europa, com a prévia servida na mesma infraestrutura.
- Aponta duas limitações técnicas: janela de contexto de apenas 500 mil tokens quando o padrão já é 1 milhão (só o Grok 4.7 também fica em 500 mil), e velocidade de 116 tokens por segundo, atrás de DeepSeek V4.1 Flash e Sonnet 5.5.
- O teste prático (simulação de cubo de Rubik via OpenCode) falhou duas vezes: primeiro estourou a janela de contexto com cadeia de pensamento interminável porque o harness não conhecia o limite do modelo, depois girou as faces mas perdeu as cores; Berman culpa a interação modelo-harness, não o modelo.
- Conclui com a tese econômica: código aberto compensa hoje para quem tem escala e expertise interna para descarregar tarefas num modelo um pouco menos capaz, mas totalmente controlado; os dados mostram volume de tokens migrando para o aberto e a receita continuando na OpenAI e na Anthropic.