a tese
Matthew Berman apresenta o DeepSeek V4.1 Flash como um modelo open source chinês espantosamente barato, rápido e eficiente, com benchmarks à altura da geração anterior de fronteira, mas que na prática dele falhou em testes concretos como a simulação de cubo mágico.
aprofundar
não
Review de novidade de IA com tom empolgado; interessa só como sinal do avanço open source chinês e da economia de tokens, sem render análise.
O que foi dito
- Situa o modelo no padrão recorrente: a fronteira avança, cerca de seis meses depois um modelo open weights iguala a geração anterior, e seis meses depois roda em máquina local.
- Nos benchmarks, o V4.1 Flash rivaliza com Opus 5 e GPT 5.6 (vence em Terminal Bench só perdendo para Opus 5, e supera ambos em Deep Suite), sendo um mixture of experts de 552 bilhões de parâmetros com apenas 8 bilhões ativos na entrada e 16 na saída.
- Explica mixture of experts (usar só parte dos pesos por consulta) e destaca ganhos de eficiência: precisa de um quarto da memória de alta banda (HBM) e um oitavo do armazenamento SSD, resposta à explosão do preço de memória puxada pela IA.
- Ressalta a velocidade (na casa de 200 tokens por segundo) e o preço irrisório, com tarifas diferenciadas em horário de pico e fora de pico, além de ser open weights e acompanhado de white paper detalhado sobre as técnicas.
- Mostra as falhas práticas: o modelo não conseguiu montar uma simulação funcional de cubo mágico (cores mudando sozinhas, “solução” apenas revertendo movimentos em vez de resolver de fato), num teste que outros modelos passam.
- Nos demais testes (retrato em estilo Microsoft Paint, simulação de bala atravessando gota d’água com ray tracing) o resultado foi estilizado ou apenas aceitável, sem o refinamento do topo de linha (compara com Astra).
- Conclui que é um excelente “cavalo de carga” eficiente e barato para 95% dos casos de uso, reforçando que a maior parte da economia não precisa da melhor resposta possível, cara e reservada aos modelos de fronteira.