Radar

radar · IA & agentes

Deepseek did it again...

a tese

Matthew Berman apresenta o DeepSeek V4.1 Flash como um modelo open source chinês espantosamente barato, rápido e eficiente, com benchmarks à altura da geração anterior de fronteira, mas que na prática dele falhou em testes concretos como a simulação de cubo mágico.

aprofundar

não

Review de novidade de IA com tom empolgado; interessa só como sinal do avanço open source chinês e da economia de tokens, sem render análise.

O que foi dito

  • Situa o modelo no padrão recorrente: a fronteira avança, cerca de seis meses depois um modelo open weights iguala a geração anterior, e seis meses depois roda em máquina local.
  • Nos benchmarks, o V4.1 Flash rivaliza com Opus 5 e GPT 5.6 (vence em Terminal Bench só perdendo para Opus 5, e supera ambos em Deep Suite), sendo um mixture of experts de 552 bilhões de parâmetros com apenas 8 bilhões ativos na entrada e 16 na saída.
  • Explica mixture of experts (usar só parte dos pesos por consulta) e destaca ganhos de eficiência: precisa de um quarto da memória de alta banda (HBM) e um oitavo do armazenamento SSD, resposta à explosão do preço de memória puxada pela IA.
  • Ressalta a velocidade (na casa de 200 tokens por segundo) e o preço irrisório, com tarifas diferenciadas em horário de pico e fora de pico, além de ser open weights e acompanhado de white paper detalhado sobre as técnicas.
  • Mostra as falhas práticas: o modelo não conseguiu montar uma simulação funcional de cubo mágico (cores mudando sozinhas, “solução” apenas revertendo movimentos em vez de resolver de fato), num teste que outros modelos passam.
  • Nos demais testes (retrato em estilo Microsoft Paint, simulação de bala atravessando gota d’água com ray tracing) o resultado foi estilizado ou apenas aceitável, sem o refinamento do topo de linha (compara com Astra).
  • Conclui que é um excelente “cavalo de carga” eficiente e barato para 95% dos casos de uso, reforçando que a maior parte da economia não precisa da melhor resposta possível, cara e reservada aos modelos de fronteira.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →