Radar

radar · IA & agentes

We need to talk about Jev...

a tese

Matthew Berman apresenta o Jev, modelo lançado por um dos co-criadores do ChatGPT após dois anos de sigilo, que abandona a arquitetura de modelo de conversa em favor de um "modelo de decisão" treinado por um método próprio, com tokens de saída gratuitos, velocidade de centenas de vezes a dos LLMs comuns e alegação de zero alucinação.

aprofundar

não

É apresentação entusiasmada de lançamento, com a afirmação central (zero alucinação) aceita sem teste e demonstrações que medem velocidade; vale só como registro de que uma arquitetura de decisão barata e rápida apareceu e que o caso de uso natural dela é rotear e filtrar, não raciocinar.

O que foi dito

  • A proposta parte de uma pergunta do próprio criador: por que modelos de conversa sobre-humanos não levaram à inteligência geral; a resposta dele é trocar o aprendizado por reforço com retorno humano por um método que ele chama de aprendizado por reforço para decisões calibradas, até 200 vezes mais rápido e 400 vezes mais barato.
  • O modelo não conversa e não escreve código do zero: recebe um estado ou um conjunto de informações e devolve decisões, milhares delas em paralelo, em milissegundos; o exemplo básico mostrado é classificação e priorização de chamados de suporte.
  • A gratuidade dos tokens de saída, com cobrança apenas de frações de centavo na entrada, é apresentada como consequência direta da eficiência, e o lema da empresa, “estamos construindo produto, não deus”, é lido por Berman como alfinetada na Anthropic.
  • A alegação mais forte e menos verificada é a de zero alucinação, que Berman repete sem testar, justificando-a pelo argumento de que o treino não otimiza para agradar humanos; ele mesmo observa que em casos críticos (saúde, alvos militares, trânsito) qualquer alucinação é catastrófica.
  • As demonstrações medem velocidade, não qualidade: o modelo joga Doom em tempo real decidindo dentro do laço do jogo, vence corridas de Wikipédia completando cinco saltos em meio segundo contra quatro a cinco segundos dos concorrentes, e numa simulação construída por Berman com outro modelo decide em 0,6 segundo o comportamento de 50 personagens diante de um anúncio.
  • Em xadrez, o teste independente é revelador do limite: o Fable jogou muito melhor, chegando a 16 de vantagem material e promovendo uma segunda dama, mas gastava de 6 a 15 segundos por lance contra 2,6 segundos do Jev e perdeu por tempo, o que sugere vitória por relógio, não por jogo.
  • Os casos de uso que emergiram na comunidade e que Berman destaca são justamente de intermediação: roteador de modelos (decidir para qual modelo enviar cada prompt sem responder nada), bloqueador de anúncios que limpa a página em fração de segundo, e uma reimplementação de direção autônoma em menos de uma hora, com o modelo decidindo em tempo real a partir dos dados do carro.
  • Berman delimita: é arquitetura nova e mais estruturada, não serve para conversa nem para escrever software do zero, e serve para quem precisa de muitas decisões rápidas e baratas; o próprio criador admite que ele é pior que os modelos de conversa em xadrez.
  • Boa parte do vídeo é patrocínio de plataforma de automação, com o argumento de plugar o modelo em fluxos de atendimento.

Mais de Matthew Berman

42 no radar
10/10Everything has been solvedaprofundar: não07/10Mistral is BACK! (Le Chonk)aprofundar: talvez07/1012 Grok Bot Use Cases That Feel Illegalaprofundar: talvez30/09OpenAI COOKEDaprofundar: talvez29/09Sonnet 5.5 Is Here. Look What It Can Build.aprofundar: talvez

todos os 42 vídeos de Matthew Berman no radar →