a tese
Matthew Berman apresenta o Jev, modelo lançado por um dos co-criadores do ChatGPT após dois anos de sigilo, que abandona a arquitetura de modelo de conversa em favor de um "modelo de decisão" treinado por um método próprio, com tokens de saída gratuitos, velocidade de centenas de vezes a dos LLMs comuns e alegação de zero alucinação.
aprofundar
não
É apresentação entusiasmada de lançamento, com a afirmação central (zero alucinação) aceita sem teste e demonstrações que medem velocidade; vale só como registro de que uma arquitetura de decisão barata e rápida apareceu e que o caso de uso natural dela é rotear e filtrar, não raciocinar.
O que foi dito
- A proposta parte de uma pergunta do próprio criador: por que modelos de conversa sobre-humanos não levaram à inteligência geral; a resposta dele é trocar o aprendizado por reforço com retorno humano por um método que ele chama de aprendizado por reforço para decisões calibradas, até 200 vezes mais rápido e 400 vezes mais barato.
- O modelo não conversa e não escreve código do zero: recebe um estado ou um conjunto de informações e devolve decisões, milhares delas em paralelo, em milissegundos; o exemplo básico mostrado é classificação e priorização de chamados de suporte.
- A gratuidade dos tokens de saída, com cobrança apenas de frações de centavo na entrada, é apresentada como consequência direta da eficiência, e o lema da empresa, “estamos construindo produto, não deus”, é lido por Berman como alfinetada na Anthropic.
- A alegação mais forte e menos verificada é a de zero alucinação, que Berman repete sem testar, justificando-a pelo argumento de que o treino não otimiza para agradar humanos; ele mesmo observa que em casos críticos (saúde, alvos militares, trânsito) qualquer alucinação é catastrófica.
- As demonstrações medem velocidade, não qualidade: o modelo joga Doom em tempo real decidindo dentro do laço do jogo, vence corridas de Wikipédia completando cinco saltos em meio segundo contra quatro a cinco segundos dos concorrentes, e numa simulação construída por Berman com outro modelo decide em 0,6 segundo o comportamento de 50 personagens diante de um anúncio.
- Em xadrez, o teste independente é revelador do limite: o Fable jogou muito melhor, chegando a 16 de vantagem material e promovendo uma segunda dama, mas gastava de 6 a 15 segundos por lance contra 2,6 segundos do Jev e perdeu por tempo, o que sugere vitória por relógio, não por jogo.
- Os casos de uso que emergiram na comunidade e que Berman destaca são justamente de intermediação: roteador de modelos (decidir para qual modelo enviar cada prompt sem responder nada), bloqueador de anúncios que limpa a página em fração de segundo, e uma reimplementação de direção autônoma em menos de uma hora, com o modelo decidindo em tempo real a partir dos dados do carro.
- Berman delimita: é arquitetura nova e mais estruturada, não serve para conversa nem para escrever software do zero, e serve para quem precisa de muitas decisões rápidas e baratas; o próprio criador admite que ele é pior que os modelos de conversa em xadrez.
- Boa parte do vídeo é patrocínio de plataforma de automação, com o argumento de plugar o modelo em fluxos de atendimento.