Radar

radar · IA & agentes

You NEED to do this (HUGE AI SAVINGS)

a tese

Usar diferentes modelos para estágios distintos (planejamento com frontier, execução com modelo barato, revisão com frontier) aumenta qualidade e reduz custo porque “tokens têm densidades de inteligência” diferentes; a disputa open-source vs closed-source vai definir preço da inferência.

aprofundar

sim

Justificativa: Bruno se beneficia de aprofundar tokenomics, metodologia dos benchmarks e impactos no desenho de agentes/fluxos (planejamento/executor/reviewer), pois isso afeta custo, latência e confiabilidade de pipelines de IA aplicáveis a projetos teológicos/filosóficos automatizados.

O que foi dito

  • Definição e premissa central: token = unidade do LLM; não são iguais — alguns modelos exigem mais tokens para resolver o mesmo problema (menor inteligência por token).
  • Preços citados: GPT‑5.6 Soul $5/1M input e $30/1M output; Kimi/K3 (open‑source chinês) $3/1M input e $15/1M output; alegação de que Kimi usa ~2x tokens para mesmas tarefas, anulando vantagem de preço.
  • Benchmarks mencionados: Deep Seek, Frontier Seek, Kimi Code Bench, Terminal Bench; resultados mostrados onde Kimi K3 fica competitivo em pontuação, mas consome mais tokens; custos por tarefa exibidos (ex.: Kimi $0.95/tarefa vs GPT‑5.6 $1.04, Claude Fable $2.75).
  • Fluxo recomendado e números: planejamento com frontier (p.ex. Fable) para spec; execução com modelos baratos/rápidos (Grok 4.5, Composer da Cursor); revisão final com frontier (GPT‑5.6); exemplo de custo para um job: Fable sozinho $81, GPT‑5.6 $46.50, mistura $25.55.
  • Técnica de qualidade: cross‑review entre modelos melhora detecção de bugs; menção ao caso/sponsor Greptile que lançou ferramenta de revisão mútua e post com resultados (Opus 4.7, GPT‑5.5, Claude, Codex citados; empresas usuárias listadas: Nvidia, Menlify, Posthog, Zapier, Substack).
  • Outras observações operacionais: output tokens são mais caros que input; velocidade importa (modelos frontier tendem a ser mais lentos); tokenomics e oferta open‑source pressionam preços para baixo, redistribuindo lucro para chips/hyperscalers e camadas de aplicação.
  • Crítica metodológica e viés: apresentação prática mas raso — dados e cálculos são mostrados sem metodologia detalhada; há dependência de benchmarks proprietários e do sponsor Greptile, portanto verificar validade empírica antes de generalizar.

Mais de Matthew Berman

11 no radar
11/08Mark Zuckerberg just called out Dario (and Anthropic)aprofundar: talvez07/08What is Google even doing?aprofundar: talvez05/08Master Codex with these 15 Tipsaprofundar: talvez04/08Open-source is WINNINGaprofundar: não31/07GPT-5.6 just made itself better...aprofundar: não

todos os 11 vídeos de Matthew Berman no radar →