Nota de leitura. Este artigo baseia-se no lançamento do Jev a 15 de setembro de 2026 e na cobertura disponível à data da escrita (TechCrunch, The Register, Tom's Hardware, Simon Willison). Os números de velocidade e de custo provêm da própria TypeSafe AI. Não foi publicado nenhum artigo técnico e ainda não existe nenhuma medição independente completa. Citamo-los como afirmações, não como factos estabelecidos.
Numa frase
A 15 de setembro de 2026, a TypeSafe AI, uma jovem empresa de São Francisco fundada por um antigo investigador da OpenAI, lançou o Jev, um modelo de inteligência artificial que lê texto como um LLM (large language model, grande modelo de linguagem) mas que nunca o escreve: devolve apenas números, ou seja, escolhas, notas e probabilidades, cada uma acompanhada de uma pontuação de confiança. A aposta é simples: a maioria das chamadas à IA dentro de um software não serve para produzir prosa, mas para decidir. Se a aposta se confirmar, uma grande parte do mercado dos «modelos pequenos» poderá deslocar-se para uma nova categoria, a dos modelos de decisão. Pensamos que o sinal mais importante não é a velocidade anunciada. É que, pela primeira vez desde o ChatGPT, um ator sério aposta que uma IA mais útil não precisa de falar melhor.
1. Um lançamento a contracorrente
Situemos o momento. Há três anos que cada grande lançamento vai no mesmo sentido: mais raciocínio, mais contexto, mais autonomia. Há apenas três semanas, a OpenAI apresentava o GPT-6 Astra como a entrada na «era da AGI». A corrida mede-se em capacidades conversacionais e agênticas.
A TypeSafe AI segue na direção oposta. Os factos, tal como foram publicados:
- A empresa. Fundada em 2024 em São Francisco por Diogo Almeida, Erik Gafni e Sasha Sheng. Almeida passou cerca de quatro anos na OpenAI, onde trabalhou no RLHF (reinforcement learning from human feedback, aprendizagem por reforço a partir de feedback humano), a técnica que tornou o ChatGPT utilizável.
- O financiamento. Uma ronda de 40 milhões de dólares liderada pelo fundo DCVC, com uma avaliação reportada na ordem dos 200 milhões de dólares.
- O produto. O Jev, disponível em acesso antecipado limitado. Um modelo proprietário baseado na arquitetura Transformer e treinado, segundo a empresa, exclusivamente com dados sintéticos.
- O preço. 0,042 $ por milhão de tokens de entrada, e nada pela saída, segundo a tabela divulgada por Simon Willison e pelo The Register.
O diagnóstico de Almeida, relatado pelo TechCrunch, cabe numa ideia: os LLM atuais adaptam-se mal à automatização porque os computadores não falam a mesma língua que eles. Um software não quer um parágrafo matizado; quer um booleano, uma categoria, um número.
2. O que faz um modelo de decisão
A mudança de abordagem merece uma descrição precisa, porque é mais simples do que parece.
Com um LLM clássico, faz-se uma pergunta em linguagem natural e recebe-se texto. Se se quiser uma decisão utilizável por um programa, pede-se ao modelo que responda «sim» ou «não» e depois espera-se que respeite a instrução, que não acrescente comentários, que não invente uma terceira opção. Toda uma engenharia foi construída para corrigir estes desvios.
O Jev elimina o problema pela raiz. O programador descreve um estado (texto ou dados semiestruturados) e depois coloca perguntas de apenas três formas:
- Choice — escolher entre opções fixadas de antemão. O Jev devolve uma distribuição de probabilidades sobre essas opções.
- Score — atribuir uma nota numa escala definida (urgência de 1 a 5, pertinência, qualidade).
- Noul — uma pergunta fechada, à qual o Jev responde com uma probabilidade entre 0 e 1.
Daqui decorrem duas consequências. Primeiro, a saída é restringida por construção: o modelo não pode responder fora do esquema. É neste sentido que a TypeSafe AI afirma eliminar as alucinações. A afirmação é exata na forma, mais discutível no conteúdo: uma má escolha entre três opções continua a ser um erro, apenas um erro bem formatado. Segundo, a confiança torna-se um dado de primeira ordem. Um software pode decidir agir sozinho acima de 0,9 e chamar uma pessoa abaixo disso.
RLCD — de Reinforcement Learning for Calibrated Decisions, aprendizagem por reforço para decisões calibradas. É o método de treino reivindicado. Onde o RLHF otimiza aquilo que os humanos preferem, o RLCD procuraria alinhar as probabilidades anunciadas com os resultados reais. Um modelo calibrado é um modelo que, quando diz «80 %», acerta cerca de quatro vezes em cada cinco.
A TypeSafe AI coloca o Jev numa categoria a que chama System One models, em referência ao pensamento rápido e intuitivo descrito pelo psicólogo Daniel Kahneman. A imagem é expressiva: os LLM de fronteira fazem o papel do raciocínio lento e deliberado; o Jev, o do reflexo.
3. Os números, e o que deles reter
A empresa reivindica respostas em 70 a 500 milissegundos, e um modelo 40 a 200 vezes mais rápido e 40 a 400 vezes mais barato do que os modelos de fronteira, com picos de 193 e 444 vezes medidos nos seus próprios fluxos de trabalho. A própria empresa reconhece um «possível enviesamento» e que esses picos representam o topo do intervalo.
Os relatos de terreno são mais modestos, e por isso mais interessantes:
- A Vercel, segundo o TechCrunch, terá substituído o Luna, o modelo pequeno da OpenAI, pelo Jev em algumas tarefas, com resultados 5 a 18 vezes mais rápidos e melhor precisão.
- A Bryo AI refere um custo 10 a 20 vezes inferior ao do Gemini e, sobretudo, pontuações de confiança realmente utilizáveis.
Retenhamos a ordem de grandeza em vez do recorde: um fator de 10 no custo e na latência de uma tarefa de classificação. É mais do que suficiente para mudar uma arquitetura de software. A 0,042 $ por milhão de tokens, um milhão de decisões sobre textos de cerca de 500 tokens cada custaria na ordem de uma vintena de dólares.
Os limites já estão documentados. Simon Willison nota que o modelo tem dificuldades com números, datas e conteúdos concebidos para o enganar. O comentador Mo Bitar coloca a pergunta que continua em aberto: «Sei que é rápido. Sei que é barato, mas será bom?». E sobretudo, o Jev não consegue justificar as suas decisões. Um LLM pode pelo menos produzir uma explicação, ainda que imperfeita. Aqui, o raciocínio desaparece por trás de um número decimal.
4. O que isto implica para o mercado
O mercado da IA divide-se em duas camadas
Até agora, o mesmo tipo de ferramenta servia para tudo: redigir um e-mail, resumir um contrato e decidir se uma mensagem é spam. O Jev formaliza uma separação que já existia na prática:
- A camada que fala — redação, raciocínio, conversa, agentes. Continua a ser o terreno dos modelos de fronteira, caros e lentos por natureza.
- A camada que decide — ordenar, encaminhar, filtrar, pontuar, priorizar. Milhares de milhões de microescolhas invisíveis que fazem funcionar o software.
A segunda camada representa provavelmente a maior parte das chamadas em volume. Até agora era faturada como a primeira, por modelos sobredimensionados. É essa ineficiência que o Jev vem explorar.
Os modelos pequenos dos grandes laboratórios estão diretamente expostos
As gamas de entrada (as versões Nano, Flash e Luna dos grandes laboratórios) são usadas massivamente para classificação. São elas que o Jev concorre em primeiro lugar, não os modelos de fronteira. O caso da Vercel deve ser lido assim: não é o Astra que é substituído, é o Luna.
Vemos três respostas possíveis por parte dos grandes laboratórios: baixar ainda mais os preços dos seus modelos pequenos, disponibilizar pontos de acesso de «decisão» nativos (as probabilidades internas de um LLM já existem e poderiam ser mais bem servidas) ou comprar. A ausência de artigo técnico e o recurso a dados sintéticos sugerem que a vantagem da TypeSafe AI assenta mais na execução do que num segredo difícil de reproduzir. Os imitadores já chegaram: uma comparação comunitária, a JevBench, listará mais de 80 sistemas «de classe Jev». Se esta dinâmica se confirmar, a categoria poderá tornar-se uma commodity em poucos meses.
O paradoxo de Jevons, desta vez no nome
O modelo deve o seu nome a William Stanley Jevons, o economista do século XIX que observou que tornar mais eficiente o uso do carvão aumentava o seu consumo total. Descrevemos este mecanismo a propósito do colapso do custo do token. O Jev assume-o abertamente.
Quando uma decisão custa uma fração de cêntimo e uma décima de segundo, não se substituem simplesmente as chamadas existentes: acrescentam-se em todo o lado onde nunca se teria ousado. Cada linha de uma folha de cálculo, cada evento de um registo técnico, cada ação de um agente pode receber a sua pontuação. A despesa unitária colapsa; o volume, esse, pode explodir.
«Sistemas mais inteligentes, não modelos mais inteligentes»
A frase é de Adam Jacob, citada pelo The Register, e resume a deslocação de valor. Andrej Karpathy vê nisto uma resposta a uma procura latente, subinvestida porque toda a indústria corria atrás de mais inteligência. Se esta leitura estiver certa, a vantagem competitiva desloca-se do modelo para a orquestração: saber que pergunta enviar a que modelo, a partir de que limiar de confiança escalar, quando fazer intervir uma pessoa.
Um uso ilustra bem esta deslocação: a supervisão de agentes. Um agente autónomo dispendioso pode ser vigiado por um modelo de decisão que verifica, a cada passo, se a ação prevista se mantém dentro do quadro definido. O reflexo vigia o raciocínio.
A avaliação e a conformidade tornam-se o verdadeiro produto
A opacidade do Jev tem uma consequência direta: só se pode confiar nele se for medido. O paradoxo é que o seu custo irrisório é precisamente o que torna possível uma avaliação exaustiva, sobre dezenas de milhares de casos. Esperamos ver surgir um mercado de ferramentas de avaliação e calibração especializadas nestes modelos.
No plano regulatório, a tentação será grande de usar um modelo de decisão para triar candidaturas, pontuar processos de crédito ou priorizar pedidos de apoio. Ora, o regulamento europeu sobre a inteligência artificial (AI Act) já classifica vários destes usos, como o recrutamento, entre os sistemas de risco elevado, com obrigações de transparência e supervisão humana. Uma pontuação sem explicação encaixa mal. Simon Willison assinala, aliás, possíveis enviesamentos logo nos primeiros testes. Na Europa, a velocidade de adoção dos modelos de decisão poderá depender menos do seu desempenho do que da capacidade de auditar as suas escolhas.
5. Sinais a acompanhar
- Medições independentes. Enquanto os fatores ×193 e ×444 forem medidos pela TypeSafe AI nos seus próprios fluxos, continuam a ser argumentos comerciais. Um banco de ensaio externo, sobre tarefas públicas, dirá onde está a realidade.
- A calibração real. Toda a promessa assenta em probabilidades fiáveis. Se um «0,9» do Jev se revelar certo nove vezes em dez, em domínios variados, a categoria é sólida. Caso contrário, não passa de um classificador rápido.
- A resposta dos grandes laboratórios. Uma API de decisão nativa na OpenAI, na Anthropic ou na Google, ou uma nova descida de preço dos seus modelos pequenos, confirmaria que a ameaça é levada a sério.
- A chegada de modelos abertos equivalentes. Se surgir um modelo de decisão de pesos abertos, a categoria escapará ao controlo de um só ator e tornar-se-á uma peça padrão.
- Os primeiros usos sensíveis. Recrutamento, crédito, moderação: é aí que surgirão as primeiras controvérsias, e as primeiras exigências de explicabilidade.
6. Uma palavra situada
A partir da Reunião, o Jev interpela-nos por uma razão simples: dá razão a uma intuição que defendemos desde o início do laboratório. A boa resposta nem sempre é o modelo mais potente. Grande parte do que se pede à IA numa ferramenta concreta, seja ordenar mensagens, detetar uma urgência ou encaminhar um pedido, é questão de reflexo e não de reflexão. Pagar um modelo de fronteira para estas tarefas é fretar um avião para atravessar a rua.
Para um ator insular e frugal, destacam-se três lições.
Primeiro, o custo da decisão deixou de ser um travão. Uma pequena estrutura pode agora acrescentar discernimento automático às suas ferramentas por alguns dólares por mês. O argumento «a IA é demasiado cara para nós» perde boa parte da sua força.
Segundo, a latência de rede pesa mais do que a do modelo. Quando o modelo responde em 150 milissegundos, a ida e volta entre a nossa ilha e um servidor californiano pode pesar tanto quanto o próprio cálculo. Quanto mais rápido é o modelo, mais visível se torna a distância. É mais um argumento para dispor, localmente, de uma capacidade modesta, no espírito do que escrevemos sobre o hardware de secretária capaz de executar modelos.
Por fim, uma decisão alugada continua a ser uma decisão revogável. O Jev é proprietário, alojado nos Estados Unidos, sem publicação técnica. Vimo-lo com o Fable 5: um acesso pode desaparecer em poucos dias, e a procura no lançamento foi tão forte que a API terá ficado brevemente indisponível. O bom uso parece-nos ser este: tirar partido da ferramenta, mas conceber os nossos sistemas para que a camada de decisão continue substituível, com os nossos próprios conjuntos de testes para verificar que outro modelo faz tão bem.
Há algo de tranquilizador neste lançamento. Depois de três anos de uma corrida em que cada anúncio prometia uma inteligência mais geral, alguém lembra que um software útil é muitas vezes feito de pequenas decisões certas, rápidas e baratas. Não é a direção mais espetacular, mas talvez seja a que chegará a mais pessoas. 決
Fontes e leituras complementares
- TechCrunch — «A new kind of AI model from a ChatGPT inventor is thrilling developers» — Declarações de Diogo Almeida, relatos da Vercel e da Bryo AI.
- Simon Willison — «Jev introduces a new shape of LLM—System One, aka Decision Models» — Funcionamento da API, preço, limites e riscos de enviesamento.
- The Register — «Shut up and calculate: Jev's new AI primitives for coders» — Primitivas Choice, Score e Noul, usos dos programadores, reações críticas.
- Tom's Hardware — «TypeSafe AI's Jev offers an alternative to LLMs that claims to be 193x faster and 445x cheaper» — Números de velocidade e custo reivindicados.
- Wikipédia — «Jev (AI model)») — Cronologia, financiamento, método RLCD e origem do nome.
- Ryuzaki Labs — «O colapso do custo do token», «GPT-6 Astra» e «Fable 5, desligado em 72 horas» — As nossas análises anteriores sobre o paradoxo de Jevons, a corrida à fronteira e a revogabilidade das capacidades alugadas.
Este documento é atualizado se surgirem elementos novos. Última revisão: 文 24 de setembro de 2026.