
Decisions API da OpenAI vs Jev: Testei os Dois em Português e a OpenAI Acertou Mais, Mas Não Ganhou
Entre na sua conta para curtir e guardar o que gostou.
Decisions API da OpenAI vs Jev: Testei os Dois em Português e a OpenAI Acertou Mais, Mas Não Ganhou
Entre na sua conta para curtir e guardar o que gostou.
Decisions API da OpenAI vs Jev: Testei os Dois em Português e a OpenAI Acertou Mais, Mas Não Ganhou
0:00 / 16:04
A OpenAI lançou a Decisions API com os mesmos formatos do Jev, três semanas depois. Testei os dois com 65 julgamentos em português: acertos, latência, custo real por chamada, o detalhe da confiança que muda a conta e qual usar.
Três semanas depois de a TypeSafe lançar o Jev, a OpenAI abriu a Decisions API com os mesmos três formatos de resposta: sim ou não, escolha entre opções e nota em níveis. Eu uso o Jev no golber.net desde setembro, então fiz o que a manchete não faz: testei os dois com os mesmos 65 julgamentos em português.
A OpenAI acertou mais: 64 contra 61. Mesmo assim, para o meu uso, ela não ganhou. Abaixo estão os números do teste, onde cada um errou, o detalhe da confiança que muda a conta, o preço real por chamada, o que os dois modelos preveem sobre a própria briga e qual eu usaria em cada caso.
O que é a Decisions API e o que a OpenAI publicou
Jev e Decisions lado a lado, em preço, limites e privacidade
O teste com 65 julgamentos em português
Por que acertar mais não basta
A OpenAI copiou o Jev, o que os dois preveem e qual usar
O que é a Decisions API
É um endpoint da OpenAI que devolve decisões tipadas em vez de texto. Você manda um texto ou uma imagem e uma lista de perguntas; ela responde com probabilidade, escolha ou nota. Está em beta público, roda só com o gpt-6-luna e custa US$ 0,10 por milhão de tokens de entrada, sem cobrar saída.
Foi apresentada no DevDay de 29 de setembro e aberta em beta público em 6 de outubro. Os três tipos de pergunta, segundo o guia oficial da OpenAI:
predicate: a probabilidade, de 0 a 1, de uma condição ser verdadeira.
choice: uma opção entre as que você definiu, com a probabilidade de cada uma e uma confiança.
score: uma nota em níveis ordenados, com a distribuição entre eles e uma confiança.
A página afirma que ela é "about 10x faster than the Responses API", sem benchmark publicado. Aceita imagem, mas só embutida em base64: link hospedado e arquivo enviado antes não entram. Tem Zero Data Retention e HIPAA para clientes elegíveis, além de residência de dados nos Estados Unidos e na Europa. Limites de taxa, tamanho máximo de entrada e número máximo de perguntas não estão publicados.
Quem já leu os meus posts sobre o Jev da TypeSafe reconhece o desenho na hora: o predicate é o noul do Jev, e choice e score têm até o mesmo nome. A Decisions apareceu de passagem no meu resumo do DevDay, mas merecia um teste de verdade.
Jev e Decisions lado a lado
No papel, a diferença está no preço, na imagem e na privacidade. O Jev cobra US$ 0,042 por milhão de tokens; a Decisions, US$ 0,10. A Decisions aceita imagem e oferece retenção zero e residência de dados; o Jev publica limites de taxa e contexto, e a OpenAI não.
Ponto | Jev (TypeSafe) | Decisions API (OpenAI) |
|---|---|---|
Entrada, por 1M de tokens | US$ 0,042 | US$ 0,10 |
Saída | Grátis | Grátis |
Formatos | noul, choice (até 255 opções), score (até 10 níveis) | predicate, choice, score |
Modelo | jev-1.13.0 | Só gpt-6-luna |
Imagem | Não aparece na tabela de modelos | Sim, em base64 |
Contexto | 64 mil tokens por requisição | Não publicado |
Limites de taxa | 100 mil tokens e 80 requisições por segundo | Não publicados |
Privacidade | Retenção zero só no plano enterprise | ZDR e HIPAA para elegíveis; dados nos EUA ou na Europa |
Situação | Acesso antecipado desde 15/09 | Beta público desde 06/10 |
Dois avisos de cada lado. A TypeSafe disse no lançamento que o preço pode ser subsidiado e que espera que ele caia. A OpenAI ainda não deu data para a versão final, e uma reportagem da Mixed News notou que a própria página do gpt-6-luna não listava o endpoint de decisões entre os suportados. Os dois são produtos de três semanas de idade.
O teste com 65 julgamentos em português
Escrevi 41 casos em português, sem nenhum dado real, e mandei as mesmas perguntas, com as mesmas instruções, para os dois. A Decisions acertou 64 de 65 julgamentos, e o Jev, 61. Rodei tudo duas vezes, e nenhuma resposta mudou de uma rodada para a outra, em nenhum dos dois.
Os casos imitam o que eu uso de verdade no site:
24 mensagens de chat: qual é o assunto (venda, dúvida, suporte, reclamação, spam ou outro) e se há um problema crítico, como pagamento, acesso ou dados pessoais.
12 avarias anotadas no checklist de uma viatura, com nota de gravidade em quatro níveis.
5 armadilhas conhecidas desse tipo de modelo: uma soma, uma comparação de datas, uma dupla negação, uma negação simples e uma ironia.
Resultado | Jev | Decisions |
|---|---|---|
Acertos (de 65) | 61 | 64 |
Latência mediana, medida do Brasil | 244 ms | 232 ms |
Latência p90 | 277 ms | 275 ms |
Tokens por chamada (média) | 547 | 407 |
Custo por 100 mil chamadas iguais | US$ 2,30 | US$ 4,07 |
Três achados que a tabela de preço não mostra. Na velocidade, deu empate técnico: o cabeçalho da OpenAI mostrou mediana de 85 ms de processamento no servidor, mas, somado o caminho de rede, as medianas ficaram em 232 e 244 ms. No custo, a diferença real é de 1,8 vez, e não de 2,4, porque o Jev contou mais tokens para o mesmo pedido. E na consistência, os dois foram estáveis.
Onde cada um errou:
Jev, no chat: "meu site em wordpress caiu de novo, vocês arrumam?" virou suporte (é venda, porque o site é da pessoa), e "paguei a consultoria ontem e ainda não confirmou" virou reclamação (eu esperava suporte).
Jev, nas avarias: o retrovisor trincado mas funcionando subiu para moderada, e a sirene que falha às vezes subiu para grave. Confesso que os dois rótulos são discutíveis: numa viatura de emergência, sirene falhando pode ser grave mesmo.
Decisions, nas armadilhas: errou a soma. Perguntei se R$ 1.200 mais R$ 850 passam de R$ 2.000, e ela deu 1% de chance de que sim. O Jev acertou com 98%, e ainda deu 97% na dupla negação, em que a Decisions ficou em 68%.
Uma ressalva honesta: 65 julgamentos escritos por mim é uma amostra pequena, e os rótulos são meus. Isso não é benchmark, é o retrato de um uso real. Se você vai decidir com base nisso, refaça com os seus casos, como mostro no post sobre quanto o Jev custa num sistema de verdade.
Por que acertar mais não basta
Num sistema, o erro que mais custa é o que vem com certeza alta. O valor de um modelo de decisão está em dizer quando não sabe, para o código mandar o caso a uma pessoa. Nesse ponto, o Jev foi melhor no meu teste, mesmo errando mais.
Um classificador que erra com 60% de confiança é um classificador que te avisa. Um que acerta com 11% de confiança te obriga a revisar tudo.
Os números da pergunta de assunto, a de seis opções:
Jev: os acertos vieram com confiança média de 0,97, e os 2 erros com 0,60 e 0,69. Com um limiar de 0,7, o código manda para revisão exatamente os 2 erros e nada mais.
Decisions: nenhum erro, mas os acertos vieram com confiança média de 0,77, e 8 dos 24 ficaram abaixo de 0,7. Um deles, "o pix da proposta deu erro", saiu certo com 0,11.
Na prática, com a Decisions eu teria de escolher entre confiar em tudo (e torcer) ou mandar um terço das conversas para revisão. Com o Jev, a regra "abaixo de 0,7 vai para uma pessoa" funcionou. A TypeSafe chama o treino dela de RLCD, aprendizado por reforço para decisões calibradas, e é exatamente esse ponto que ela vende. A OpenAI não fala em calibração no guia: recomenda que você ajuste os limiares com exemplos rotulados da sua aplicação.
Nas notas de gravidade, a confiança não separou os erros nos dois casos: os do Jev vieram com 0,87 e 0,82. Então a vantagem vale para a pergunta de escolha neste teste, não para tudo.
A OpenAI copiou o Jev?
Não dá para provar cópia, e eu não vou afirmar. O que dá para dizer: o mesmo desenho, com os mesmos três formatos e a saída grátis, chegou três semanas depois, e a Crypto Briefing já leu o anúncio do DevDay como "a competitive response to products like Jev". A ideia de classificar com probabilidade é antiga. O pacote é que ficou parecido demais para ser coincidência de marketing.
O risco para a TypeSafe não é técnico. É distribuição. Quem já paga a OpenAI, já tem a chave, o contrato, o SDK e a nota fiscal ganha a Decisions com uma linha de código. A TypeSafe precisa convencer cada desenvolvedor a abrir mais uma conta. É a mesma história de produto que vira recurso de plataforma grande, que já vimos com os agentes da OpenAI.
Perguntei aos dois modelos sobre o futuro da briga, com os mesmos fatos e as mesmas perguntas. Cada um parece um pouco otimista com o próprio lado:
Até 31/12/2026 | Jev | Decisions |
|---|---|---|
A Decisions sai do beta | 35% | 73% |
A Decisions ganha outro modelo além do gpt-6-luna | 39% | 68% |
A OpenAI baixa a Decisions para US$ 0,042 ou menos | 28% | 50% |
A TypeSafe baixa o preço do Jev | 60% | 68% |
Google ou Anthropic lançam uma API igual | 38% | 35% |
A TypeSafe é comprada ou fecha (até 30/06/2027) | 9% | 18% |
O modelo da OpenAI dá o dobro de chance de a própria OpenAI chegar à versão final, e o dobro de chance de a TypeSafe ser comprada ou fechar. Não acho que seja viés de propósito, mas é divertido ver. Eu registro as apostas pelo lado que o Jev acha mais provável, porque é ele que uso aqui, e confiro em janeiro no placar de previsões:
| Aposta | Confiança | Verificação | Resultado |
|---|---|---|---|
| A Decisions API da OpenAI ainda está em beta em 31/12/2026. | 65% | 05/01/2027 | Em aberto |
| A Decisions API continua só com o gpt-6-luna em 31/12/2026. | 61% | 05/01/2027 | Em aberto |
| A OpenAI não baixa a Decisions API para US$ 0,042 ou menos por milhão de tokens até 31/12/2026. | 72% | 05/01/2027 | Em aberto |
| A TypeSafe baixa o preço do Jev abaixo de US$ 0,042 por milhão de tokens até 31/12/2026. | 60% | 05/01/2027 | Em aberto |
| Nem Google nem Anthropic lançam uma API própria de decisões tipadas até 31/12/2026. | 62% | 05/01/2027 | Em aberto |
Qual usar no seu sistema
Para quem já está na OpenAI e precisa de imagem, retenção zero ou dados na Europa, a Decisions resolve sem conta nova. Para quem quer o menor custo e uma confiança que separa o erro do acerto, o Jev ainda leva. Eu continuo com o Jev no golber.net e deixo a Decisions como reserva.
Um roteiro rápido de escolha:
Precisa julgar foto (avaria, produto, documento)? Decisions, porque aceita imagem.
Tem exigência de contrato, saúde ou dado na Europa? Decisions, pelo ZDR, HIPAA e residência de dados, se a sua conta for elegível.
Vai rodar milhões de chamadas e precisa mandar só os casos duvidosos para uma pessoa? Jev, pelo preço e pela confiança, desde que você confirme com os seus casos.
Tem conta, soma ou data no meio? Nenhum dos dois: faça a conta no código. A Decisions errou a soma, e a documentação do Jev avisa que ele não é calculadora.
Não quer depender de uma empresa só? Escreva as perguntas uma vez e troque o fornecedor por configuração, como faço com os modelos da OpenAI nos meus sistemas.
O ponto mais importante não muda: os dois formatos são quase iguais, então o custo de trocar é baixo. Monte as perguntas e os casos de teste no seu código, e o fornecedor vira detalhe. Se você quer colocar decisões de IA baratas e auditáveis no seu sistema, com triagem, limiar e revisão humana nos casos duvidosos, é o que eu faço na consultoria técnica.
Perguntas frequentes
O que é a Decisions API da OpenAI?
É um endpoint da OpenAI, em beta público desde 6 de outubro de 2026, que devolve decisões tipadas em vez de texto: probabilidade de sim, escolha entre opções ou nota em níveis. Roda só com o gpt-6-luna e aceita texto e imagem.
Quanto custa a Decisions API?
US$ 0,10 por milhão de tokens de entrada, sem cobrança de saída nem de cache, segundo o guia da OpenAI. No meu teste, saiu US$ 4,07 a cada 100 mil chamadas curtas, contra US$ 2,30 do Jev.
A Decisions API é melhor que o Jev?
No meu teste com 65 julgamentos em português, a Decisions acertou 64 e o Jev 61. Mas os erros do Jev vieram com confiança baixa, fáceis de mandar para revisão, e a Decisions deu confiança baixa até em acertos. Teste com os seus casos.
A Decisions API é mais rápida que o Jev?
Não no meu teste. Medindo do Brasil, a mediana foi de 232 ms na Decisions e 244 ms no Jev. A OpenAI diz que ela é cerca de 10 vezes mais rápida que a Responses API, que é outra comparação.
A Decisions API funciona em português?
Funcionou bem no meu teste, com 64 acertos em 65. A OpenAI não publica uma lista de idiomas no guia. O Jev diz que o inglês é a língua principal e que outras funcionam, mas não tão bem.
A OpenAI copiou o Jev?
Não há como provar. Os três formatos e a saída grátis são iguais, e a Decisions saiu três semanas depois do Jev. A Crypto Briefing leu o anúncio como resposta competitiva a produtos como o Jev.
Golber Dóriaquem escreve este blog
Receba os posts novos no seu email
IA aplicada ao trabalho, stack e o negócio de uma pessoa só, direto na sua caixa de entrada. Sem spam, e sair é um clique em qualquer email.