Pular para o conteúdo
Confronto visual entre a Decisions API da OpenAI e a Jev da TypeSafe, destacando a análise de acurácia em português.
Voltar para o Blog

Decisions API da OpenAI vs Jev: Testei os Dois em Português e a OpenAI Acertou Mais, Mas Não Ganhou

Equipe Golber.
11 min de leitura
Inteligência Artificial

Entre na sua conta para curtir e guardar o que gostou.

Ouça este artigo

Decisions API da OpenAI vs Jev: Testei os Dois em Português e a OpenAI Acertou Mais, Mas Não Ganhou

0:00 / 16:04
1×
Sincronia do destaque
no ponto
Se a voz parecer atrás do trecho marcado, atrase o destaque
Confronto visual entre a Decisions API da OpenAI e a Jev da TypeSafe, destacando a análise de acurácia em português.

A OpenAI lançou a Decisions API com os mesmos formatos do Jev, três semanas depois. Testei os dois com 65 julgamentos em português: acertos, latência, custo real por chamada, o detalhe da confiança que muda a conta e qual usar.

Três semanas depois de a TypeSafe lançar o Jev, a OpenAI abriu a Decisions API com os mesmos três formatos de resposta: sim ou não, escolha entre opções e nota em níveis. Eu uso o Jev no golber.net desde setembro, então fiz o que a manchete não faz: testei os dois com os mesmos 65 julgamentos em português.

A OpenAI acertou mais: 64 contra 61. Mesmo assim, para o meu uso, ela não ganhou. Abaixo estão os números do teste, onde cada um errou, o detalhe da confiança que muda a conta, o preço real por chamada, o que os dois modelos preveem sobre a própria briga e qual eu usaria em cada caso.

  • O que é a Decisions API e o que a OpenAI publicou

  • Jev e Decisions lado a lado, em preço, limites e privacidade

  • O teste com 65 julgamentos em português

  • Por que acertar mais não basta

  • A OpenAI copiou o Jev, o que os dois preveem e qual usar

O que é a Decisions API

É um endpoint da OpenAI que devolve decisões tipadas em vez de texto. Você manda um texto ou uma imagem e uma lista de perguntas; ela responde com probabilidade, escolha ou nota. Está em beta público, roda só com o gpt-6-luna e custa US$ 0,10 por milhão de tokens de entrada, sem cobrar saída.

Foi apresentada no DevDay de 29 de setembro e aberta em beta público em 6 de outubro. Os três tipos de pergunta, segundo o guia oficial da OpenAI:

  • predicate: a probabilidade, de 0 a 1, de uma condição ser verdadeira.

  • choice: uma opção entre as que você definiu, com a probabilidade de cada uma e uma confiança.

  • score: uma nota em níveis ordenados, com a distribuição entre eles e uma confiança.

A página afirma que ela é "about 10x faster than the Responses API", sem benchmark publicado. Aceita imagem, mas só embutida em base64: link hospedado e arquivo enviado antes não entram. Tem Zero Data Retention e HIPAA para clientes elegíveis, além de residência de dados nos Estados Unidos e na Europa. Limites de taxa, tamanho máximo de entrada e número máximo de perguntas não estão publicados.

Quem já leu os meus posts sobre o Jev da TypeSafe reconhece o desenho na hora: o predicate é o noul do Jev, e choice e score têm até o mesmo nome. A Decisions apareceu de passagem no meu resumo do DevDay, mas merecia um teste de verdade.

Jev e Decisions lado a lado

No papel, a diferença está no preço, na imagem e na privacidade. O Jev cobra US$ 0,042 por milhão de tokens; a Decisions, US$ 0,10. A Decisions aceita imagem e oferece retenção zero e residência de dados; o Jev publica limites de taxa e contexto, e a OpenAI não.

Ponto

Jev (TypeSafe)

Decisions API (OpenAI)

Entrada, por 1M de tokens

US$ 0,042

US$ 0,10

Saída

Grátis

Grátis

Formatos

noul, choice (até 255 opções), score (até 10 níveis)

predicate, choice, score

Modelo

jev-1.13.0

Só gpt-6-luna

Imagem

Não aparece na tabela de modelos

Sim, em base64

Contexto

64 mil tokens por requisição

Não publicado

Limites de taxa

100 mil tokens e 80 requisições por segundo

Não publicados

Privacidade

Retenção zero só no plano enterprise

ZDR e HIPAA para elegíveis; dados nos EUA ou na Europa

Situação

Acesso antecipado desde 15/09

Beta público desde 06/10

Dois avisos de cada lado. A TypeSafe disse no lançamento que o preço pode ser subsidiado e que espera que ele caia. A OpenAI ainda não deu data para a versão final, e uma reportagem da Mixed News notou que a própria página do gpt-6-luna não listava o endpoint de decisões entre os suportados. Os dois são produtos de três semanas de idade.

O teste com 65 julgamentos em português

Escrevi 41 casos em português, sem nenhum dado real, e mandei as mesmas perguntas, com as mesmas instruções, para os dois. A Decisions acertou 64 de 65 julgamentos, e o Jev, 61. Rodei tudo duas vezes, e nenhuma resposta mudou de uma rodada para a outra, em nenhum dos dois.

Os casos imitam o que eu uso de verdade no site:

  1. 24 mensagens de chat: qual é o assunto (venda, dúvida, suporte, reclamação, spam ou outro) e se há um problema crítico, como pagamento, acesso ou dados pessoais.

  2. 12 avarias anotadas no checklist de uma viatura, com nota de gravidade em quatro níveis.

  3. 5 armadilhas conhecidas desse tipo de modelo: uma soma, uma comparação de datas, uma dupla negação, uma negação simples e uma ironia.

Resultado

Jev

Decisions

Acertos (de 65)

61

64

Latência mediana, medida do Brasil

244 ms

232 ms

Latência p90

277 ms

275 ms

Tokens por chamada (média)

547

407

Custo por 100 mil chamadas iguais

US$ 2,30

US$ 4,07

Três achados que a tabela de preço não mostra. Na velocidade, deu empate técnico: o cabeçalho da OpenAI mostrou mediana de 85 ms de processamento no servidor, mas, somado o caminho de rede, as medianas ficaram em 232 e 244 ms. No custo, a diferença real é de 1,8 vez, e não de 2,4, porque o Jev contou mais tokens para o mesmo pedido. E na consistência, os dois foram estáveis.

Onde cada um errou:

  • Jev, no chat: "meu site em wordpress caiu de novo, vocês arrumam?" virou suporte (é venda, porque o site é da pessoa), e "paguei a consultoria ontem e ainda não confirmou" virou reclamação (eu esperava suporte).

  • Jev, nas avarias: o retrovisor trincado mas funcionando subiu para moderada, e a sirene que falha às vezes subiu para grave. Confesso que os dois rótulos são discutíveis: numa viatura de emergência, sirene falhando pode ser grave mesmo.

  • Decisions, nas armadilhas: errou a soma. Perguntei se R$ 1.200 mais R$ 850 passam de R$ 2.000, e ela deu 1% de chance de que sim. O Jev acertou com 98%, e ainda deu 97% na dupla negação, em que a Decisions ficou em 68%.

Uma ressalva honesta: 65 julgamentos escritos por mim é uma amostra pequena, e os rótulos são meus. Isso não é benchmark, é o retrato de um uso real. Se você vai decidir com base nisso, refaça com os seus casos, como mostro no post sobre quanto o Jev custa num sistema de verdade.

Por que acertar mais não basta

Num sistema, o erro que mais custa é o que vem com certeza alta. O valor de um modelo de decisão está em dizer quando não sabe, para o código mandar o caso a uma pessoa. Nesse ponto, o Jev foi melhor no meu teste, mesmo errando mais.

Um classificador que erra com 60% de confiança é um classificador que te avisa. Um que acerta com 11% de confiança te obriga a revisar tudo.

Os números da pergunta de assunto, a de seis opções:

  • Jev: os acertos vieram com confiança média de 0,97, e os 2 erros com 0,60 e 0,69. Com um limiar de 0,7, o código manda para revisão exatamente os 2 erros e nada mais.

  • Decisions: nenhum erro, mas os acertos vieram com confiança média de 0,77, e 8 dos 24 ficaram abaixo de 0,7. Um deles, "o pix da proposta deu erro", saiu certo com 0,11.

Na prática, com a Decisions eu teria de escolher entre confiar em tudo (e torcer) ou mandar um terço das conversas para revisão. Com o Jev, a regra "abaixo de 0,7 vai para uma pessoa" funcionou. A TypeSafe chama o treino dela de RLCD, aprendizado por reforço para decisões calibradas, e é exatamente esse ponto que ela vende. A OpenAI não fala em calibração no guia: recomenda que você ajuste os limiares com exemplos rotulados da sua aplicação.

Nas notas de gravidade, a confiança não separou os erros nos dois casos: os do Jev vieram com 0,87 e 0,82. Então a vantagem vale para a pergunta de escolha neste teste, não para tudo.

A OpenAI copiou o Jev?

Não dá para provar cópia, e eu não vou afirmar. O que dá para dizer: o mesmo desenho, com os mesmos três formatos e a saída grátis, chegou três semanas depois, e a Crypto Briefing já leu o anúncio do DevDay como "a competitive response to products like Jev". A ideia de classificar com probabilidade é antiga. O pacote é que ficou parecido demais para ser coincidência de marketing.

O risco para a TypeSafe não é técnico. É distribuição. Quem já paga a OpenAI, já tem a chave, o contrato, o SDK e a nota fiscal ganha a Decisions com uma linha de código. A TypeSafe precisa convencer cada desenvolvedor a abrir mais uma conta. É a mesma história de produto que vira recurso de plataforma grande, que já vimos com os agentes da OpenAI.

Perguntei aos dois modelos sobre o futuro da briga, com os mesmos fatos e as mesmas perguntas. Cada um parece um pouco otimista com o próprio lado:

Até 31/12/2026

Jev

Decisions

A Decisions sai do beta

35%

73%

A Decisions ganha outro modelo além do gpt-6-luna

39%

68%

A OpenAI baixa a Decisions para US$ 0,042 ou menos

28%

50%

A TypeSafe baixa o preço do Jev

60%

68%

Google ou Anthropic lançam uma API igual

38%

35%

A TypeSafe é comprada ou fecha (até 30/06/2027)

9%

18%

O modelo da OpenAI dá o dobro de chance de a própria OpenAI chegar à versão final, e o dobro de chance de a TypeSafe ser comprada ou fechar. Não acho que seja viés de propósito, mas é divertido ver. Eu registro as apostas pelo lado que o Jev acha mais provável, porque é ele que uso aqui, e confiro em janeiro no placar de previsões:

ApostaConfiançaVerificaçãoResultado
A Decisions API da OpenAI ainda está em beta em 31/12/2026.65%05/01/2027Em aberto
A Decisions API continua só com o gpt-6-luna em 31/12/2026.61%05/01/2027Em aberto
A OpenAI não baixa a Decisions API para US$ 0,042 ou menos por milhão de tokens até 31/12/2026.72%05/01/2027Em aberto
A TypeSafe baixa o preço do Jev abaixo de US$ 0,042 por milhão de tokens até 31/12/2026.60%05/01/2027Em aberto
Nem Google nem Anthropic lançam uma API própria de decisões tipadas até 31/12/2026.62%05/01/2027Em aberto

Qual usar no seu sistema

Para quem já está na OpenAI e precisa de imagem, retenção zero ou dados na Europa, a Decisions resolve sem conta nova. Para quem quer o menor custo e uma confiança que separa o erro do acerto, o Jev ainda leva. Eu continuo com o Jev no golber.net e deixo a Decisions como reserva.

Um roteiro rápido de escolha:

  1. Precisa julgar foto (avaria, produto, documento)? Decisions, porque aceita imagem.

  2. Tem exigência de contrato, saúde ou dado na Europa? Decisions, pelo ZDR, HIPAA e residência de dados, se a sua conta for elegível.

  3. Vai rodar milhões de chamadas e precisa mandar só os casos duvidosos para uma pessoa? Jev, pelo preço e pela confiança, desde que você confirme com os seus casos.

  4. Tem conta, soma ou data no meio? Nenhum dos dois: faça a conta no código. A Decisions errou a soma, e a documentação do Jev avisa que ele não é calculadora.

  5. Não quer depender de uma empresa só? Escreva as perguntas uma vez e troque o fornecedor por configuração, como faço com os modelos da OpenAI nos meus sistemas.

O ponto mais importante não muda: os dois formatos são quase iguais, então o custo de trocar é baixo. Monte as perguntas e os casos de teste no seu código, e o fornecedor vira detalhe. Se você quer colocar decisões de IA baratas e auditáveis no seu sistema, com triagem, limiar e revisão humana nos casos duvidosos, é o que eu faço na consultoria técnica.

Perguntas frequentes

O que é a Decisions API da OpenAI?

É um endpoint da OpenAI, em beta público desde 6 de outubro de 2026, que devolve decisões tipadas em vez de texto: probabilidade de sim, escolha entre opções ou nota em níveis. Roda só com o gpt-6-luna e aceita texto e imagem.

Quanto custa a Decisions API?

US$ 0,10 por milhão de tokens de entrada, sem cobrança de saída nem de cache, segundo o guia da OpenAI. No meu teste, saiu US$ 4,07 a cada 100 mil chamadas curtas, contra US$ 2,30 do Jev.

A Decisions API é melhor que o Jev?

No meu teste com 65 julgamentos em português, a Decisions acertou 64 e o Jev 61. Mas os erros do Jev vieram com confiança baixa, fáceis de mandar para revisão, e a Decisions deu confiança baixa até em acertos. Teste com os seus casos.

A Decisions API é mais rápida que o Jev?

Não no meu teste. Medindo do Brasil, a mediana foi de 232 ms na Decisions e 244 ms no Jev. A OpenAI diz que ela é cerca de 10 vezes mais rápida que a Responses API, que é outra comparação.

A Decisions API funciona em português?

Funcionou bem no meu teste, com 64 acertos em 65. A OpenAI não publica uma lista de idiomas no guia. O Jev diz que o inglês é a língua principal e que outras funcionam, mas não tão bem.

A OpenAI copiou o Jev?

Não há como provar. Os três formatos e a saída grátis são iguais, e a Decisions saiu três semanas depois do Jev. A Crypto Briefing leu o anúncio como resposta competitiva a produtos como o Jev.

Gostou?
Compartilhar

Golber Dóriaquem escreve este blog

Receba os posts novos no seu email

IA aplicada ao trabalho, stack e o negócio de uma pessoa só, direto na sua caixa de entrada. Sem spam, e sair é um clique em qualquer email.