TypeSafe · Acesso Antecipado

Avalie textos em larga escala com o Jev.

O Jev é um modelo de julgamento estruturado da TypeSafe. Ele gera resultados exatos em formato booleano, múltipla escolha e pontuação. Você pode processar até 32 perguntas independentes em paralelo por solicitação.

Illustration of Jev turning a block of text into three structured judgment cards: a probability bar, a multiple-choice selector, and an ordered score bar

Chame o Jev diretamente do seu espaço de trabalho.

O Agente Kollab invoca o Jev automaticamente quando você pede avaliações estruturadas. Você também pode executá-lo manualmente via CLI para scripts e pipelines.

Instalar e executar
npm install -g @kollab/cli
kollab login

echo '{
  "state": "Help! My payouts have been failing for 3 days.",
  "questions": {
    "is_urgent": { "type": "noul", "instructions": "Does this convey urgency?" },
    "department": { "type": "choice", "instructions": "Which team should handle this?",
      "criteria": { "billing": "Payments, invoicing, refunds", "technical": "Bugs, outages, integrations", "sales": "Pricing, upgrades, new accounts" } }
  }
}' | kollab tool run jev --json

Parte do arsenal de modelos do Kollab.

Acesse o Jev junto com um conjunto completo de modelos para tarefas de texto, visão, vídeo e áudio.

Imagens
GPT Image 2
Vídeo
Seedance 2 · Veo 3
Voz
Grok TTS · Grok STT
Visão
Visual Q&A
Pesquisa e dados
Web search · Deep search · Social data fetch
Modelos de chat
Claude · GPT · Gemini · Grok · Kimi · DeepSeek · GLM

Casos de uso de julgamento estruturado.

Execute tarefas específicas de avaliação com o Jev.

Benchmarks de desempenho.

Execução rápida e alta consistência para tarefas de classificação em lote.

Benchmarks Oficiais
Paralelo vs Sequencial
10x mais rápido · 12,2x mais barato

13 perguntas em uma chamada: 0,27s vs. 2,71s para 13 chamadas separadas

TypeSafe cookbook
Benchmarks Oficiais
Precisão do Top-10 na Reordenação de Candidatos
38% → 62%

Conjunto de dados jurídicos CLERC, 40 consultas, lista restrita top-30 do BM25

TypeSafe cookbook
Avaliações Independentes
Concordância com o Claude Fable 5.1
91,5%

6.003 avaliações verificadas · US$ 160 vs US$ 33.000 por milhão de julgamentos

Good Start Labs
Avaliações Independentes
Velocidade na Detecção de Defeitos de Escrita
25x mais rápido

Mediana de 0,35s vs 8,83s · detectou 6/7 defeitos inseridos

Every.to
Avaliações Independentes
Precisão na Classificação Zero-Shot de Spam
98,64%

Conjunto de teste com 5.733 e-mails, próximo aos 98,87% de uma base de referência TF-IDF ajustada

bitnovus (independente)

Perguntas frequentes.

O que é o Jev e como ele difere dos modelos de chat padrão?+

O Jev é um modelo de julgamento estruturado. Ele gera resultados exatos em formato booleano, múltipla escolha e pontuação. Ele ignora completamente textos conversacionais e retorna dados puros.

Como eu uso o Jev no Kollab?+

O Agente Kollab invoca o Jev automaticamente quando você descreve uma tarefa que requer julgamento estruturado. Você também pode chamá-lo diretamente do seu terminal usando o comando `kollab tool run jev`.

Como o preço é calculado?+

Os tokens de entrada custam US$ 0,042 por milhão. Os tokens de saída são totalmente gratuitos.

O Jev tem suporte a chinês, japonês e coreano?+

Sim. A precisão para os idiomas CJK é atualmente inferior à do inglês.

As probabilidades de confiança são absolutamente precisas?+

Auditorias independentes mostram que as probabilidades de saída do Jev não são estritamente calibradas. Trate-as como pontuações relativas e monotônicas. Recomendamos a verificação por amostragem em tarefas de alto risco.

O Jev pode processar imagens ou áudio?+

O Jev processa apenas texto simples de até 80,000 caracteres. Você deve primeiro transcrever o áudio ou extrair o texto das imagens. O Kollab oferece outros modelos, como GPT Image 2 e Grok STT, para o processamento direto de mídia.

Comece a avaliar textos com o Jev.

Execute tarefas de classificação e pontuação de alto volume diretamente no seu espaço de trabalho.