TypeSafe · 搶先體驗

使用 Jev 大規模評估文本。

Jev 是由 TypeSafe 推出的結構化判斷模型。它能輸出精確的布林值、選擇與評分結果。您可以在單次請求中平行處理多達 32 個獨立問題。

Illustration of Jev turning a block of text into three structured judgment cards: a probability bar, a multiple-choice selector, and an ordered score bar

直接從您的工作區呼叫 Jev。

當您要求進行結構化評估時,Kollab Agent 會自動呼叫 Jev。您也可以透過命令列介面 (CLI) 手動執行,以便用於指令碼與自動化流程。

安裝與呼叫
npm install -g @kollab/cli
kollab login

echo '{
  "state": "Help! My payouts have been failing for 3 days.",
  "questions": {
    "is_urgent": { "type": "noul", "instructions": "Does this convey urgency?" },
    "department": { "type": "choice", "instructions": "Which team should handle this?",
      "criteria": { "billing": "Payments, invoicing, refunds", "technical": "Bugs, outages, integrations", "sales": "Pricing, upgrades, new accounts" } }
  }
}' | kollab tool run jev --json

Kollab 模型庫的一部分。

與處理文本、視覺、影片及音訊任務的完整模型套件一起使用 Jev。

圖片
GPT Image 2
影片
Seedance 2 · Veo 3
語音
Grok TTS · Grok STT
視覺
Visual Q&A
搜尋與資料
Web search · Deep search · Social data fetch
聊天模型
Claude · GPT · Gemini · Grok · Kimi · DeepSeek · GLM

結構化判斷的應用案例。

使用 Jev 執行特定的評估任務。

效能基準測試。

針對大批量的分類任務,提供快速執行與高度一致性。

官方基準測試
平行與循序處理對比
快 10 倍 · 便宜 12.2 倍

單次呼叫處理 13 個問題:0.27 秒,相較於分開 13 次呼叫需 2.71 秒

TypeSafe cookbook
官方基準測試
候選項目重新排序 Top-10 準確率
38% → 62%

CLERC 法律資料集,40 個查詢字詞,BM25 前 30 名候選清單

TypeSafe cookbook
第三方獨立評估
與 Claude Fable 5.1 的結果一致性
91.5%

檢查了 6,003 筆評分 · 每百萬次判斷成本為 US$160 對比 US$33,000

Good Start Labs
第三方獨立評估
寫作瑕疵偵測速度
快 25 倍

中位數 0.35 秒對比 8.83 秒 · 成功偵測出 6/7 個人為植入的瑕疵

Every.to
第三方獨立評估
垃圾郵件 Zero-Shot 分類準確率
98.64%

5,733 封電子郵件的測試集,逼近經過微調的 TF-IDF 基準值 98.87%

bitnovus (獨立評估)

常見問題。

Jev 是什麼?它與標準的聊天模型有何不同?+

Jev 是一個結構化判斷模型。它能輸出精確的布林值、選擇和評分。它完全跳過對話式文本,只回傳純資料。

我該如何在 Kollab 中使用 Jev?+

當您描述一個需要結構化判斷的任務時,Kollab Agent 會自動呼叫 Jev。您也可以透過終端機使用 `kollab tool run jev` 指令來直接呼叫它。

定價是如何計算的?+

輸入的 Token 費用為每百萬個 US$0.042 美元。輸出的 Token 則是完全免費的。

Jev 支援中文、日文和韓文嗎?+

是的。不過目前中日韓 (CJK) 語言的準確率仍低於英文。

信賴機率 (confidence probabilities) 絕對準確嗎?+

獨立審計顯示 Jev 的輸出機率並未經過嚴格校準。請將它們視為相對的、單調遞增的評分。我們建議對高風險任務進行抽查。

Jev 可以處理圖片或音訊嗎?+

Jev 只能處理最多 80,000 字元的純文字。您必須先將音訊轉錄或從圖片中擷取文字。Kollab 有提供像是 GPT Image 2 與 Grok STT 等其他模型,可用於直接處理多媒體內容。

開始使用 Jev 評估文本。

直接在您的工作區中執行大批量的分類與評分任務。