J
← 所有教程 · · Kiang

01 · 为什么你应该关心 Jev

通用大模型已经够聪明,但软件里的'小判断'仍然太慢、太贵、不可靠。Jev 是对这个问题的具体回答。

入门动机背景

过去两年,几乎每一家做大模型的公司都在告诉你:模型越来越聪明了

GPT-5、Claude Sonnet 4.x、Gemini、DeepSeek——它们的对话质量确实在以肉眼可见的速度提升。但有一个反直觉的事实:

绝大多数企业级软件里的”AI”,并不是真的更智能了;它们只是把同一个通用大模型接到了更多”if 分支”上。

判断”这封邮件要不要立刻回”,用 GPT-5 跑一次:3 秒、$0.02。 判断”这个工具调用是否危险”,再跑一次:3 秒、$0.02。 判断”这条 RAG 召回的内容是否相关”,再跑一次:3 秒、$0.02。

一个稍微复杂一点的 agent,一个回合下来要调大模型几十次。结果是:功能是搭起来了,但延迟、账单、错误率全都不让人放心

Jev 是 TypeSafe AI 在 2026 年 9 月扔出来的一颗炸弹。它的目标不是”再做一款更聪明的聊天模型”,而是专门把上面这种”小判断”做对、做大、做到便宜到可以无限复制

读完这一系列教程你会看到:

  • 它和 ChatGPT 根本不是一类东西
  • 它能做到什么、做不到什么(官方自己说的)
  • 怎么把它接到你自己的代码里
  • 真实的”杀手级”用例长什么样
  • 怎么判断它值不值得放进你的项目

一个具体的小例子

假设你在做一个客服工单系统。需求是:进来的邮件要决定送给哪个团队

最直觉的做法是:把邮件内容塞进 prompt,让 GPT-5 输出”billing / technical / account”。

你是一个客服分诊助手。请阅读以下邮件,判断它属于哪个团队:

{邮件内容}

请只输出一个词: billing / technical / account

看起来很合理。但你跑一段时间就会发现:

痛点表现
每次 2–5 秒。一个工单一天可能被分诊好几次,延迟肉眼可见
$0.20–$10 / 百万 token 输入,输出还是输入的 5 倍价
不可靠偶尔会输出”当然是 billing 啦~“之类的客套话,你得写正则去抠
不诚实即使 prompt 里说”输出 confidence”,它给的数字也没有校准——它说 0.9 的时候,实际准确率可能只有 0.7
会出错偶尔会输出第四个选项、不存在的团队名,或一段完全无关的话——幻觉

如果一个判断这么简单、这么高频、这么便宜的事,都让一个 700B 参数的对话模型来做,那它就属于杀鸡用牛刀。

大模型的训练目标 ≠ 你的需求

这一点很关键,但很少有人讲透。

大模型今天被两种”训练套路”塑造成形:

  • RLHF——拿人类偏好当奖励信号,目标是”让人看着舒服”
  • RLVR——拿可验证的题目(数学证明、代码跑通)当奖励信号,目标是”在 benchmark 上拿高分”

这两种训练出来的模型,都有一个共同特征:它在”说话”,而不是”判断”

但你的工单分诊系统不需要一个会”说话”的助手。你需要的是:

给定一份邮件,返回一个枚举值 + 一个我能信的 confidence。

这就是 Jev 要解决的问题。

本系列路线图

  1. 为什么你应该关心 Jev(本文)
  2. Jev 是什么——三句话讲清楚
  3. 三种题型精讲——Choice / Score / Noul
  4. 为什么它这么快、这么便宜?
  5. 它不擅长什么?(官方自己说的)
  6. 从 0 到跑通——申请 + API + SDK
  7. 四个杀手级应用
  8. 常见误区
  9. 决策树:什么时候该用 Jev?

读完之后,你应该能:(1) 跟别人讲清楚 Jev 是什么、不是什么;(2) 拿到 waitlist 之后 30 分钟内跑通第一个调用;(3) 判断它值不值得放进你的项目。