01 · 为什么你应该关心 Jev
通用大模型已经够聪明,但软件里的'小判断'仍然太慢、太贵、不可靠。Jev 是对这个问题的具体回答。
过去两年,几乎每一家做大模型的公司都在告诉你:模型越来越聪明了。
GPT-5、Claude Sonnet 4.x、Gemini、DeepSeek——它们的对话质量确实在以肉眼可见的速度提升。但有一个反直觉的事实:
绝大多数企业级软件里的”AI”,并不是真的更智能了;它们只是把同一个通用大模型接到了更多”if 分支”上。
判断”这封邮件要不要立刻回”,用 GPT-5 跑一次:3 秒、$0.02。 判断”这个工具调用是否危险”,再跑一次:3 秒、$0.02。 判断”这条 RAG 召回的内容是否相关”,再跑一次:3 秒、$0.02。
一个稍微复杂一点的 agent,一个回合下来要调大模型几十次。结果是:功能是搭起来了,但延迟、账单、错误率全都不让人放心。
Jev 是 TypeSafe AI 在 2026 年 9 月扔出来的一颗炸弹。它的目标不是”再做一款更聪明的聊天模型”,而是专门把上面这种”小判断”做对、做大、做到便宜到可以无限复制。
读完这一系列教程你会看到:
- 它和 ChatGPT 根本不是一类东西
- 它能做到什么、做不到什么(官方自己说的)
- 怎么把它接到你自己的代码里
- 真实的”杀手级”用例长什么样
- 怎么判断它值不值得放进你的项目
一个具体的小例子
假设你在做一个客服工单系统。需求是:进来的邮件要决定送给哪个团队。
最直觉的做法是:把邮件内容塞进 prompt,让 GPT-5 输出”billing / technical / account”。
你是一个客服分诊助手。请阅读以下邮件,判断它属于哪个团队:
{邮件内容}
请只输出一个词: billing / technical / account
看起来很合理。但你跑一段时间就会发现:
| 痛点 | 表现 |
|---|---|
| 慢 | 每次 2–5 秒。一个工单一天可能被分诊好几次,延迟肉眼可见 |
| 贵 | $0.20–$10 / 百万 token 输入,输出还是输入的 5 倍价 |
| 不可靠 | 偶尔会输出”当然是 billing 啦~“之类的客套话,你得写正则去抠 |
| 不诚实 | 即使 prompt 里说”输出 confidence”,它给的数字也没有校准——它说 0.9 的时候,实际准确率可能只有 0.7 |
| 会出错 | 偶尔会输出第四个选项、不存在的团队名,或一段完全无关的话——幻觉 |
如果一个判断这么简单、这么高频、这么便宜的事,都让一个 700B 参数的对话模型来做,那它就属于杀鸡用牛刀。
大模型的训练目标 ≠ 你的需求
这一点很关键,但很少有人讲透。
大模型今天被两种”训练套路”塑造成形:
- RLHF——拿人类偏好当奖励信号,目标是”让人看着舒服”
- RLVR——拿可验证的题目(数学证明、代码跑通)当奖励信号,目标是”在 benchmark 上拿高分”
这两种训练出来的模型,都有一个共同特征:它在”说话”,而不是”判断”。
但你的工单分诊系统不需要一个会”说话”的助手。你需要的是:
给定一份邮件,返回一个枚举值 + 一个我能信的 confidence。
这就是 Jev 要解决的问题。
本系列路线图
- 为什么你应该关心 Jev(本文)
- Jev 是什么——三句话讲清楚
- 三种题型精讲——Choice / Score / Noul
- 为什么它这么快、这么便宜?
- 它不擅长什么?(官方自己说的)
- 从 0 到跑通——申请 + API + SDK
- 四个杀手级应用
- 常见误区
- 决策树:什么时候该用 Jev?
读完之后,你应该能:(1) 跟别人讲清楚 Jev 是什么、不是什么;(2) 拿到 waitlist 之后 30 分钟内跑通第一个调用;(3) 判断它值不值得放进你的项目。