04 · 为什么它这么快、这么便宜?
训练目标不同、推理方式不同、不会幻觉、输出免费——四件事拆开讲。
这一章回答一个具体问题:Jev 的 70ms 延迟和 $0.042/MTok 输入价是怎么做到的?
答案分四层:训练目标、推理方式、输出 schema、价格模型。
4.1 训练目标不同
Jev 不是从零开始训的——它脱胎于”对决策友好的预训练模型”,但训练目标完全不同:
| 大模型(RLHF / RLVR) | Jev(RLCD) | |
|---|---|---|
| 优化什么 | “让生成的下一个 token 像人话” | “让输出的概率分布能反映真实不确定性” |
| 奖励信号 | 人类偏好 / 可验证题目 | 真实结果的校准误差 |
| 长期效果 | 会说话、会推理 | 报 confidence 时是校准的 |
Jev 的训练目标叫做 RLCD——Reinforcement Learning for Calibrated Decisions。训练时它被反复”惩罚”:
它说 0.9 概率时,如果实际只有 0.7 是对的,就被扣分。
这就是为什么它的 confidence 是校准的(calibrated):
当它说”我有 80% 把握”的时候,长期看,这类判断确实有 80% 是对的。
这件事听起来不起眼,但在工程上意义重大——你可以真的拿 confidence 当阈值。
RLHF vs RLCD:一张对比图
RLHF(大模型)
│
│ 训练时:
│ "你好/谢谢/很高兴认识你" → 人类打分 → 调高这类 token 的概率
│
│ 后果:
│ - 客套话变多
│ - 听起来很自信
│ - 容易讨好用户
│
▼
RLCD(Jev)
│
│ 训练时:
│ "退款概率 0.7" → 实际是否退款 → 校准误差 → 调高/低这个数字
│
│ 后果:
│ - 不客套
│ - 0.7 就是 0.7
│ - 概率是有意义的
│
▼
4.2 推理方式不同
大模型是自回归的——它一个字一个字生成。你看到 3 秒延迟,主要时间花在”生成 500 个 token”上。
Jev 是并行采样器——它一次性算出所有选项的概率。一次前向传播,搞定。
| 自回归 LLM | Jev(并行采样) | |
|---|---|---|
| 单次推理时间 | 与输出长度成正比 | 与问题复杂度成正比,几乎与”答案数”无关 |
| 适合”生成长文本” | ✅ | ❌(根本不长文本) |
| 适合”做选择” | 又慢又贵 | ✅ 极致便宜 |
直观比喻:
- LLM 像一个一个字写邮件的人(发邮件耗时 = 字数 × 写字速度)
- Jev 像一份同时算出所有选项概率的雷达(耗时 = 雷达扫描时间,跟选项数量几乎无关)
4.3 不会幻觉
因为它的输出被schema 强制约束——你让它在 5 个选项里选,它只能输出这 5 个字符串里的一个。它没有”自由发挥”的空间。
这不是营销话术——它是数学上不可能输出一个不在你列表里的值。
但要注意一点(官方自己说的):“不会给出选项之外的答案”不等于”不会选错”。如果你给的 5 个选项都不对,模型仍然会”自信地”选一个最接近的。这就是为什么 confidence 这么重要——当模型不确定的时候,confidence 会低。
4.4 价格模型
官方公布的价格:
| 项目 | 价格 |
|---|---|
| 输入 | $0.042 / 百万 token(42 美元每十亿 token) |
| 输出 | 免费(官方称为”too cheap to meter”) |
| 端到端延迟 | 70 – 500 毫秒 |
横向对比:
| 模型 | 输入价格(每百万 token) | 延迟 |
|---|---|---|
| GPT-5.6 Terra | ~$2 | 5–20 秒 |
| Claude Sonnet 4.6 | ~$3 | 3–15 秒 |
| DeepSeek V3 | ~$0.30 | 3–10 秒 |
| Jev | $0.042 | 70–500 毫秒 |
实际工作负载里,Jev 相对前沿模型普遍做到 20–200 倍快、40–400 倍便宜(官方在 workflow evals 上自报)。
为什么”输出免费”是结构性的
不是营销话术——Jev 根本不生成 token。它的输出是一个固定的 JSON 结构,描述选项的概率分布。这个 JSON 是直接从模型的最后一层 logits 算出来的,没有”生成”过程。
所以 output_tokens = 0,没有输出成本这个概念。
这就是为什么批量调用 Jev 的成本几乎只跟”输入 token 数”成正比——13 道题一次调用 vs 13 次单题调用,输入 token 数一样,但后者的 HTTP 开销多 12 倍。