J
← 所有教程 · · Kiang

04 · 为什么它这么快、这么便宜?

训练目标不同、推理方式不同、不会幻觉、输出免费——四件事拆开讲。

入门训练RLCD性能

这一章回答一个具体问题:Jev 的 70ms 延迟和 $0.042/MTok 输入价是怎么做到的?

答案分四层:训练目标、推理方式、输出 schema、价格模型。

4.1 训练目标不同

Jev 不是从零开始训的——它脱胎于”对决策友好的预训练模型”,但训练目标完全不同:

大模型(RLHF / RLVR)Jev(RLCD)
优化什么“让生成的下一个 token 像人话”“让输出的概率分布能反映真实不确定性”
奖励信号人类偏好 / 可验证题目真实结果的校准误差
长期效果会说话、会推理报 confidence 时是校准的

Jev 的训练目标叫做 RLCD——Reinforcement Learning for Calibrated Decisions。训练时它被反复”惩罚”:

它说 0.9 概率时,如果实际只有 0.7 是对的,就被扣分。

这就是为什么它的 confidence 是校准的(calibrated):

当它说”我有 80% 把握”的时候,长期看,这类判断确实有 80% 是对的。

这件事听起来不起眼,但在工程上意义重大——你可以真的拿 confidence 当阈值

RLHF vs RLCD:一张对比图

RLHF(大模型)

   │  训练时:
   │  "你好/谢谢/很高兴认识你" → 人类打分 → 调高这类 token 的概率

   │  后果:
   │  - 客套话变多
   │  - 听起来很自信
   │  - 容易讨好用户


RLCD(Jev)

   │  训练时:
   │  "退款概率 0.7" → 实际是否退款 → 校准误差 → 调高/低这个数字

   │  后果:
   │  - 不客套
   │  - 0.7 就是 0.7
   │  - 概率是有意义的

4.2 推理方式不同

大模型是自回归的——它一个字一个字生成。你看到 3 秒延迟,主要时间花在”生成 500 个 token”上。

Jev 是并行采样器——它一次性算出所有选项的概率。一次前向传播,搞定。

自回归 LLMJev(并行采样)
单次推理时间与输出长度成正比与问题复杂度成正比,几乎与”答案数”无关
适合”生成长文本”❌(根本不长文本)
适合”做选择”又慢又贵✅ 极致便宜

直观比喻:

  • LLM 像一个一个字写邮件的人(发邮件耗时 = 字数 × 写字速度)
  • Jev 像一份同时算出所有选项概率的雷达(耗时 = 雷达扫描时间,跟选项数量几乎无关)

4.3 不会幻觉

因为它的输出被schema 强制约束——你让它在 5 个选项里选,它只能输出这 5 个字符串里的一个。它没有”自由发挥”的空间。

这不是营销话术——它是数学上不可能输出一个不在你列表里的值。

但要注意一点(官方自己说的):“不会给出选项之外的答案”不等于”不会选错”。如果你给的 5 个选项都不对,模型仍然会”自信地”选一个最接近的。这就是为什么 confidence 这么重要——当模型不确定的时候,confidence 会低

4.4 价格模型

官方公布的价格:

项目价格
输入$0.042 / 百万 token(42 美元每十亿 token)
输出免费(官方称为”too cheap to meter”)
端到端延迟70 – 500 毫秒

横向对比:

模型输入价格(每百万 token)延迟
GPT-5.6 Terra~$25–20 秒
Claude Sonnet 4.6~$33–15 秒
DeepSeek V3~$0.303–10 秒
Jev$0.04270–500 毫秒

实际工作负载里,Jev 相对前沿模型普遍做到 20–200 倍快、40–400 倍便宜(官方在 workflow evals 上自报)。

为什么”输出免费”是结构性的

不是营销话术——Jev 根本不生成 token。它的输出是一个固定的 JSON 结构,描述选项的概率分布。这个 JSON 是直接从模型的最后一层 logits 算出来的,没有”生成”过程。

所以 output_tokens = 0,没有输出成本这个概念

这就是为什么批量调用 Jev 的成本几乎只跟”输入 token 数”成正比——13 道题一次调用 vs 13 次单题调用,输入 token 数一样,但后者的 HTTP 开销多 12 倍

下一步

第 05 章:它不擅长什么 →