J

术语表

点击跳转。

  • Calibration

    概率与实际频率的匹配。说 0.8 confidence 的判断,长期看应该约 80% 是对的。Jev 的概率是校准的,LLM 的不是。

    别名:校准

  • Choice

    Jev 的原语之一。从一个列表(≤255 选项)里选一个,返回 choice + 每项概率 + confidence。

  • Composite Scoring

    把复杂判断拆成多个 Score question,在代码里加权组合。Jev 给出每维度评分,代码决定权重。

    别名:复合打分

  • Confidence

    Choice/Score 答案的'集中度'。Choice 中 confidence = max(probabilities),Score 类似。对 Noul 不适用。

  • Confidence-Gated Routing

    用 confidence 当第二决策轴的模式。confidence < LOW 转人工,中段复核,高段自动执行。阈值随风险动态调整。

    别名:confidence 门控

  • Hallucination

    模型生成不存在的内容。Jev 在 schema 强制下不可能产生(因为输出被严格约束),但'选错'仍然可能——这两件事不要混。

    别名:幻觉

  • Intent Routing

    用 Jev 分类用户意图,然后路由到不同处理器(确定性逻辑 / 专精 LLM / 人工)。

    别名:意图路由

  • Jaggedness

    AI 模型的'擅长 vs 不擅长'的非线性边界。TypeSafe 用此词描述 Jev 的短板,如'字面理解、不算术、不生成'。详见 [Jev 1.13 jaggedness](/docs/jev-1-13-jaggedness)。

    别名:参差不齐

  • Jevons Paradox

    1865 年的经济学原理:资源利用效率提高时,总消耗不降反升(因为便宜了用量爆炸)。TypeSafe 借此为模型取名'Jev',赌智能成本下降会解锁更多用例。

    别名:杰文斯悖论

  • Noul

    Jev 的原语之一。是/否问题,返回 0–1 的概率(是的概率)。不带 confidence——noul 本身就是答案。

    别名:Boolean, 是/否

  • RLCD

    Jev 的训练目标。优化目标是'让输出的概率分布能反映真实不确定性'。对比 RLHF(优化人类偏好)和 RLVR(优化可验证奖励)。

    别名:Reinforcement Learning for Calibrated Decisions, 校准决策强化学习

  • RLHF

    大模型主流训练范式。用人类偏好作为奖励信号,目标是'让人看着舒服'。ChatGPT/InstructGPT 用此训练。

    别名:Reinforcement Learning from Human Feedback, 人类反馈强化学习

  • RLVR

    推理模型(Reasoning Models)的训练范式。用可验证的题目(数学证明、代码跑通)作奖励信号。

    别名:Reinforcement Learning from Verifiable Rewards, 可验证奖励强化学习

  • Score

    Jev 的原语之一。在有序刻度(2–10 级)上打分,返回 score(可落在级别之间)+ 每级概率 + confidence。

  • Speculative Fan-Out

    一次发一堆 question(含试探性的)给 Jev,在代码里挑有用的。Jev 并行评估,加 question 几乎不增加延迟。

    别名:扇出

  • State

    传给 Jev 的输入材料。可以是 string、JSON object 或 array。所有 questions 共享同一个 state,独立评估。

  • System One Model

    为软件做快速结构化决策的 AI 模型类别。Jev 是第一款。借自 Kahneman《思考,快与慢》的 System 1(快速直觉)概念。

    别名:System One, System 1 Model

  • System Two Model

    慢速、需要推理的 AI 模型。当前的所有聊天大模型(GPT-5、Claude 等)基本都属于这一类。对比 System One。

    别名:System 2, reasoning model

  • Workflow Eval

    TypeSafe 自建的评测范式。不是判断单一答案对错,而是测试'AI 在一段程序/workflow 里工作得好不好'。用最强外部模型的平均输出作参考概率。

    别名:工作流评估