支持教程 / Cookbook / 文档 / 术语 / FAQ / 文章全文搜索
官方文档里收录的 20+ 个真实业务场景。点击查看完整代码、prompt、和评测数据。
把'画 NVDA 和 SPY 的滚动相关性图'这种自然语言请求,转成 10 个 typed function 的精确调用,每个参数都带 confidence。
两阶段:第一阶段缝合被硬换行破坏的段落,第二阶段用 Jev 给每个块分类(标题/列表/代码/引用)。
让 Jev 提议特征 → 转成数值 → 用模型错误训练监督学习(CatBoost)。AutoML 思路用在 feature engineering。
Choice 决策的稳定性测试:同一问题多次跑,看 confidence 是否一致。比较自动动作 vs 人工复核的占比。
用一道 Choice 题判断'引用的上下文是否支持这个声明',把幻觉引用抓出来送人工复核。
为不确定的 Noul 答案自动路由到人工审核,同时保留模型返回的概率值供业务参考。
把日期文本按'年、月、日'拆成三个 Choice 问题,在代码里组装成 Date 对象。这样避开 Jev 不擅长日期算术的短板。
判断两个啤酒目录里哪些产品是同一个:从 450 对候选里决定每对是否合并、保留、还是人工审核。一道 Score 题搞定。
把 SEC 年报分到 75 个行业组。一道 Choice,根据 confidence 自动选:返回细分行业还是上一级大类。
对每条召回的 passage 打分,然后在代码里决定哪些送到 answering 模型:保留并标记矛盾的、丢掉带隐藏指令的、标记包含 PII 的。
通过并行 beam search 在 TypeSafe Choice 概率上做层级分类——专利、零售、生物医学、源代码 4 个层级。
用 regex 先找出候选邮箱/电话/数字的位置,再用 Jev 在候选里挑出真正要的 span。在代码里规范化为最终值。
对文档每行(或每段)用 Choice/Score 打分。218 行 1 次调用搞定。找相关行用 Noul 再确认文档是否包含答案。
为 40 个 CLERC 法律查询的 30 段 BM25 短名单,用一道 Jev 题把 top-1 准确率从 5% 提到 18%,top-10 从 38% 提到 62%。
知识图谱里的实体对齐:不同数据源描述的是不是同一个实体?用 Jev Choice 在 N 个候选里挑出最匹配的。
用一个 TypeSafe 调用跑 13 个问题,展示批量调用比 13 次单独调用便宜 12.2 倍、快 10 倍。
对每条进出 LLM 的消息都过 TypeSafe 的守门,描述可能危害并评分严重度,根据概率决定放行/复核/拦截/路由。
在 GitHub Terms of Service 上按自然语言查询搜索,一行代码对 218 个候选段落打分,选出真正相关的。
mini 模型跑一遍结构化抽取 → 验证关键字段 → 不确定时才升级到 reasoning 模型。省 10× 成本,保留大部分质量。
从 182 个 Hermes skills 里给 agent 的下一步动作选一个 skill。第一道 Choice 排前几名,第二道 Noul 二次确认是否需要 skill。