J

Cookbook 实战

官方文档里收录的 20+ 个真实业务场景。点击查看完整代码、prompt、和评测数据。

难度:
题型:
高阶 function-callingagent

Function Calling · 自然语言转 typed function call

把'画 NVDA 和 SPY 的滚动相关性图'这种自然语言请求,转成 10 个 typed function 的精确调用,每个参数都带 confidence。

查看详情 →
进阶 formattingparsing

Structure Recovery · 从纯文本重建 Markdown

两阶段:第一阶段缝合被硬换行破坏的段落,第二阶段用 Jev 给每个块分类(标题/列表/代码/引用)。

查看详情 →
高阶 feature-engineeringautoml

Autoresearch · 自动发现数值特征

让 Jev 提议特征 → 转成数值 → 用模型错误训练监督学习(CatBoost)。AutoML 思路用在 feature engineering。

查看详情 →
进阶 self-consistency审核

Self-consistency · Choice 标签一致性

Choice 决策的稳定性测试:同一问题多次跑,看 confidence 是否一致。比较自动动作 vs 人工复核的占比。

查看详情 →
入门 RAGverification

Citation Check · 抓出幻觉引用

用一道 Choice 题判断'引用的上下文是否支持这个声明',把幻觉引用抓出来送人工复核。

查看详情 →
进阶 self-consistency审核

Self-consistency · Noul 不确定时转人工复核

为不确定的 Noul 答案自动路由到人工审核,同时保留模型返回的概率值供业务参考。

查看详情 →
入门 extraction日期

Date Extraction · 拆年月日给 Choice

把日期文本按'年、月、日'拆成三个 Choice 问题,在代码里组装成 Date 对象。这样避开 Jev 不擅长日期算术的短板。

查看详情 →
高阶 entity-linkingdedup

Entity Alignment · 两份产品目录对齐

判断两个啤酒目录里哪些产品是同一个:从 450 对候选里决定每对是否合并、保留、还是人工审核。一道 Score 题搞定。

查看详情 →
进阶 classificationhierarchical

Classification with Confidence · 75 个行业自动分级

把 SEC 年报分到 75 个行业组。一道 Choice,根据 confidence 自动选:返回细分行业还是上一级大类。

查看详情 →
进阶 RAG过滤

Classifying RAG Passages · 召回质量过滤

对每条召回的 passage 打分,然后在代码里决定哪些送到 answering 模型:保留并标记矛盾的、丢掉带隐藏指令的、标记包含 PII 的。

查看详情 →
高阶 classificationhierarchical

Hierarchical Classification · 深度分类树

通过并行 beam search 在 TypeSafe Choice 概率上做层级分类——专利、零售、生物医学、源代码 4 个层级。

查看详情 →
入门 extractionregex

Pre-parsed Extraction · regex 先粗筛,Jev 选 span

用 regex 先找出候选邮箱/电话/数字的位置,再用 Jev 在候选里挑出真正要的 span。在代码里规范化为最终值。

查看详情 →
进阶 searchsemantic

Line-by-line Search · 文档级语义 grep

对文档每行(或每段)用 Choice/Score 打分。218 行 1 次调用搞定。找相关行用 Noul 再确认文档是否包含答案。

查看详情 →
进阶 RAGrerank

Re-ranking · BM25 候选集的精确重排

为 40 个 CLERC 法律查询的 30 段 BM25 短名单,用一道 Jev 题把 top-1 准确率从 5% 提到 18%,top-10 从 38% 提到 62%。

查看详情 →
高阶 knowledge-graphentity-linking

Knowledge Graph Entity Alignment · 实体对齐

知识图谱里的实体对齐:不同数据源描述的是不是同一个实体?用 Jev Choice 在 N 个候选里挑出最匹配的。

查看详情 →
入门 performancebatch

Parallel Questions · 13 题一次调用

用一个 TypeSafe 调用跑 13 个问题,展示批量调用比 13 次单独调用便宜 12.2 倍、快 10 倍。

查看详情 →
进阶 guardrailsafety

Guardrails for LLMs · 出入双向守门

对每条进出 LLM 的消息都过 TypeSafe 的守门,描述可能危害并评分严重度,根据概率决定放行/复核/拦截/路由。

查看详情 →
进阶 searchsemantic

Semantic Find · GitHub ToS 语义搜索

在 GitHub Terms of Service 上按自然语言查询搜索,一行代码对 218 个候选段落打分,选出真正相关的。

查看详情 →
高阶 cascadecost-optimization

SDE Cascade · 用 mini 模型拿 reasoning 模型 90% 的质量

mini 模型跑一遍结构化抽取 → 验证关键字段 → 不确定时才升级到 reasoning 模型。省 10× 成本,保留大部分质量。

查看详情 →
高阶 agentskill-routing

Skill Suggestion · 给 Agent 推荐下一个 skill

从 182 个 Hermes skills 里给 agent 的下一步动作选一个 skill。第一道 Choice 排前几名,第二道 Noul 二次确认是否需要 skill。

查看详情 →