FAQ
从 X、Discord、HN 汇总的高频问题。
Q. 怎么拿到 Jev 的 access?
目前是邀请制。去 https://typesafe.ai 点 Join Waitlist,填写申请。**重点**:写清楚你打算用 Jev 做什么(具体场景,不是'研究 AI')。X 上反馈普遍几十分钟到 1 天过审。 **替代路径**:不想等的话,OpenRouter 已经上线 `typesafe/jev`,直接用 OpenRouter 的 key 调用。
Q. Jev 能做什么?不能做什么?
**能做**:分类、路由、评分、抽取、rerank、guardrail、verifier、实时 UI 决策、PB 级数据分析。 **不能做**:生成文本/代码、精确计数/日期算术、多模态(图片/音频/视频)、长链推理、多轮对话管理。 详见 [Jev jaggedness 报告](/docs/jev-1-13-jaggedness) 和 [决策树](/tutorials/09-decision-tree)。
Q. Jev 多少钱?
**输入 $0.042 / 百万 token**(每十亿 $42),**输出免费**(官方称'too cheap to meter')。端到端延迟 70–500 ms。 相比 GPT-5.6 Terra ~$2/MTok 输入 + 输出,典型工作负载便宜 40–400 倍。详见 [官方工作流评测](https://evals.typesafe.ai)。 创始人 Diogo Almeida 在 X 上明确说'**不会涨价**'。
Q. Jev 会取代 GPT-5 / Claude 吗?
**不会**。Jev 是补充,不是替代。 - LLM 擅长:生成文本、写代码、推理、解释 - Jev 擅长:分类、路由、评分、guardrail、verifier 合理用法是两者并存——**LLM 想,Jev 判**。代码掌控控制流,LLM 处理开放式任务,Jev 处理封闭式决策。
Q. Jev 的 confidence 真的可信吗?
**在群体层面是的**。Jev 经过 RLCD 训练,它的 confidence 是**校准的**——说 0.8 confidence 的题长期看 80% 是对的。 但**单条不保证**。说 0.95 confidence 的某一条,这次可能恰好错。 实操建议: 1. 用 confidence 阈值做门控(参考 [Confidence 计算器](/tools/confidence-calculator)) 2. 在自己的样本上跑校准曲线 3. 关键场景做 A/B 对照
Q. Jev 支持图片/音频/视频吗?
**目前不支持**。Jev 1.13 只吃文本(string / JSON object / array of text)。 要做多模态: 1. 用其他模型做 OCR / 语音转文字 2. 把转出来的文本给 Jev 3. Jev 做判断 官方说多模态在路线图上,但没有具体时间表。
Q. Jev 是开源的吗?能自己部署吗?
**Jev 模型本身不开源**,只能通过 TypeSafe 控制台、API 或 OpenRouter 调用。 但: - **SDK 开源**:`typesafe-sdk` Python / JavaScript - **Agent skill 开源**:`typesafe-ai/skills` - **文档和 Cookbook 完全公开** Jev 是闭源的前沿模型,跟 GPT-5、Claude 一样。
Q. Jev 的上下文窗口多大?
**总 64K token,但更严格的限制**:state + 最长单 question 合计 ≤ **~32K token**(约 150,000 字符)。 很多人先撞到这个限制,才发现。详见 [Cheatsheet](/tools/cheatsheet#limits)。
Q. Jev 真的不能计数吗?
**不能**。无论是字符数、关键词出现次数,还是 list 里的项目数。 **怎么办**:在代码里算,然后把数字作为 state 的一部分传给 Jev。Jev 拿到的应该是**预计算的事实**,不是原始数据。 ```python state = { "items": items, "precomputed_count": len(items), # ← 在代码里算 } question = Noul(f"Given there are {len(items)} items, is this a large list?") ```
Q. Jev 的中文能力怎么样?
**能用,但不如英文稳**。官方 jaggedness 报告明确说 Jev 的主要训练语言是英文,其他语言(包括 CJK)准确率较低。 实操建议: 1. **拿真实样本盲测**——不要直接相信英文 demo 的准确率 2. 中文 prompt 可以写,但 criteria 要写得更具体 3. 重要决策做 A/B 对照,准备比英文更保守的 confidence 阈值
没找到答案?去 Discord 问 或 联系我们。