# Jev:不生成文本的 System One 决策模型(TypeSafe AI) > RLHF共同发明人新公司首作:不做聊天只做结构化决策,概率校准可信到能写进代码阈值,便宜两个数量级 # Jev:一个不说话的模型,可能是今年最重要的发布 9 月 15 日,OpenAI 前研究员、RLHF 共同发明人 Diogo Almeida 带着他的新公司 TypeSafe AI 走出隐身,发布了第一个 "System One Model"——**Jev**($40M 种子轮,DCVC 领投)。 它的差异化不在于"更聪明",而在于彻底换了个物种:**Jev 不生成任何文本**。你给它一段上下文和几个类型化的问题(多选一 / 打分 / Yes 概率),它一次性返回所有答案和概率分布。没有聊天,没有流式输出,没有废话——软件拿到结果直接执行。 ## 真正的护城河:校准(Calibration) 普通 LLM 说"我 85% 确定",这话基本不能当真——RLHF 训练出来的模型天生谄媚且过度自信。Jev 用自研的 **RLCD(Reinforcement Learning for Calibrated Decisions)** 训练,用 Brier score 这类可验证真值的评分规则做奖励,让"85% 把握"在统计上真的对应 85% 正确率。 **这才是闭环能力的关键**:概率可信,你就可以把阈值直接写进代码——"置信度 >98% 自动执行,<60% 转人工",中间不需要任何人参与判断。分类、路由、内容审核、Agent 的 if-else 分支,全部可以交给它自动闭环。 ## 价格与速度 - 输入 **$0.042 / 百万 token**(约 GPT-4o 的 1/60),**输出免费** - 单次调用 **70–500ms**,比前沿 LLM 快 40–200 倍 - 64K 上下文,闭源 API(`jev-1.13.0`),目前 early access waitlist ## 开源社区 48 小时复现潮 发布几天内,HuggingFace 上已经冒出 48 个开源复现/解析项目,有专门的 tracker 在追踪:[multimodalart/jev-reproductions-tracker](https://huggingface.co/spaces/multimodalart/jev-reproductions-tracker)。 值得关注的几条路线: - **并行约束解码**(不训练,直接在现成模型上模拟):`harshatheg/Qwen-2.5-1B-RLCD`(HF♥429)、`ekzhang/openjev-sglang`(Qwen3.6-35B-A3B + SGLang radix cache,64 个并行决策 <1 秒) - **真训了权重的**:`convaiinnovations/laya`(421M,HF♥577 全生态最高)、`AlexWortega/openjev`(Qwen3.5-4B + MLP 头)、`bespokelabs/Bespoke-Nimble-9B`(数据+模型+配方全开源,与 Jev 一致率 90.1%) - **Diffusion LM 路线**:DiffusionGemma 并行填充 schema,实测与 Jev API 速度打平,vLLM 已合入 PR 但要清醒:**所有开源复现都只是抄到了"接口形状和速度",RLCD 校准训练没人复现出来**——多个独立评测发现开源版的置信度不可靠。这恰好说明 Jev 的核心价值不在架构,而在训练方法。 ## 怎么用(三步上手) 1. **排队**:去 [typesafe.ai](https://typesafe.ai) 申请 early access(官方在批量放 key);等 key 期间可以先用网页 Playground 零代码试手感 2. **拿 key 装 SDK**:dashboard 创建 API key,然后 `pip install typesafe-sdk`,环境变量 `TYPESAFE_API_KEY=xxx` 3. **调用**:一个 `system_one` 调用并行回答多个类型化问题,70–500ms 返回全部结果: ```python from typesafe_sdk import Choice, Noul, Score, TypeSafeClient client = TypeSafeClient() # 默认 jev-latest resp = client.system_one( state="我的Stripe账户连了3天都失败,正在流失订单,请尽快处理!", questions={ "紧急吗": Noul(instructions="这条消息是否表达紧迫"), "分给谁": Choice(instructions="该由哪个团队处理", criteria={"billing": "支付/订阅", "technical": "bug/集成"}), "火气": Score(instructions="客户多生气", criteria=["平静", "不满", "暴怒"]), }, ) # resp.answers["紧急吗"].noul == 0.999 —— 可以直接写进 if p > 0.98 的阈值逻辑 ``` **排队期间的平替**:开源项目 `ekzhang/openjev-sglang` 把 Qwen3.6-35B-A3B 包装成一模一样的 `/v1/systemone` 接口,流程代码可以先写好,官方 key 下来换个 base_url 就切换。注意开源版的概率没经过校准,别拿它的置信度做阈值判断。 ## 谁该关注 - 做 Agent 编排的:路由、分类、judge 这类"假装成 if 语句的昂贵 LLM 调用",是它的主战场 - 跑本地推理的:openjev-sglang 那套在 Qwen3.6-35B-A3B 上就能复刻接口形状(概率别当真) - 等开源的:蹲 Archer Hume 承诺的开源权重版,或 Bespoke Nimble 的全开源配方 **相关链接:** - 官方博客(发布公告):https://typesafe.ai/blog/introducing-system-one-models-and-jev - 复现追踪器:https://huggingface.co/spaces/multimodalart/jev-reproductions-tracker --- **分类**:随笔 **标签**:开源 · 模型 · Jev **作者**:子龙 **链接**:https://octohz.com/p/2157