Jev:不生成文本的 System One 决策模型(TypeSafe AI)

Jev:不生成文本的 System One 决策模型(TypeSafe AI)


RLHF共同发明人新公司首作:不做聊天只做结构化决策,概率校准可信到能写进代码阈值,便宜两个数量级

Jev:一个不说话的模型,可能是今年最重要的发布

9 月 15 日,OpenAI 前研究员、RLHF 共同发明人 Diogo Almeida 带着他的新公司 TypeSafe AI 走出隐身,发布了第一个 "System One Model"——Jev($40M 种子轮,DCVC 领投)。

它的差异化不在于"更聪明",而在于彻底换了个物种:Jev 不生成任何文本。你给它一段上下文和几个类型化的问题(多选一 / 打分 / Yes 概率),它一次性返回所有答案和概率分布。没有聊天,没有流式输出,没有废话——软件拿到结果直接执行。

真正的护城河:校准(Calibration)

普通 LLM 说"我 85% 确定",这话基本不能当真——RLHF 训练出来的模型天生谄媚且过度自信。Jev 用自研的 RLCD(Reinforcement Learning for Calibrated Decisions) 训练,用 Brier score 这类可验证真值的评分规则做奖励,让"85% 把握"在统计上真的对应 85% 正确率。

这才是闭环能力的关键:概率可信,你就可以把阈值直接写进代码——"置信度 >98% 自动执行,<60% 转人工",中间不需要任何人参与判断。分类、路由、内容审核、Agent 的 if-else 分支,全部可以交给它自动闭环。

价格与速度

  • 输入 $0.042 / 百万 token(约 GPT-4o 的 1/60),输出免费
  • 单次调用 70–500ms,比前沿 LLM 快 40–200 倍
  • 64K 上下文,闭源 API(jev-1.13.0),目前 early access waitlist

开源社区 48 小时复现潮

发布几天内,HuggingFace 上已经冒出 48 个开源复现/解析项目,有专门的 tracker 在追踪:multimodalart/jev-reproductions-tracker。

值得关注的几条路线:

  • 并行约束解码(不训练,直接在现成模型上模拟):harshatheg/Qwen-2.5-1B-RLCD(HF♥429)、ekzhang/openjev-sglang(Qwen3.6-35B-A3B + SGLang radix cache,64 个并行决策 <1 秒)
  • 真训了权重的:convaiinnovations/laya(421M,HF♥577 全生态最高)、AlexWortega/openjev(Qwen3.5-4B + MLP 头)、bespokelabs/Bespoke-Nimble-9B(数据+模型+配方全开源,与 Jev 一致率 90.1%)
  • Diffusion LM 路线:DiffusionGemma 并行填充 schema,实测与 Jev API 速度打平,vLLM 已合入 PR

但要清醒:所有开源复现都只是抄到了"接口形状和速度",RLCD 校准训练没人复现出来——多个独立评测发现开源版的置信度不可靠。这恰好说明 Jev 的核心价值不在架构,而在训练方法。

怎么用(三步上手)

  1. 排队:去 typesafe.ai 申请 early access(官方在批量放 key);等 key 期间可以先用网页 Playground 零代码试手感
  2. 拿 key 装 SDK:dashboard 创建 API key,然后 pip install typesafe-sdk,环境变量 TYPESAFE_API_KEY=xxx
  3. 调用:一个 system_one 调用并行回答多个类型化问题,70–500ms 返回全部结果:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()  # 默认 jev-latest
resp = client.system_one(
    state="我的Stripe账户连了3天都失败,正在流失订单,请尽快处理!",
    questions={
        "紧急吗": Noul(instructions="这条消息是否表达紧迫"),
        "分给谁": Choice(instructions="该由哪个团队处理",
                        criteria={"billing": "支付/订阅", "technical": "bug/集成"}),
        "火气": Score(instructions="客户多生气", criteria=["平静", "不满", "暴怒"]),
    },
)
# resp.answers["紧急吗"].noul == 0.999 —— 可以直接写进 if p > 0.98 的阈值逻辑

排队期间的平替:开源项目 ekzhang/openjev-sglang 把 Qwen3.6-35B-A3B 包装成一模一样的 /v1/systemone 接口,流程代码可以先写好,官方 key 下来换个 base_url 就切换。注意开源版的概率没经过校准,别拿它的置信度做阈值判断。

谁该关注

  • 做 Agent 编排的:路由、分类、judge 这类"假装成 if 语句的昂贵 LLM 调用",是它的主战场
  • 跑本地推理的:openjev-sglang 那套在 Qwen3.6-35B-A3B 上就能复刻接口形状(概率别当真)
  • 等开源的:蹲 Archer Hume 承诺的开源权重版,或 Bespoke Nimble 的全开源配方

相关链接:

4200举报0子龙•8天前
被收录:

暂无评论