一家安全公司算过一笔账:同样让一个 72B 的大模型给数据分类,让它把答案"写"出来,每条要花一秒;跳过生成、直接从输出分布里读答案,不到 0.1 秒。中间差出来的 8 到 40 倍成本,没有换来任何信息增量——全花在了"好的,让我想想"这类客套话上。
这基本就是 Jev 的全部出发点。
9 月 15 日,旧金山公司 TypeSafe 带着 4000 万美元种子轮(DCVC 领投)出场,发布第一个模型 Jev。它不会聊天,不会写文章,甚至在物理架构上不具备生成一句话的能力。创始团队来头不小:创始人 Diogo Almeida 是 RLHF 和 InstructGPT 的共同发明人——就是把 ChatGPT 从"复读机"调成"助手"的那套技术的发明人之一。
现在,他做了一个相反方向的产品:让 AI 彻底闭嘴。
一、软件要的不是作家,是化验单
你让大模型当客服,客户说"刚买的耳机有杂音,退钱"。它洋洋洒洒输出一大段 JSON,你的程序再写一堆解析代码,还得祈祷它别在格式上出幺蛾子。
但换个场景想想体检:你在意的是医生跟你说了一小时话,还是那张机器可读的化验单——每项指标一个值、一个参考范围、一个异常标记,系统直接入库?
TypeSafe 给这类模型起了个名字:System One 模型,借的是卡尼曼《思考,快与慢》的框架。他们的判断是:软件里绝大多数决策本来就是 System 1 式的——"这条工单分给谁""这条评论是不是广告""现在该买入还是观望"——快、直觉、选项有限。而我们一直在租 System 2(会推理、会写作文的旗舰大模型)去干 System 1 的活,为冗余的表达力按 token 付钱。
Jev 把表达力整个砍掉:非结构化的程序状态进去,带类型、带概率的决策出来。官方延迟 70 到 500 毫秒,输入每百万 token 0.042 美元,输出免费——因为根本没有"输出 token"这回事。
二、三种题型,把格式幻觉关在门外
Jev 不接受自由提问,只提供三种原生题型:
| 题型 | 干什么 | 输出 |
|---|---|---|
| Choice | 在最多 255 个选项里选一个 | 各选项概率 + 置信度 |
| Score | 按你定义的 2~10 档打分 | 分数 + 概率分布 |
| Noul | 判断命题真伪 | 真伪概率 + 置信度 |
因为答案空间提前被物理框死,类型错误和格式幻觉在数学上就不可能出现——它想编都没地方编。
支撑这套玩法的是两个新东西。一是并行采样器:大模型像打字机逐字蹦(自回归),Jev 像盖章,所有决策维度一次性并行算完。二是训练方法 RLCD(强化学习校准决策):不走 RLHF 那套"取悦人类"的路子,专攻概率校准——说 90% 把握,长期看就真的对 90%。置信度是一等公民,下游代码才敢按置信度自动放权:高于阈值自动执行,低于阈值转人工。
三、48 小时,社区已经把它拆明白了
发布不到两天,GitHub 上冒出一批复现项目。最有意思的是 jevlike:由于 TypeSafe 没公开架构,开发者 vinnylarouge 从模型类型签名反向工程了一套等价实现——把每个选项编码成独立的查询向量,各自对上下文做注意力加权,再用共享点积打分。另一个项目 openjev-sglang 用更野的路子:拿 Qwen3.6-35B-A3B 加 SGLang 前缀缓存模拟同样的接口,64 个决策任务一秒内跑完。
真实世界的早期玩家也已经在晒案例:有人用 Jev 读订单簿做市,模型延迟约 81 毫秒,刚好塞进区块预算;有人给无人机装上它做 2.5Hz 的实时判断。这些项目未必都是 Jev 本尊,但指向同一件事:"快速结构化决策"是一个真实存在、且此前一直被大模型高薪聘任的岗位。
应用侧的想象空间也清楚了:Agent 流水线里那些"该调哪个工具、该不该终止、结果靠不靠谱"的高频小判断,用 Jev 扛,官方口径能把昂贵的大模型调用量压掉 90% 以上;海量批处理——两万条评论打标签约 0.2 美元,一千篇论文分类约 0.08 美元——更是直接把"要不要上 AI"的讨论变成了"上多少"。
四、动手之前,先把这盆冷水收好
第一个要泼的,是那句"不会幻觉"。准确的说法是:它不能编造文本,但它完全可以自信地给出错误答案。选错了选项、打错了分,错误依然发生,只是形式从"编故事"变成了"面不改色的错判"。而校准概率是长期统计性质——说 90% 对 90%,是十万次里的 90%,你手头这一单照样可能翻车。
第二个坑是分布漂移。校准建立在训练分布上,客服话术变了、新类型的工单出现了,概率还是照样输出,但已经不再可信——而它不会报警提醒你"我过期了"。任何想让 Jev 接管关键决策的团队,都得自己建监控:定期抽样对账,拿真实结果反查校准曲线。
第三个是数据问题。官方宣传"快两个数量级",中文圈的转述已经写到了"最高加速 193 倍、便宜 444 倍"——全都是厂商自测。模型处于 early access、闭源商业、没有第三方 benchmark,TypeSafe 用来对比的 LLM 决策基线还是自家的 wrapper,多少有点既当运动员又当裁判。数字可以听,决策先别押上去。
最后一条是天花板:它只能做选择题。255 个选项的上限、2 到 10 档的刻度,意味着一切需要开放生成、需要解释、需要创造的场景,它一概无能为力。如果你的判断本身需要"想清楚再说",省下的钱一分都省不回来。
五、它不会取代大模型,它会住进大模型旁边
把整件事连起来看,一个分层的模型栈正在浮现:大模型负责表达,Jev 这类决策模型负责拍板,代码负责执行。Agent 的每一次工具调用、每一条内容审核、每一笔自动放款背后,都可能站着一个不说话的裁判。
对普通开发者,我的建议很具体:拿你系统里最烦的那个 if-else 开刀——就是那段堆了十几个 else if、每次业务变更都要改、改完还提心吊胆的逻辑——问问自己,它是不是本质上在做一个选择题。如果是,等 Jev 这类模型开放 API 降价普及,它可能就是你给系统装的第一个"化验科"。
省钱这件事,从来不是靠换一个更便宜的作家,而是想清楚哪些环节根本不需要作家。
相关链接:
- TypeSafe 官方公告:https://typesafe.ai/blog/introducing-system-one-models-and-jev
- jevlike(社区复现):https://github.com/vinnylarouge/jevlike
暂无评论。