零点六 B 的模型在抢大模型的活:评分头卷出新高度
9 月 15 日,TypeSafe AI 发布了 Jev:一个不会写字的模型,只回选择题、判断题和打分题。Vercel、Cloudflare 三天内接了进去,一天一万三千次判断,账单三毛五。
四十八小时后,开源圈给 Jev 找了平替;八天后,平替自己也被平替了。
9 月 21 日开源的 AgentJev-0.6B,跑的是同一条赛道:不生成一个字,一次前向直接吐概率分布,解码 token 数为零。在 typed-decisions 基准的 2000 道题上答对 1585 道(79.25%),比 Laya 已发布权重多对 45 道——而 Laya 是 Jev 目前最被认可的开源平替。更扎心的是训练数据:AgentJev 少用两成,成绩反超。
它只是把 Qwen3-0.6B 的"嘴"拔了
AgentJev 的主干是 Qwen3-0.6B,但语言模型输出头被整个摘掉,换成一个小评分头。每个候选项读自己最后一个 token 的隐状态,由一个与排列等变的小头给整组打分——选项的书写顺序不会偷偷变成名次。
这个架构决定了它的失败方式。没有输出词表,就没有 JSON 要解析,没有格式坏掉重试那一轮,也没有"自信地输出一句错话"。失败从「解析不出来」变成「概率偏低」,而概率偏低是可以设阈值的。
它只出三种原语,每一种都交出完整分布,不只给赢家:
- Boolean:问命题真假,回传两个质量;
- Choice:2 到 255 个选项,回传选中值、top 概率、前两名差值和整张分布;
- Score:2 到 10 级评分表,回传等级和期望分,期望分可以落在两级之间。
路由、阈值、回退这三种工程用法,靠的都是这张分布。上下文 2048 token,超长直接报错拒绝,不做静默截断——一段 diff 被悄悄剪掉一半、返回的概率还挺好看,这种错最难查,闸门场景宁可报错。
少用两成数据,多对 45 道题
| 模型 | 类型 | Top-1 | 参数量 |
|---|---|---|---|
| AgentJev-0.6B | 专用 | 79.25%(1585/2000) | 598M |
| Laya 已发布权重 | 专用 | 77.00%(1540/2000) | 421M |
| meraGPT Decider 1 | 通用零样本 | 76.8% | 未公开 |
| TypeSafe Jev 1.13.0 | 通用零样本 | 72.7% | 未公开 |
有人会怀疑这是复跑方式造出来的领先。但 77.00% 是 AgentJev 复跑 Laya 权重量出来的,Laya 模型卡自报 0.766,两边 Brier、ECE、score MAE 三组数贴着,复跑口径没动手脚。Laya 自己也承认基座零样本接近随机(0.36 对 0.318 随机基线),0.766 是微调后的分数——两边都是"专用微调"口径,这才有的比。
AgentJev 留出 120 个开发加 120 个校准案例,按开发集表现挑出第 600 步才开测试集;Laya 用满 1200 个训练案例。少用两成数据仍高 2.25 个百分点,400 案例做 bootstrap,95% 区间 [0.65, 3.90],下界没跨过零。这个领先幅度不大,但站得住。
校准这一栏差距更明显:
| 指标(越低越好) | AgentJev | Laya | 参照 |
|---|---|---|---|
| Brier | 0.0448 | 0.0615 | 0.148(Jev 1.13.0) |
| Score MAE | 0.2096 | 0.2423 | 0.391(Jev 1.08.0) |
| ECE | 0.1687 | 0.2170 | 0.144(Jev) |
Brier 和 Score MAE 全场最低。原因有一部分是施工量:它的三个原语各带一个温度标量,在校准集上重新拟合过;Laya 的温度是从基础权重继承的,模型卡自己承认没为这个模型重调。对"拿概率当闸门"的场景,这一栏比准确率更值钱——概率可校准,你才能写出"0.9 以上自动放行、以下进人工"这种规则。
候选一多,差距才真正拉开
这是它最实在的优势,而且限制条件是对手自己写在模型卡上的。
Laya 的选项共享固定 256 token 额度,官方建议 Choice 保持 20 个以内——选项一多,每个标签摊不到几个 token,准确率掉得很快。AgentJev 这边 Choice 支持到 255 个,每个候选项读自己最后一个 token 的隐状态,所有分支挂同一份 KV 前缀上打分。
64 个选项的负载下,冗余主干 token 从 33547 降到 2551,少算 92.4%;共享前缀 298.91 ms 对非共享 609.65 ms,快约一倍,两条路的概率最大差 0.000508,选中的选项没变。上下文上限 2048 对 Laya 的 1024,也翻了一倍。
| 负载 | Laya(421M) | AgentJev(598M) |
|---|---|---|
| 单案 P50,1 段状态 5 道题 | 41.53 ms | 约 60-70 ms |
| 宽候选,64 Choice + 1 Boolean | 约 500-600 ms | 298.91 ms |
| 上下文上限 | 1024 token | 2048 token |
短输入场景 Laya 反而快约 20 毫秒。这个模型的适用边界写在它的架构里:选项表越长,它越划算;候选经常超过 30 个的场景,这一条比那 2.25 个点更值钱。
全栈开源,841 秒能自己重训
权重在 HuggingFace 的 aimeigaoshou/agent-jev,Apache-2.0,598M 参数全 bf16 约 1.2GB。仓库里除了权重,还有训练入口、推理服务、客户端和一个现成的 Claude Code 钩子。种子和数据版本都写在报告里,一次完整训练 841 秒——一杯咖啡的时间,换成自己的业务数据就能重训,这跟按 token 计费的闭源接口不是一个玩法。
加载方式有个小坑:它不是因果语言模型,AutoModelForCausalLM 载不动,得手动转成 state_dict:
from huggingface_hub import hf_hub_download
from safetensors.torch import load_file
import torch
src = hf_hub_download("aimeigaoshou/agent-jev", "model.safetensors")
torch.save({"state_dict": load_file(src)}, "agentjev_v1.pt")
hf_hub_download("aimeigaoshou/agent-jev", "temperatures.json", local_dir=".")
起服务一条命令:
python -m jev_service.server --checkpoint agentjev_v1.pt --model-path Qwen/Qwen3-0.6B --temperatures temperatures.json --port 8149
服务只绑 127.0.0.1,数据不出机器;HTTP 层一次能吃 32 个状态、128 个问题、1024 条候选路径。仓库里的 agentjev_hook.py 是 Claude Code 的 PreToolUse 钩子,盯着 Bash、Write、Edit,问一个 Boolean 和一个四级 Score,只有 Score 落在第 3 级且 Boolean 说不安全才拦。它是 fail-open 的——服务没响应就退出 0 放行,掉线不阻断你的 agent。
一个人的项目,和它追不上的地方
这事有多卷,看看时间线就懂了:9 月 15 日 Jev 发布,两天后 Kev(Qwen2.5-0.5B + LoRA,MacBook M5 训练 1 小时 45 分钟)和 Bespoke Nimble(9B,2676 样本 90.12% 准确率)上线,一周后 Laya 拿出多语言路由,又三天,AgentJev 在宽度上反超。
但看仓库就会冷静下来。AgentJev 的 GitHub 仓库主分支只有 1 个 contributor、4 个 commit。这不是团队产品,是一个人的极限压缩实验。社区生态的差距更直观:Laya 发布不久,社区已经做出 GGUF、MLX、ONNX、CoreML 四套转换——Mac 用户 pip install laya 就能跑;AgentJev 目前什么都没有,必须自己拉 PyTorch 起 CUDA 服务。
还有四道硬边界,写代码前先认清:
- 只认四个工作流:发票处理、客服、安全事件、agent 轨迹。换个领域要么重训要么别用,别指望零样本泛化;
- 它不能读长文:上下文 2048 token 是天花板,读懂长上下文、给建议、写文案,它一个字都帮不上;
- 置信度是给程序看的,不是给你看的:Brier 0.0448 仍意味着有错判,0.9779 也能错,阈值得用自己的数据校;
- "作者自测"要打折听:79.25% 和毫秒数都是作者自己复跑的口径,样本 2000 题、单机环境,第三方还没人复现过这份报告。
谁该试
正在用 27B 以上模型做路由、分类和闸门的,这 1.2GB 值得在 GPU 上占个角落,尤其是选项表常年超过 30 个的场景。想跑通的路径:先起服务,从 agent 日志里挑 50 条状态,配上 3-5 道平时靠正则在挡的判断题,看分布长什么样,再用放行的那批当校准集。
要读懂文档、写文案、聊天的,关掉这个页面就行——它压根不是干这个的。
过去两年我们习惯了"更强的模型 = 更大的模型"。Jev、Laya、AgentJev 这条线在说另一件事:agent 里大量"选择"节点,一直在用最贵的工具干最便宜的活。你缺的可能不是更大的模型,是一个更对的模型——哪怕它只有 0.6B,连一句话都不会说。
相关链接:
- HuggingFace 权重:https://huggingface.co/aimeigaoshou/agent-jev
- Laya(开源平替):https://github.com/NandhaKishorM/laya
- TypeSafe Jev(闭源原版):https://typesafe.ai
- Qwen3-0.6B 主干:https://huggingface.co/Qwen/Qwen3-0.6B
暂无评论。