首页 > 开源 > Jeff 开源发布:22 毫秒出一次决策的小模型、0.8B 微调在 benchmark 上逼近 Jev

Jeff 开源发布:22 毫秒出一次决策的小模型、0.8B 微调在 benchmark 上逼近 Jev

OSChina资讯 2026-09-29 14:12 9 阅读 查看原文

一个叫 Jeff 的开源项目,把「专做快速决策的小模型」这条路又往前推了一步。它是 Qwen3.5 和 Gemma 4 的微调版本,定位是“zero-shot(零样本)”分类器——你描述一个场景、列一堆选项,Jeff 一次前向计算就返回每个选项的校准概率,不生成文本、不用解析,在 RTX PRO 6000 上约 22 毫秒出一次决策,Apple M4 Max(MLX)上 28 毫秒。

zero-shot 意味着选项可以千奇百怪:客服工单该转给哪个团队、用户意图识别、内容审核标签、语音命令、游戏下一步走法——你的类别压根不用出现在训练数据里,描述出来 Jeff 就能选。作者自己强调这是「System 1」式的模型,只做又快又稳的判断,不搞多步推理;真要复杂推理,它比不过跑在更大模型上的 Jev。

关键是这个「小」字。在 4599 道题、五大公开 benchmark 上,Jeff 的总体得分几乎和 Jev 打平:Qwen3.5-0.8B 拿到 79.1、Qwen3.5-2B 到 83.1、Gemma4-E2B 是 81.6,对照 Jev 官方公布的 83.0 和 AutoJev-27B 的 84.9。不过推理型评测(BBH、JudgeBench、JevBench)里它明显落后——这正是小模型的预期。另一个亮点是微调上限:作者用约 1.1 万个语音导航样本微调,半个小时内把留出准确率从 31.7% 拉到 95.8%。

整个项目完全跑在本地硬件上:用一张 RTX PRO 6000 训练(0.8B 约 2 小时、2B 约 3.5 小时),训练数据全部由开源模型 Qwen3.8-Flash-Next 在两张 DGX Spark 上合成,测试在 MacBook 上完成——没有云 GPU,训练数据里也没有任何闭源模型输出。它和 Jev 字段格式一致,但自称是独立项目、与 Jev 制造商 TypeSafe 无关,代码从开源的 AutoJev 配方(MIT 许可)起步。

来源: