首页 > 资讯 > RSI再创奇迹!StartLux推出开源决策模型StartLux-Decision,38项基准中31项高于Jev

RSI再创奇迹!StartLux推出开源决策模型StartLux-Decision,38项基准中31项高于Jev

钛媒体 2026-10-04 16:32 6 阅读 查看原文

钛媒体注:9月30日,上海人工智能公司StartLux(原点星辉)推出开源决策模型StartLux-Decision,并一次性推出0.8B、2B、4B、9B、27B五档版本,多项评测数据高于TypeSafe AI 公司近期发布的Jev 1.13。以下为StartLux官方发布文章原文,来源于微信公众号StartLux

Jev为大模型领域带来了一条全新的技术思路,在决策效率与响应速度上展现出很强的潜力。我们十分欣赏该团队的创新,也高度认可这一技术方向。智能体真正执行任务时,每一步等待都会累积,最终影响用户体验。 

为此,StartLux(原点星辉)将团队自建的Auto Research方法用于决策模型研发,用3天时间完成了StartLux-Decision的研发与验证,并一次性推出0.8B、2B、4B、9B、27B五档版本。如此快速的迭代,得益于我们持续建设的Auto Research研发管线。这也是StartLux推进RSI的核心路径之一,让AI深度参与数据构造、训练、评测与失败分析,加快模型迭代。  

在独立的Decision Index 0.2.1评测中,27B版本得分63.88,38项基准中有31项高于Jev 1.13;在上海人工智能实验室(上海AI实验室)发布Intern-Decision时采用的七项评测中,27B平均准确率达到91.82%,同样高于Jev的88.74%。[1]

本次发布的核心表现如下:

• 27B版本决策综合得分63.88,38项基准中31项高于Jev。在Decision Index 0.2.1 上,这一成绩比Jev1.13的57.91高出5.97分;9B版本以58.63分超过这一公开对照。

• 27B版本七套测试平均准确率达到91.82%。高于Jev的88.74%和Intern-Decision-4B的90.02%;公开JevBench答对208/231题,比Jev多9题,Hard子集的111道难题少错8题。

• 一次回答三个问题,4B平均耗时26毫秒。在单卡H200、BF16的短请求测试中,0.8B、2B、9B和27B分别为12.2、15.5、35.7和102.3毫秒。模型直接输出选择及概率,不必生成回答文本。

• 五档规格覆盖0.8B至27B,支持本地部署。在Decision Index 0.2.1上,五档模型均领先对应公开对照:0.8B、2B、4B、9B均高于同尺寸公开榜单最高分,27B则高于当日公开榜首Jev 1.13。五档模型均提供原始权重及Q8_0、Q4_K_M、BF16三种GGUF版本。

*以上为项目公布的测试结果。Decision Index对照采用2026年9月28日公开榜单快照,StartLux-Decision为团队自测;时延为特定硬件与短请求条件下的结果,详细口径见正文。

一次计算,完成多个判断

一条业务信息,往往需要同时作出多个判断。以客服工单为例,同一条“订单被重复扣费,但仍显示未支付”的信息,可以同时对应三个问题:交给哪个团队、今天是否需要处理、影响有多严重。StartLux-Decision支持选择题、是非题和等级评分,让这些问题可以在一次请求中共同完成,不必逐个生成回答。[1]

*工单分流演示:一次请求完成三个判断。

从单步判断走向连续网页操作

连续执行,来自每一步决策与页面状态的衔接。在网页操作中,StartLux-Decision 每步回答两个问题:下一步操作哪个控件,任务是否已经完成?执行系统按模型的选择操作页面,再把更新后的状态交给模型,进入下一轮判断。

• 在多重条件下完成商品筛选与下单

在购物演示中,用户要求购买“最便宜、免运费的8节装AA电池,并寄到家庭地址”。模型需要同时考虑型号、包装数量、价格和配送条件,不能只选择页面上最便宜的商品。最终,系统完成下单,并通过任务条件检查。

*购物演示:筛选符合型号、包装与配送条件的商品,完成下单并核对结果。

• 把成员邀请与权限设置衔接起来

在办公协作演示中,任务是把指定成员邀请到Design团队,并设置为Editor。模型需要选对团队、成员和角色,再判断邀请是否完成。同样的方法可作为后台配置、成员管理等流程中的操作决策环节。

*团队管理演示:选择Design团队,邀请指定成员,并设置Editor角色。

注:上述演示由执行系统提供页面状态和可选控件,输入框通过候选建议项完成选择;模型负责决策,系统负责执行与结果检查。它们展示的是受控环境中的连续操作,不等同于任意网站的自由输入能力。

让决策能力进入动态游戏交互

从网页操作延伸到业务流程,同一套决策接口可以承担更多明确的判断任务:客服系统选择处理团队,办公助手判断该使用哪个工具,工作流决定进入哪条处理分支。开发者提供业务状态和合法选项,模型负责在这些选项中作出判断。需要撰写邮件、填写开放式内容时,再由生成式模型接手。

游戏则提供了另一类测试环境:状态持续变化,动作执行后很快就会产生反馈。在Mario、DOOM、StarCraft II和JevBall的演示中,StartLux-Decision被接入各自的运行环境,用于选择移动、跳跃、攻击或其他候选操作。

  • Mario · 1-1 关卡

*比较候选动作的模拟结果,选择移动与跳跃。

  • StarCraft II · 策略决策

*选择建造目标、兵种优先级与攻防策略。

  • DOOM · Deathmatch

*选择目标、是否开火与移动方式。

  • JevBall · 足球协作

*为球附近的球员分别选择传球、射门等动作。

根据本次发布记录,StartLux-Decision在Mario演示中完成了1-1关卡;在 StarCraft II演示中,为人族机器人选择建造目标、兵种优先级与攻防策略,并战胜内置Hard难度AI。这里展示的是具体运行结果,不是多轮测试的通关率或胜率。

不同游戏也对应不同的决策节奏。StarCraft II每12秒游戏时间提交一组三个问题;DOOM同时判断目标、是否开火和如何移动,并等待模型回答;JevBall则持续运行,一次请求为球附近的多名球员分别选择动作,迟到的回答由游戏自身策略兜底。

*这些演示并非统一的“直接读屏”测试。Mario先在模拟器中试运行11种候选动作,再将结果写成文字供模型选择;StarCraft II的采集、建造与单位控制由脚本执行;DOOM的状态来自游戏引擎,瞄准、寻路和脱困由代码处理。模型负责各自接口定义的决策,不包办全部感知与执行。

• 交互中的细节,也可以单独测量
可靠的交互,往往取决于一个容易被忽略的判断。例如,玩家说“汉娜,你今天见过杰夫吗?”,系统需要判断对话对象是汉娜,而不是只因句子出现“杰夫”就让另一个角色回应。把这一环节单独测量,才能更清楚地比较模型是在理解对话,还是仅仅匹配名字。

*对话对象判断:句子同时出现汉娜与杰夫,但被询问的是汉娜。各角色分别作是非判断。

*旗舰版本为StartLux-Decision-27B。除Dino Run为团队通过Jev API在同一执行环境复测外,Jev 数据引自相应测试作者的报告;0.8B、2B在这些游戏上的表现明显较弱。

正常文本与姓名误听两种输入下,StartLux-Decision分别比Jev少错5条和7条;相比简单姓名匹配,差距更为明显。Dino Run则没有拉开差距:双方都在20次测试中达到预设上限。对应用而言,既要看模型在哪些复杂判断上更可靠,也要看某项测试是否已经不足以区分能力。

多项决策评测高于Jev

团队使用Decision Index官方评测工具运行完整测试,并以2026年9月28日的公开榜单快照作为对照。StartLux-Decision的系列最高得分为63.88,高于Jev 1.13的 57.91;在指数包含的38项基准中,有31项得分更高。

同一快照中,Rune 26B-A4B、Decider chat 31B和AutoJev-27B的得分分别为 57.44、57.33和56.40。StartLux-Decision的最高得分分别高出6.44、6.55和 7.48分;9B版本得分为58.63,也高于这几项公开结果以及Jev 1.13的57.91。

*Decision Index 0.2.1对比。StartLux-Decision使用榜单评测工具完成团队自测,其他模型取自 2026年9月28日公开榜单;不表示已获官方上榜认证。 

• 从综合得分看关键能力的优势

总分之外,分领域结果更能说明差异来自哪里。在语言理解、检索与分类、工具与自动化,以及艺术与人类偏好四个领域,StartLux-Decision旗舰版本的得分均高于表中其余对照;知识与推理领域则由Jev 1.13领先。

*表中数值均为 Decision Index 的领域得分,不是原始准确率;旗舰版本对应 StartLux-Decision-27B。

其中,语言理解为74.5对62.0,检索与分类为66.8对55.4,工具与自动化为82.2对75.1,分别高出Jev 1.13 12.5、11.4 和7.1分。这些能力与前面的应用场景相呼应:理解用户提出的条件,在候选对象中作出区分,再选择下一步操作。

对开发者而言,综合表现最终要落到具体任务。进一步拆到单项测试,差异也并不完全一致。以下几项同时列出领先项和未领先项,便于开发者结合自己的任务判断。

*以上为Decision Index版本中的随机基线校正分数,不能直接当作各基准原版的准确率或完整Agent成功率。† 表示训练使用了该基准的公开训练集,测试题已过滤;完整 38 项结果见项目文档。

这种差异也说明,综合得分领先不等于所有能力都更强。StartLux-Decision在知识与推理领域的44.3低于Jev的51.4,API-Bank也未领先。对智能体更有用的选择方式,仍然是看它最常遇到哪些判断,而不只看一个总分。

• 公开决策测试:不仅比较总分,也比较错在哪里

在来自上海人工智能实验室(上海AI实验室)发布Intern-Decision时采用的七套测试中,StartLux-Decision旗舰版本平均准确率为91.82%,高于Jev 1.13的88.74%和Intern-Decision-4B的90.02%。公开JevBench共231题,三者分别答对208、199和201题。下面把同一组资料中的其他模型也放在一起对照。

*七套测试为JevBench Easy / Original / Hard、Typed Decisions、ToolACE、AG News与WildJailBreak。公开题答对数、七套平均与Decision Index是不同指标。

在JevBench-Hard的111道公开难题中,旗舰版本错23题,比Jev 1.13的31题少8题;4B版本错27题,也少于Intern-Decision-4B的29题。七套测试平均错误率四舍五入后,旗舰版本为8.2%,本系列4B为8.8%,Intern-Decision-4B为10.0%,Jev 1.13为11.3%。

*左:JevBench-Hard公开难题错误数,越少越好。右:七套测试平均错误率。图中错误率为四舍五入后的结果。

  • 多档规格支撑不同部署需求

StartLux-Decision提供五档版本,开发者可以按设备资源和任务需求选择。对照同日公开榜单,四个较小版本的得分均超过对应尺寸的最高分模型;旗舰版本则与榜首Jev 1.13比较,Jev 1.13的参数规模未公开。

*同尺寸比较:0.8B、2B、4B、9B 分别对照当日同尺寸最高分模型;27B对照公开榜首Jev 1.13,后者参数规模未公开,不属于已知的同尺寸比较。 

这四档模型分别领先对应公开对照19.64、15.22、9.71和11.74分。9B版本也以 58.63分高于Jev 1.13的57.91分,分差为0.72。与同样提供多个规格的Intern-Decision相比,差异也出现在各档模型,而不只在旗舰版本。

*StartLux / Intern分别指StartLux-Decision与Intern-Decision的对应规格。

其中,4B版本在公开JevBench上答对204题,七套测试平均准确率为91.17%,均高于Jev的相应结果;但其Decision Index综合得分仍低于Jev。不同测试反映不同能力,选择模型仍应回到实际任务。

*评测说明:以上StartLux-Decision成绩为团队自测,并非官方上榜结果。Decision Index是经随机基线校正、加权汇总的指数,不是直接准确率。训练数据使用了其中14项基准的公开训练集,对应测试题已过滤。公开JevBench的208/231不是包含保密测试、速度与成本的官方总分。ToolACE 项取自公开训练集;排除该项后,4B的其余六套平均准确率为 90.67%,Intern-Decision-4B为88.95%。

以毫秒级响应支撑高频判断

决策速度关系到智能体能多快进入下一步。在单卡H200、bf16、本地HTTP的短请求测试中,StartLux-Decision-4B一次回答三个问题,平均耗时26.0毫秒;只回答一个是非问题时,平均为14.7毫秒。0.8B与2B的三问题请求分别为12.2和15.5 毫秒。

*推理时延:StartLux-Decision为H200上200次串行请求的平均值;Jev为其 API 网关报告的服务端耗时,取100次平均。 

*Jev 1.13 在同类三问题请求上的服务端耗时为64.0毫秒,但双方硬件和服务栈不同,不能据此得出严格的同硬件倍速结论。这里的毫秒数也不是整项网页任务的完成时间:输入长度、页面加载和工具执行都会影响最终耗时。

同类参考中,Intern-Decision在RTX 4090上报告的 0.8B、2B、4B时延分别约为 34.0、33.3 和 44.2毫秒。与StartLux-Decision的H200数据一样,这些数值需要连同硬件与服务环境阅读,不能直接归结为模型本身的速度差。

同一模型内部的优化更能直接说明工程收益:在上述短请求测试中,StartLux-Decision-4B未启用CUDA Graph时为90.3毫秒,启用后为26.0毫秒。项目同时使用快速线性注意力算子,并把多个问题合并到一次前向计算,减少重复计算与调用开销。

对智能体而言,这种计算方式的价值,是让候选动作已经明确的判断直接进入决策环节,不必等待长文本生成。一次请求还可以同时完成动作选择与结束判断,减少重复调用,为更紧凑、更连贯的执行流程提供条件。

  • 让专用决策与大模型协同工作

StartLux-Decision还会返回每个候选项的概率。这为模型协作提供了明确的分流接口:在经过验证的常规场景里,可以直接执行决策;候选项难以区分、状态不充分或操作风险较高时,则补充观察、交给大模型分析,或者请求人工确认。

概率输出并不自动等于真实成功率,分流阈值需要结合业务数据校准。支付、删除、权限修改等操作仍应遵守原有授权与确认规则。决策模型的作用是帮助系统判断下一步,而不是替代这些约束。

模型是否适合长期运行,还取决于它能否装进实际的部署环境。除原始权重外,StartLux-Decision的五档版本均提供面向llama.cpp的GGUF文件,包含保留原权重精度的BF16,以及Q8_0、Q4_K_M两种量化格式。

在Hugging Face模型合集中,每档规格的Q8_0、Q4_K_M 和 BF16 版本均已单独列出,共15个GGUF条目。开发者可以直接按“模型规格+精度”选择对应仓库,下载 GGUF文件及决策服务所需的配套配置。

*表中为模型文件大小,不是运行时总内存或显存需求;不代表这些规格已在任意设备上达到前文H200的时延。

以4B为例,Q8_0文件大小为4.48GB,在这次231道公开JevBench题目的量化复测中,与原始权重的决策一致率为100%,同样答对204题。进一步压缩为2.71 GB的 Q4_K_M后,决策一致率为98.3%,答对201题。开发者因此可以在文件大小与任务表现之间作出更具体的取舍。

  • 兼容现有接口并支持业务适配

在接入方式上,StartLux-Decision采用TypeSafe的/v1/systemone的接口,兼容原有Jev客户端的数据结构。业务程序可以保留现有的“状态+问题”调用方式,再配置相应服务地址。

*接口说明:常见选择题可在一次前向计算中处理;单题超过26个候选项时,服务会分组筛选并进行后续决选,不是任意长度候选列表都只计算一次。

GGUF部署同样保留这一接口:llama.cpp负责承载模型,项目配套的决策服务负责组织问题并读出选项结果。项目代码采用Apache-2.0许可,模型权重采用CC BY-NC 4.0许可,可用于研究及其他非商业用途;商业使用需另行取得StartLux Labs 授权;仓库还提供推理、评测复现、LoRA微调与温度校准工具,方便开发者围绕自己的业务继续适配。

 以Auto Research驱动决策模型迭代

StartLux-Decision背后,是StartLux持续推进的Auto Research研发管线。这套由联合创始人兼CTO郭权玮带领团队建设的研发系统,将研究过程本身纳入迭代,也是公司推进RSI(递归式自我改进)的一条路径。

此前,机器之心在2026年9月16日的《本地该怎么做RSI?我们与StartLux CTO聊了聊》中,介绍过这套方法:AI不只执行预先安排的实验,还会根据上一轮结果分析失败、提出新假设,并参与决定下一步研究什么;研究目标、评价标准和关键规则仍由人把关。[2] 

这次,团队将这套方法落实到专用决策模型的迭代中,围绕智能体执行时的关键判断展开研发:能否选对动作、能否理解任务条件、输出是否适合程序使用。AI参与数据构造、训练与评测,失败结果再回到下一轮实验中;改动是否保留,由实际测试检验,而不只看模型自己如何评价。

这也延续了郭权玮此前在钛媒体报道中表达的观点。2026年9月16日,钛媒体记录了他在ITValue Summit的分享:企业评估AI,应更多关注整套系统能否完成业务任务,并结合模型调度、权限与任务反馈持续改进。[3] 

  • 让决策能力进一步服务自动研究

自动研究同样需要反复作出决策:下一步调用哪个工具,哪些失败需要进一步检查,什么情况应当暂停或转交其他模型。StartLux-Decision为这些环节提供了可尝试的专用组件,也为决策能力进入研究流程打开了进一步探索的空间;是否能带来稳定收益,仍需要在具体研究流程中验证。

在郭权玮的定义中,Auto Research是实现RSI的核心元件:先让AI参与研究和模型改进,之后进一步要求被改进后的AI连“改进 AI 的能力”本身也得到提升。StartLux-Decision是这条研发路线上的另一项具体成果。

从一次判断到连续执行,StartLux关注的是智能体如何把任务做得更顺畅。StartLux-Decision将专用决策能力带到操作页面、分配任务和调用工具等环节,让高频判断有机会减少不必要的等待,让复杂问题及时转交合适的模型或人。围绕这些真实任务,StartLux将继续推进模型、推理系统与智能体执行能力的协同,让研发成果更直接地服务任务完成。

代码与模型:

为助力决策模型赛道发展,我们决定完整开源Startlux-Decision,欢迎大家下载、测试与交流。同时,也欢迎优秀人才加入我们共同推动RSI发展。

  • GitHub链接:

https://github.com/StartLuxLabs/Startlux-Decision

  • Hugging Face 模型合集下载链接:

https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493

*合集包含五档原始模型,以及按规格与精度分别列出的15个GGUF版本;

  • 技术资料与相关阅读

[1] StartLux-Decision已公开项目仓库:README、推理文档、评测结果、量化测试及 media 演示素材。2026-09-30 核对;Decision Index 对照仍采用仓库注明的 2026-09-28 榜单快照,主评测与量化复测分别列示。 

[2] 机器之心,2026-09-16:《本地该怎么做RSI?我们与StartLux CTO聊了聊》(公开转载)。

[3] 钛媒体,2026-09-16:《郭权玮:企业AI不必迷信综合榜单,重系统闭环与可信部署》。

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App