首页 > AI前沿 > Specialized Decision Models vs. General-Purpose LLMs: Benchmarking Jev Across Knowledge, Reasoning, and Multilingual Tasks

Specialized Decision Models vs. General-Purpose LLMs: Benchmarking Jev Across Knowledge, Reasoning, and Multilingual Tasks

arXiv自然语言 2026-10-08 21:52 5 阅读 查看原文

Jev是一个“系统一”模型,它从给定选项中选择一个答案,而不是生成文本。我们研究了这种专门的决策模型与通用的大型语言模型(LLMs)之间的比较。我们评估了Jev在13个涵盖知识、推理和多语言理解的多个选择题基准上的表现,并将其与19个LLMs在三个层级上进行了比较:前沿、代表和小型。

Jev在知识和常识基准上与前沿LLMs具有竞争力,并在MMLU-Redux和ARC-Challenge上取得了最佳成绩。在数学之外,它也优于大多数代表LLMs和所有小型LLMs。然而,在数学应用题方面,它落后了:在MathQA上,它比前沿中位数低17.7分,并且得分低于所有19个LLMs。

这些结果表明,一个专门的决策模型可以在主要依赖知识的决策上与通用LLMs相匹配,但不适用于需要多步计算的决策。