首页 > 资讯 > 4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?

4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?

机器之心 2026-10-07 05:00 5 阅读 查看原文
编辑|Panda

9 月 27 日,第 46 届国际象棋奥林匹克团体赛在撒马尔罕落幕。东道主乌兹别克斯坦在最后一轮以 2.5 比 1.5 击败乌克兰,第二次捧起公开组金牌,中国女队则第七次登上女子组最高领奖台。下一场焦点大战也近在眼前:11 月底,两位 20 岁的棋手古克什(Gukesh D)与辛达罗夫(Javokhir Sindarov)将在日内瓦争夺世界冠军头衔,这将是史上最年轻的一场世界冠军对决。


看过近几年顶级棋赛直播的人,大概都熟悉画面一侧那根上下浮动的评估条。引擎会告诉你此刻白方领先半个兵,或者某步棋让胜率一落千丈,但它从不解释原因——这仍要靠坐在解说席上的特级大师。


棋盘最左边那根黑白相间、上下浮动的竖条就是评估条


这其实是 AI 领域一个普遍困境的缩影。最强的专家模型往往是沉默的,而最会说话的语言模型,在专业领域里又常常不够强。国际象棋引擎早已把人类远远甩在身后,却说不出一句人话。前沿大模型能写出头头是道的分析,可它推荐的着法本身未必站得住,解释也就成了无本之木。


近日,普林斯顿大学陈丹琦团队在 arXiv 发布了一项成果,尝试把这两端接起来。



他们训练的模型名叫 QUEEN,总参数量约 4B,棋力接近一位典型特级大师,同时能用自然语言讲清楚自己为什么这样走。




  • 论文标题:Language Models that Play Chess and Explain Their Moves

  • 论文地址:https://arxiv.org/abs/2610.03695v1

  • 模型地址:https://huggingface.co/collections/princeton-nlp/queen-chess-models

  • 开源代码:https://github.com/queen-project/queen


会下的不会说,会说的下不好


国际象棋与 AI 的缘分可以追溯到 1950 年。那一年,克劳德·香农(Claude Shannon)估算了国际象棋的计算复杂度,并设想了下棋机器的样子。


此后七十多年,从依靠手工评估函数的「深蓝」,到靠自我对弈成长起来的 AlphaZero,再到基于 Transformer 的 Leela Chess Zero(Lc0),引擎一代比一代强。但它们输出的始终只是一个着法和一串胜率数字。


语言模型这边的问题恰好相反。论文梳理发现,此前专门微调过的国际象棋语言模型大多只在孤立的战术题上训练和评测,连在这种受限场景里都难以选出好棋,解释的质量自然有限。今天的前沿模型进步明显,能给出像样的解释,但代价不菲:作者在附录里提到,用 GPT-5.6-Sol 的高推理档下一整盘棋,成本常常超过 15 美元。


这件事的意义不止于棋盘。论文表示,截至 10 月 2 日,全球共有 1899 位特级大师,不到活跃线上棋手的万分之一。绝大多数棋手一辈子都等不到一位特级大师坐下来给自己讲棋。 一个既下得好、又讲得清、还跑得便宜的模型,填补的正是这块空白。


一位沉默的大师,一位会说话的解说员


QUEEN 的思路可以用一个场景来理解:让一位只会用手指棋盘的沉默大师,和一位口才很好但棋力平平的解说员搭档。大师负责「看」,解说员负责「说」,关键在于让解说员真正读懂大师的手势。



具体来说,「沉默的大师」是 Lc0 家族的 BT5 网络(论文称其为 Leela),约 240M 参数、15 层,输入固定为 64 个 token,正好对应棋盘上的 64 个格子,不做搜索就能下到接近超人的水平。


「解说员」是 HuggingFace 的 SmolLM3-3B,一个几乎没受过国际象棋训练的通用指令模型。


两者之间的桥梁借鉴了视觉语言模型 Flamingo 的门控交叉注意力:Leela 第 i 层的表征,接入语言模型第 2i 层之前,一共插入 16 个桥接模块,约 470M 参数。与原版 Flamingo 只取编码器最后一层不同,这种逐层对接让语言模型能同时看到 Leela 浅层和深层的「想法」。门控初始值设为零,桥接一开始相当于不存在,再随训练逐步打开,避免早期噪声干扰。


接下来是教解说员读懂手势。团队设计了一套四阶段问答课程,由浅入深:先问「某个格子上是什么子」这类静态问题,再问「这个马能走到哪」「谁能将军」这类动态问题,然后给出 1 到 8 步走法,让模型推演出未来局面再作答。所有答案都由程序生成并校验。这一阶段 Leela 和语言模型本体都被冻结,只训练桥接层和新增的词表。之所以要新增 64 个格子和 12 种棋子的专用 token,是因为原有分词器对格子名拆分得不一致,而「bishop」「knight」这些词在日常语料里带着与棋盘无关的含义。


训练后,模型在四类问题上的准确率分别达到 99.97%、99.97%、98.97% 和 96.07%。


用自然语言版的「贝尔曼更新」自我进化


学会读棋之后,模型还不会写分析。团队先用 GPT-5.6-Sol 的低推理档为 15000 个局面生成示范解释,花费 652.35 美元,过滤掉含非法着法或失误的样本后剩下 8602 条,用来做第一轮监督微调,得到的模型 Elo 为 1782。解释写得通顺,但推荐的棋常常不靠谱。


真正让 QUEEN 变强的,是新提出的迭代搜索蒸馏。它的灵感来自 AlphaZero:用搜索得到更好的判断,再把判断「压」回网络里,让网络下次不搜也能直接想到。QUEEN 的做法是把这个过程搬到自然语言上,作为理查德·贝尔曼(Richard Bellman)价值更新的语言版本。


这很像一位棋手的复盘习惯。面对一个局面,模型先写出三个候选着法;然后分别走一步,把三个新局面各自重新分析一遍;如果某个子局面的分析本身出了错,就顺着这个错误继续往下钻,直到找到模型「刚好力所不及」的位置。


随后,由 Qwen3.8-27B 把三份子分析合并成一份对原局面的完整解释,说明为什么选这一步、另外两步差在哪里,并被明确要求不得添加任何新内容。只有当合并后的结论比模型原先的判断更好时,这条数据才会被保留,用来训练下一轮模型。



论文给出了一些例子。白方面对三个候选:Rh2、Qh2+ 和 Qxf3。从对手视角看,三个子局面的评估分别是必被将死、-0.1 和 0.0,取对对手最不利的那个,结论是看似安静的 Rh2 才是杀着,而诱人的将军 Qh2+ 会放走对方的王。每一轮大约从 40 万个根局面出发,最终产出 15 万到 28 万条训练数据。七轮之后,第八代模型被正式命名为 QUEEN。


实验结果


棋力方面,每个模型与 8 个强度不同的引擎对弈 32 盘,按 Lichess 等级分体系换算。QUEEN 最终达到 2697 分,Gemini-3.1-Pro 为 2201,GPT-5.6-Sol 为 2071,同为 4B 规模的前作 C1-4B 则 32 盘全负。作为参照,Lichess 上特级大师快棋等级分的中位数是 2730。七轮迭代中,QUEEN 的分数从 1782 一路涨到 2697,累计提升 915 分,中间第五到第六轮曾短暂回落约 100 分。



论证能力方面,团队在 1000 道战术题和 1000 个实战局面上检验模型给出的主变是否出错。在战术题上,QUEEN 首步不失误率为 91.6%,比第二名 Gemini 高出 9 个百分点;在实战局面上这一数字为 97.1%。


不过,论文也坦率展示了短板。在 GPT-5.6-Sol 担任评委的打分里,QUEEN 的结构连贯性为 3.51,与 Sol 持平,但概念连贯性只有 2.76,明显低于 Sol 的 3.61,语言流畅度也略逊于前沿模型。


换句话说,它找到的变化是对的,但在用「牵制」「前哨」这类术语描述局面时更容易张冠李戴。作者分析,自我蒸馏能把搜索树逐渐压进权重,却教不会模型描述它没见过的棋型,错误的概念还可能在合并过程中层层传递。


消融实验给出了两个结论:


  • Leela 编码器和四阶段课程缺一不可,去掉任何一个,模型的棋力都会跌到 514 分。

  • QUEEN 并非简单复读 Leela:在有 5 个以上合理着法的局面中,它有 53.8% 的情况选了与 Leela 不同的棋。


团队还试验了完全不依赖前沿大模型的版本,用 Stockfish 手工评估特征加模板生成初始解释,结果前四轮的棋力反而更高,第一轮就达到 2115 分。


结语


QUEEN 的价值不只在国际象棋。它真正提供的是一套配方:在一个已有「沉默专家」的领域,用交叉注意力把专家模型接到语言模型上,先用课程教会语言模型读懂专家的表征,再用搜索加蒸馏的方式让解释越写越好。


作者认为,这套方法可以迁移到游戏、机器人和计算机操作等领域,这些地方恰好都不缺强大但不会说话的专用模型。


再过一个多月,日内瓦的世界冠军赛直播里,评估条依然只会给出数字,而能把数字讲成道理的 AI,或许已经不远了。


图片


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com