首页 > 资讯 > AI开始「研究自己」:Mechanist开启机器智能机制科学

AI开始「研究自己」:Mechanist开启机器智能机制科学

机器之心 2026-09-06 06:00 2 阅读 查看原文


近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。而如果这种探究模型内部如何学习、组织和使用知识的「实验」不再完全依赖人类完成,而是交给 AI 自己呢?让它提出假设、寻找机制、设计实验、验证结果,甚至进一步干预模型。


正如医生、心理学家和脑科学家从不同层面研究人类自身,理解我们的行为、认知与大脑机制,我们也可以进一步追问:AI 能否成为研究机器智能自身的「科学家」?这正是 Mechanist 正在探索的问题



  • Paper: https://arxiv.org/abs/2608.12036v2

  • Code: https://github.com/zjunlp/Mechanist

  • Project Web Site: http://mechanist.openkg.cn/


让 AI 自己寻找「智能是怎么产生的」



与传统 AI Scientist 主要帮助科学家研究药物、材料和生物学问题不同,Mechanist 关注的是一个更底层的问题:模型是如何获得这些知识、内部怎么计算这些知识?


Mechanist 将机理研究过程组织成「假设生成,实验执行,结果验证,迭代修正」的完整闭环。但理解模型机理并不容易:大模型的智能由输入、内部表征与海量参数的复杂交互共同产生,往往牵一发而动全身,很难仅凭行为相关性定位真正起作用的因果机制。为支撑可靠的机理发现,Mechanist 构建了两类基础资源:


一是 Scientific Knowledge Graph 辅助提出猜想,包括由约 1.3 万篇可解释性研究论文构成的机理知识图谱,以及覆盖 26 个学科、4300 万篇论文的跨学科知识库;二是大模型智能机理的基础分析工具库,涵盖 32 类机制分析、因果干预与验证方法


Mechanist 并不是简单地让大模型总结论文或编写实验代码,而是让 AI 真正「做」机制研究。它需要提出可证伪的假设,设计并执行实验,再根据结果验证和修正自己的判断。只有当结论能够经受不同模型、数据和方法的检验,才被视为一个更可靠的机制发现。


Mechanist 发现了什么?


Mechanist 最有意思的地方在于,它并没有停留在自动科研的流程展示,而是进一步发现了一些此前并不显然的模型内部规律。


模型究竟如何区分并使用「我知道的事实」和「别人相信的事实」



例如,模型知道「2026 年世界杯决赛将在 Jersey 举行」,但如果告诉它「James 认为决赛将在洛杉矶」,再分别问「现实中的决赛在哪里」和「James 认为在哪里」,模型需要同时维护两种不同的知识状态。


Mechanist 将上述现象划分为 World Knowledge、Personal Belief 和 Attributed Belief 三种情境,并观察到 GPT、Gemini、Claude、Qwen、Pythia、OLMo 等多个模型在这三种情境中均普遍存在错误:有时别人的错误信念会干扰模型自己的事实判断;有时模型自己的知识又会反过来覆盖它对他人信念的判断。


Mechanist 没有停留在行为层面,而是继续向模型内部追踪。研究发现,在 Pythia-1B 中,仅约 0.05% 的参数就与这类 belief-state reasoning 高度相关,并且可以进一步分成不同功能的 attention heads:L4.H1(第 4 层的第 1 个 head,后面与此同理) 主要参与 Attributed Belief,而 L9.H1、L7.H5、L12.H1 等 heads 与 Personal Belief 密切相关。因果干预给出了更强的证据:比如关闭 L4.H1 后,Attributed Belief 准确率从 0.86 降至 0.34,而 Personal Belief 保持不变。这说明模型内部可能并不存在一个笼统的信念区域,相反,不同的信念状态可能由相对独立的内部计算机制承担 [2-4]。


Mechanist 还追踪了这些机制是怎么形成的。在 Pythia-1B 的预训练过程中,Attributed Belief 相关能力很早就出现,而 Personal Belief 则在后续训练中逐渐形成;随着训练推进,对应 heads 的因果重要性也同步增强。这意味着,模型的高级认知能力并非在训练完成后突然出现,而可能伴随着特定内部机制逐步形成。研究者因此不仅可以追问模型「具有什么能力」,还可以进一步追踪能力何时出现、由哪些机制支撑,以及这些机制如何随训练演化,从而将研究从静态的模型解释推进到对智能形成过程的探索。


找到机理之后,还能控制和改进


如果机制研究只能告诉我们「这里有一个 head」,价值仍然有限。Mechanist 继续做了一步:直接干预这些 belief heads,就像直接拧动「模型内部的旋钮」[5-6]。这种机理干预方法比单纯给模型增加 prompt 提示更有效,在 Pythia-410M、Pythia-1B 和 Pythia-2.8B 上分别带来 +15.3%、+8.8% 和 +3.5% 的提升,同时保持较低的错误破坏率。于是,一个完整的因果链条出现了:发现行为→定位机制→因果验证→主动干预→能力提升


基于机理设计的生物发现


同样的思路还被用于 Evo2 这样的生物序列基础模型。如果想生成具有更高 α- 螺旋含量的 DNA 序列,传统方法通常需要生成大量候选,再通过结构预测进行筛选。Mechanist 则尝试找到模型内部与 α- 螺旋相关的特征,然后直接进行 steering。在 900 条生成序列上,目标特征干预将平均预测 α- 螺旋含量从 43.8% 提升到 56.6%。这意味着模型内部那些原本用于「解释」的特征,实际上还可以进一步变成控制模型行为的旋钮。


从知识编辑,到机器智能的「实验科学」


回过头看,知识编辑与 Mechanist 正在形成一条系统的研究路线:Understand AI, Improve AI. 这不是简单地把模型拆开看,而是理解之后能够重新控制它


知识编辑最初关注的是模型知道错了怎么改,随后逐渐深入到知识存在哪里、如何连接、模型为什么相信某些知识,以及改变这些知识和内部机制后,能否进一步影响模型的推理与行为。Mechanist 则将这一思路进一步自动化,形成编辑、观察、验证、再干预的闭环,让模型机制研究从被动分析走向主动实验。


这也引出了一个更大的问题:未来的 AI 能否研究自己的机制,并根据研究结果不断改进自己?现阶段讨论的递归自我改进(RSI),往往强调 AI 自动写代码、生成数据、优化训练过程。但如果 AI 只是不断试错,却无法理解自己为什么成功、为什么失败,这种自我改进本质上仍然更接近自动化搜索 [7-8]。


真正的递归改进或许需要更进一步:发现问题、理解机制、设计实验、验证假设、定向干预,再观察干预后的变化。从这个意义上看,Mechanist 探索的不只是一个新的 AI Scientist 系统,而是一种面向机器智能的研究范式:把大模型作为实验对象,把机制发现作为科学问题,把因果干预作为实验手段


从改变模型中的一个知识开始,到理解智能为何产生、如何被干预,再到机器智能能否依据对自身机制的理解持续改进自己。这或许正是 通过 Mechanism Science of AI 通向 AGI 的一条路径。 


参考文献

[1] Towards principled knowledge editing methods for large language model reasoning, Nature Machine Intelligence, 2026

[2] Language models cannot reliably distinguish belief from knowledge and fact,Nature Machine Intelligence, 2025

[3] Language Models Use Lookbacks to Track Beliefs, ICLR, 2026

[4] How Large Language Models Encode Theory-of-Mind: A Study on Sparse Parameter Patterns, npj Artificial Intelligence, 2025

[5] Toward universal steering and monitoring of AI models, Science, 2026

[6] Steering Llama 2 via Contrastive Activation Addition, ACL, 2023

[7] AlphaEvolve: A coding agent for scientific and algorithmic discovery, 2025

[8] Accelerating scientific discovery with Co-Scientist, Nature, 2026


图片


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com