新智元报道
新智元报道

大额免费Token Plan:https://discovery-home.intern-ai.org.cn/,https://api.atria-asi.ai/,https://zenmux.ai/atria-asi/atria-dawn-preview
项目网站:https://atria-asi.ai/
模型权重:https://huggingface.co/internlm/Atria-Dawn-Preview
Paper链接:https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf
20 分钟,一个 MiniOS操作系统搭建了起来。
AI4AI 设计并训练一个超过 4 亿参数的天气预测模型,1 分钟,预测未来一周的全球天气。
这是智能体模型 Atria Dawn Preview 在此次展示中完成的两项任务。
上海人工智能实验室联合复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构,共同发布了这一智能体新模型。
模型能做什么,自然是发布的看点。但这一次,团队还把目光转向了另一件事:这个模型,究竟是怎么被研发出来的?
在 Atria 的后训练过程中,研发人员普遍使用编程智能体辅助工作。写代码、执行实验、分析结果,AI 已经参与其中。
于是,一个问题浮了出来:当 AI 开始帮忙「造 AI」,人类还在忙什么?
越来越多的操作交给 AI 之后,AI工程团队的劳动究竟减少了多少,又有多少转移到了不容易被看见的地方?
Atria 团队收集了研发中的人机交互记录,尝试把这些分工拆开来看。
回看模型研发,人类的工作一直在变。
早期,人们为模型标注数据。后来,通过偏好反馈告诉模型什么样的回答更好。如今,AI 开始参与代码编写、实验执行和结果分析。
人机协作的范围,就这样从训练数据的生产,延伸到了研发流程本身。
沿着数据、训练与评估三个环节,可以看到这一变化:
一些过去需要研究者一步步完成的操作,现在可以交给智能体连续推进。
但研发中,还有一类工作很难用代码行数来衡量。
问题该怎么定义?哪条技术路线值得尝试?实验结果究竟支持了什么判断?继续投入,还是及时换方向?
这些决定可能只需要几句话,却会影响后面一连串操作。
因此,想知道 AI 在研发中贡献了多少,就需要沿着过程往回看:方案是谁提出的,选择是谁作出的,卡住之后又是谁把方向纠正过来的。
这也是 Atria 团队分析交互记录的出发点。
团队分析了 56 名参与者的 769 条任务记录,并结合智能体日志,观察研发中的人机分工。
其中,739 项任务明确回答了是否使用 AI,713 项涉及 AI,使用率达到 96.5%。
在这批被调查的研发工作里,用 AI 已经相当普遍。
不过,96.5% 回答的是「有没有用」,还没有回答「承担了多少」,更没有回答「谁在作决定」。
真正值得展开的,是接下来几组数字。


在 455 项已完成、使用了 AI,且获得有效可行性回答的任务中,151 项被参与者判断为:如果没有 AI,自己负责的部分就无法完成。
占比 33.2%。
这里有一个明确前提:任务范围、质量要求和其他资源保持不变。
也就是说,对这些参与者而言,AI 的作用已经延伸到任务是否可行。一部分原本受资源或个人能力限制的工作,有了 AI,才进入了能够完成的范围。
当然,这里的「做不成」,来自参与者对当时情况的回顾性判断。
这些任务可能确实超出了参与者在给定条件下、不借助 AI 所能完成的范围,也可能是 AI 的使用改变了他们对自身能力和任务可行性的判断。
参与者认为任务离不开 AI,并不意味着最终选择也由 AI 作出。要理解 AI 在工作中的作用,还需要进一步区分:谁提出方案,谁作出最终选择。


再看技术决策。
在执行岗位参与者报告的 567 项方法或参数决策中,AI 提出方案的比例达到 64.6%。
其中,最常见的协作方式是:AI 提出,人类选择。
这一组合占全部此类决策的 55.4%。
如果把视线放到最终选择上,分工就更加清楚:85.5% 的方法或路线决策由人类作出最终选择,AI 作出最终选择的比例为 9.2%。
在目标或范围、验收标准两个环节,人类作出最终选择的比例,也分别达到 93.4% 和 81.9%。
甚至在那 151 项被参与者认为「没有 AI 就无法完成」的任务中,仍有 144 项由人类最终选择目标,占比 95.4%。
两件事同时发生了。研究者依赖 AI 完成工作,AI 也经常参与技术方案的形成;与此同时,人类仍然承担着多数最终选择。
哪些方案值得采用,哪些结果符合要求,研究应该朝哪个方向推进,这些判断构成了人类工作的重要部分。
把整个任务简单标成「人做的」或「AI 做的」,很容易把中间的分工混淆。方案提出、最终选择和具体执行,需要分别看。


智能体卡住之后,会发生什么?
团队请参与者回顾了每项任务中最关键的一次困难。在记录了困难及应对方式的 588 项任务中,76.0% 经人类介入后继续推进,由人类接管主要工作的比例只有 0.7%。
人类最常做的两件事,分别是:
-
补充背景或澄清需求:35.2%。 -
诊断问题或改变方法:34.7%。
另有 23.0% 的任务由 AI 自行恢复推进。
这让「人类介入」有了更具体的样子:研究者补上缺失的信息,判断问题出在哪里,或者调整方法,智能体随后继续执行。
修改产出时,也出现了类似的分工。
在明确记录主要 AI 产出去向的 627 项任务中,354 项发生了实质性修改,占比 56.5%。
而在这些需要实质性修改的任务中,75.4% 由 AI 根据人类反馈完成修改。
初稿是 AI 写的,修改稿也可能是 AI 写的。
但两版之间,人类指出了什么问题、提出了什么要求,同样影响着最终结果。
如果只统计生成内容、代码量或直接编辑次数,这部分通过反馈完成的工作,就很容易被低估。
研发过程之外,Atria Dawn Preview 本身的能力,也是此次发布的重点。
团队对模型进行了评测,并与其他基线模型展开对比。具体结果如下:
在团队给出的 8 项基准对比中,Atria Dawn Preview 取得了 两项第一、两项第二:
-
AutomationBench、CyberGym:得分最高。 -
SkillsBench、Workspace-Bench-Lite:位列第二。
这组结果展现了它有竞争力的智能体能力。
分数之外,团队还给出了三个 Demo,分别对应模型训练、软件开发和网络安全。它们把模型组织工作、使用工具、根据反馈继续推进的过程,放到了具体任务里。

第一个任务,直接让 AI 参与全球天气预测模型的设计与训练。
任务提供了 超过 100 GB 的全球气象数据,同时禁用了网络搜索。Atria Dawn Preview 需要基于这些数据,构建能够学习气象变量变化规律的预测模型。
在这一过程中,它设计了一个 参数量超过 4 亿的 ViT 骨干网络,完成 45,000 步训练,学习 69 个气象变量随时间的演化规律。
最终,系统能够在 1 分钟内,预测未来一周的全球天气。
在该案例的评测设置下,系统使用了更少的训练数据,部分预测指标优于英伟达的经典天气预报模型 FourCastNet。
而任务最终交付的,是一个经过训练、能够运行的天气预测系统。模型设计之后,训练和运行也实际完成了。

第二个任务,转向软件开发。
Atria Dawn Preview 从自然语言需求出发,在 20 分钟内构建了一个 MiniOS,把文字描述转化为可运行的软件成果。
这一案例关注的是完整项目如何推进:组织开发工作、实现代码,并最终交付一个能够运行的系统。
自然语言需求进入任务流程,可运行的软件成为最终产出。

第三个任务发生在隔离靶场中。
Atria Dawn Preview 从网站分析和攻击面排查开始,进一步完成漏洞发现、利用、与修复。
过程中,模型不仅要识别网站结构和潜在风险,还要通过多轮测试排除错误判断、定位真实漏洞,并完成攻击、修复和复验。
这项任务覆盖了从发现潜在漏洞,到验证漏洞是否成立,再到修复漏洞的过程。
三个案例,让基准分数之外的执行过程变得更具体:模型如何安排工作,如何利用工具反馈,以及如何把任务推进到最终结果。
把模型能力与研发过程放在一起看,Atria 的这次实践提供了两个观察角度。
一边,是后训练得到的模型能够完成哪些任务。
另一边,是完成这次后训练,人和 AI 各自承担了什么。
如果 AI 的能力继续提升,这两条线就会进一步交汇,触及 递归自我改进:
AI 参与模型研发,推动能力提升;提升后的能力,再投入下一轮研发,带来进一步改进。
但要让这个过程持续运转,还有问题需要回答。团队将注意力放在了其中两点。

当 AI 能够更快地修改训练流程、构建工具和开展实验,研究者会得到更多结果,也需要及时判断哪些结果值得相信。
训练信号可靠吗?评估漏掉了什么?自我修改有没有偏离原来的目标?
这些问题,都需要有相应的检验。
一轮实验中没有被发现的错误,可能被带进下一轮,继续影响后续判断。
因此,研发自动化向前推进时,独立评估、可追溯的过程记录,以及异常情况下的暂停和回退机制,也需要跟上。
实验数量和执行速度可以增加,改进是否可靠,仍然要经过验证。

人类什么时候介入,是这次观察的一部分。
再往前一步,AI 能否自己判断:什么时候需要人类参与?
目标不够明确,证据彼此冲突,或者问题必须依赖现实世界的反馈,这些时候,继续执行未必能解决问题。
模型需要识别:哪些事情可以自行处理,哪些需要补充信息、专业判断或明确授权。
这也可能改变人的工作方式。研究者可以在关键节点提供判断和帮助,而不必持续指挥每一步操作。
但有效的求助,需要模型把问题说清楚。
卡在哪里,有哪些不确定性,为什么需要人类参与,得到的反馈又该如何用于后续行动,这些都是能力的一部分。
从 AI 辅助研发走向递归自我改进,还有多远,需要在一轮轮实践中检验。
Atria Dawn Preview 展示了模型能够把任务推进到什么程度。Atria 的研发记录,则让人看见了这些成果背后的协作过程。
Atria 背后,是一支学生广泛参与的年轻研发团队。
按学生与 AI Lab 正式员工统计,96 名主要成员中,有 65 名在校生,占比超过三分之二。
其中,博士生 33 人,本科及硕士生 32 人,与 31 名正式员工共同参与项目研发。专项组长中的学生比例达到 70%。
团队汇聚了上海人工智能实验室、复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构与高校的研究力量。
不同高校、不同培养阶段的青年学生,在同一个大模型后训练项目中开展协作,也共同参与了这次关于 AI 能力与人机分工的实践。
而 Atria 这个名字,也藏着团队对这项工作的理解。
Atria 是南三角座的主星,和此前 Delta、长江三角洲与三角形的意象天然呼应;atrium 原意是中庭、汇聚空间,像一个让不同学校、团队与学科在这里相遇、协作的场所。
一颗星,指向更远的探索;一个中庭,容纳不同的人与想法。Atria 也许正代表着这样一种可能:让更多人一起,把智能体能力推向下一步。
|
|
|
参考资料:
编辑:大卫


