首页 > 开源 > 智能体什么该记什么不该记?openKylin专家来答

智能体什么该记什么不该记?openKylin专家来答

OSChina资讯 2026-09-15 14:58 2 阅读 查看原文

2026 年,大模型智能体正从实验室走进办公、研发和个人助理场景。它要长期陪着用户干活,就得记住用户的偏好、常用的路径、习惯用的模板。记不住,每次对话都从头开始,用户很快就失去耐心;记太死,临时信息、敏感内容又一直留在系统里,成了隐患。

什么该记、什么不该记,没有统一答案,却直接决定智能体好不好用。2026 上海开源软件应用创新大赛的「开源 AI 工具赛道」里,openKylin 提出了一道赛题,全称是《面向 openKylin 操作系统的智能体长期记忆自动化评测 Benchmark 设计》,要求参赛者给智能体的记忆能力装一把标尺。

OpenAtom openKylin 是由开放原子开源基金会孵化及运营的开源操作系统项目,由麒麟软件发起,联合基础软硬件企业、非营利组织、高校、科研机构与个人开发者共同创立。2026 年 6 月,国防科技大学、哈工大(深圳)、麒麟软件等单位共建的 AgentOS SIG 发布了基于 openKylin 的开源智能体操作系统。目前 openKylin 里已经跑着 KylinBot、kylin-agent、OpenClaw、Hermes Agent 等多个智能体框架,框架不缺,缺一套系统级的自动化工具,把不同智能体在记忆能力上的表现量化出来。

命题的背景来自三个现实问题。目前的评测往往依赖人工检查,难以规模化;简单问答式验证项覆盖不到真实使用中的冲突更新、相似干扰和行动复用;自动评分容易出现语义偏移,很难稳定判断模型到底是记住了、误记了,还是不该记却记了。

这道题要求参赛者基于 openKylin 环境,设计一套自动化、低人工介入、可复现、可扩展的评测方案,把对话、记忆记录、行动轨迹、文件统一组织为证据,自动评估智能体的长期记忆能力,重点覆盖长期保持、记忆调用、动态更新、相近区分、边界识别、任务复用六项能力。

交付的要求方案文档要写清测试目标、数据生成方式、验证用例与自动评分流程;数据集要给出可扩展的数据结构;样例数据与结果、可复现材料要一并提供,代码须能在 openKylin 上编译运行;评测流程要封装成一键运行的 CLI 工具,建议产出 .deb 软件包;演示要在 openKylin 桌面环境下对至少两款智能体跑完评测,录一段 3 到 5 分钟、带多维对比雷达图的完整视频。

评审按六个维度打分。自动评分能力和数据设计质量各占 25%,权重最高,稳定性与可复现性、任务定义与通用性各占 15%,指标完整性和创新性与工程可落地性各占 10%。

命题怎么解,专家来直播间讲透

赛题的边界,光看文字容易拿不准。自动化评测算不算做到位、数据集要覆盖到什么程度、代码在 openKylin 上跑通有没有坑,这些都需要出题人来讲。

9 月 16 日 19:00openKylin AISubsystem SIG Maintainer、麒麟软件研发工程师杜雨霏将做客「OSC开源社区」 视频号直播间,围绕这道赛题做一次现场解读,讲命题背景、讲解题思路、讲备赛要点,并在线回答选手提问。

杜雨霏是本次上海开源软件应用创新大赛的赛题命题成员,负责智能体模型记忆模块评测相关工作,参与了这道赛题的设计与打磨。评分标准怎么定、什么样的方案算真正把问题解决了,她会在直播间里给大家讲清楚。

如果你正在准备这道题,或者还在犹豫要不要报名,都可以带着问题来直播间。

大赛报名截止 10 月 11 日,总奖池 100 万元,总决赛 10 月 29 日在上海张江人工智能创新小镇举办,听完直播再动手,时间来得及。

欢迎扫码预约直播: