首页 > 开源 > 上海开源大赛DaoCloud赛题公布,选做可获额外现金激励

上海开源大赛DaoCloud赛题公布,选做可获额外现金激励

OSChina资讯 2026-09-21 15:37 7 阅读 查看原文

2026 年,智算云领域面临着相似的问题,即算力能买到,但跑得顺却不容易。

过去两年,行业把精力放在算力供给上,异构集群从千卡走到万卡。卡到位之后,压力转向利用率和吞吐。训练侧任务排队等配额,推理侧 KV Cache 命中率上不去,首 token 时延压不下来,单版权重几十上百 GB 还要在训练节点和终端之间来回搬。真正拖住效率和安全的,往往是网络、存储、数据路径和制品准入等细微环节,任何一处掉速,前面堆的算力难以发挥全力。

基于这些痛点,道客 DaoCloud 在 2026 上海开源软件应用创新大赛的「智算云赛道」上提出了两道赛题。

道客 DaoCloud 是一家专注 AI 基础设施的软件厂商,2014 年底成立于上海,是国家级专精特新“小巨人”企业。深耕开源十余年,目前云原生开源贡献全球前三、亚太第一,也是唯一拥有操作系统指导委员会的中国企业,牵头制定了全球首个 AI Infra 标准,主流推理引擎 vLLM 的贡献全球前五,更有多个自主开源项目 Clusterpedia、HwameiStor、Spiderpool 等均进入CNCF 沙箱阶段。
 
依托深厚的技术积淀,公司构建完整的产品矩阵:专为智算中心打造的 d.run Token 工厂效能平台,推动裸算力中心升级为高效能 Token 工厂;面向企业级场景的 d.run AI 操作系统,打通 “算力 - 模型 - Token” 全链路,实现 80% 以上算力利用率,将每一份算力高效转化为 AI 生产力。面向企业数字化转型,DaoCloud Enterprise 云原生操作系统已服务超千家客户。
 
这次的两道赛题,一道来自推理存储侧的开源项目,一道来自模型仓库项目,两道赛题均以真实业务问题为出发点,依托现有开源代码作为赛题开发底座。
 

赛题一,盘加得越多,网卡越像瓶颈

大模型推理的响应速度,很大一部分取决于 KV Cache 的复用效率。为了让缓存装得下更多内容,存储侧会把单个对象条带化分布到多块 NVMe 或多个存储节点上。盘的并发读取能力在涨,多盘聚合带宽很快超过单张网卡的传输能力,后端磁盘还有余量,前面这条网线先到顶。
 
业内的思路叫多轨网络,让同一个客户端 Worker 通过多张 RDMA 网卡或多条独立路径并行传输,把带宽聚起来。多插几块网卡不等于问题解决。系统得自己发现和维护路径,把对象条带分配到不同轨道,协调多个 Queue Pair 与完成队列,把分散写入的结果汇总到位,同时保证对象版本、条带校验和目标缓冲区一致。更难防的是错序,已失败或取消的请求如果把目标缓冲区释放出去,迟到的 RDMA Write 可能写进别人的数据里。
 
这道题基于道客开源的 KV Cache 分层存储项目 ContextStore,它把缓存从 GPU 显存延伸到主机内存、NVMe 和 JBOF 存储池,为 vLLM、Dynamo、NIXL 提供跨实例前缀复用。命题要求在真实代码和 RDMA 数据路径里把多轨并行读取做出来,不改动现有磁盘条带布局和上层读取接口,保持单网卡部署可用,还要能说清瓶颈出在网卡、PCIe、内存、磁盘还是软件处理。
 
门槛比听起来低,命题方不要求自备实体 RDMA 网卡,也不要求 GPU。没有硬件的可以在普通以太网接口上用 Soft-RoCE 构造至少两条独立路径,也可以做一个可控的 Mock 环境,把路径管理、调度、完成汇总和故障处理跑通。Soft-RoCE 与 Mock 只能验收功能和失败语义,不能证明硬件多轨的聚合带宽。
 

赛题二,模型能不能用,下载之前没人知道

另一道题要解决的是关于模型仓库的问题。一个模型版本里装的不只是权重,还有配置、Tokenizer、Python 代码、动态库、压缩包和多种序列化文件。PyTorch 的部分模型用 Pickle 保存,加载时触发其中的代码执行,脚本和压缩包同样可能夹带东西。未经检查的模型一旦下载到研发终端或推理节点,风险就从仓库扩散进企业计算环境。访问控制能决定谁可以上传和下载,但保证不了某个版本的内容安不安全。
 
命题要求在模型进入、更新和分发这三个环节上补一道可追溯的扫描与准入。参赛者要基于 MatrixHub 做出可运行的原型,在不执行不可信模型代码的前提下做文件级检测、风险汇总和下载控制,给出可解释、可审计、可重新扫描的安全结论。模型仓库特有的部分是对危险序列化格式做静态分析,既不反序列化对象,也不执行里面的代码。
 
MatrixHub 是道客开源的自托管模型仓库,兼容 Hugging Face 客户端,2026 年 1 月开源,采用 Apache 2.0 协议,支持上传、代理缓存与分发。命题要求扫描结论真正落到客户端里,把端点指向 MatrixHub 之后,用官方 huggingface_hub 库调 model_info(),返回结果要能表达对应版本的安全状态,未扫描、扫描中、扫描失败和已通过不能被折叠成同一个空值。剩下的都是工程问题,超大文件怎么扫,重复分片能不能复用结果,扫描器故障和规则更新后怎么办。扫描本身也必须安全,不得加载模型、不得执行仓库里的脚本,测试也不用真实恶意样本。
 
多轨路径怎么建模、扫描状态机分几档、准入策略怎么配、评审怎么打分,都在赛题原文里,这里不再赘述。
 

赛题额外激励

选择挑战道客 DaoCloud 这两道赛题的参赛选手,除了参与「智算云赛道」角逐价值 100 万元的大赛总奖池以外, 完成赛题的优秀团队还将额外获得道客 DaoCloud 提供的赛题奖金(总额 2 万元现金,每道赛题 1 万元,每道题的前三名可按递减比例获得)。特别说明,赛题团队项目完成度需通过审核才可参与赛题奖金排名。
 
有意向报名参赛的选手,可以到 上海开源软件应用创新大赛官网的命题页面找到道客 DaoCloud 的这两道赛题,阅读详细的交付要求与评审标准。

关于 2026 上海开源软件应用创新大赛

由开源中国主办的上海市年度开源技术赛事,设 AI+工业软件、智算云、开源 AI 工具三大赛道,每个赛道独立评审、独立设奖,总奖池 100 万元。大赛面向企业、高校、科研机构、开源社区及学生团队开放,个人或团队均可报名。参赛选手可选择挑战企业命题,也可以提交自己的开源项目参赛,每个项目只可选一个对应赛道。
 
大赛报名截止 10 月 11 日,总决赛将于 10 月 29 日在上海张江人工智能创新小镇举行,30 支入围队伍将通过线下路演角逐现金与算力大奖。欢迎全国开源开发者、开源技术爱好者、AI 技术创新者报名参赛。
 
AI 正在重写软件的生产方式,开源也早已超出代码共享本身。新的技术浪潮面前,参与者比旁观者更早拿到答案。
 

大赛官网:https://www.oschina.net/os2026/