首页 > 资讯 > 小米表格结构化数据大模型 TabLDM 发布开源:四大基准评测第一梯队,回归能力登顶 OpenML-CTR23

小米表格结构化数据大模型 TabLDM 发布开源:四大基准评测第一梯队,回归能力登顶 OpenML-CTR23

IT之家 2026-09-05 10:31 1 阅读 查看原文

IT之家 9 月 5 日消息,小米今日正式发布通用表格数据基础大模型 Xiaomi-TabLDM。

据介绍,该模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。

长期以来,金融、医疗、制造、物流等领域大量核心数据以表格形式存在,但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型,存在多次训练及版本管理等繁重的部署代价。Xiaomi-TabLDM 旨在将“一次预训练、跨任务使用”的基础模型范式带入结构化数据领域。

该模型从三个方向推进表格基础模型能力。预训练方面,Xiaomi-TabLDM 完全基于结构因果模型(SCM)生成的大规模合成数据进行预训练,覆盖不同数据规模、变量类型、依赖关系和函数关系,扩大预训练任务分布。模型架构方面,引入双流特征分组(dual-stream feature grouping)、轻量级注意力残差(lightweight Attention Residual)和稀疏混合专家(sparse Mixture-of-Experts),从不同粒度建模特征关系,通过稀疏专家扩大模型容量。推理方面,该模型进一步探索了 Test-Time Scaling,在保持预训练模型参数不变的情况下,通过增加推理阶段计算量持续提升预测性能。

在四大公开基准评测中,Xiaomi-TabLDM 均跻身第一梯队。回归能力表现突出:在 OpenML-CTR23 回归榜排名第一;在 TALENT、TabArena 和 BCCO 的回归任务中均排名第二;在 TALENT 二分类任务中同样排名第一。在性能与效率的平衡上,以 TabArena 回归任务为例,Xiaomi-TabLDM 取得第二高 Elo 评分的同时,训练时间比排名第一的 TabFM 减少 82%,预测时间减少 68%(Elo 评分原为国际象棋等级分制度,此处用于衡量模型在基准测试中的相对性能排名)。

在真实工业场景验证中,Xiaomi-TabLDM 相比传统机器学习展现出更高的预测精度和跨工况适应能力。材料性能预测场景下,该模型无需微调即可将预测精度提升 130%,减少约 90% 的无效试模与装机测试。零件重量预测场景中,相比 XGBoost,失误样本比例降低约 31%。生产组分预测场景中,平均误差相比 XGBoost 降低约 54%;当生产工况发生变化时,仅补充约 30 条新工况样本作为上下文,即可将平均误差降低约 62%。

该模型提供 scikit-learn 兼容接口,可通过 pip 安装使用。

目前,Xiaomi-TabLDM 相关模型权重与代码已正式开源,IT之家附相关代码及模型权重:

  • 代码:https://github.com/ xiaomi-research / xiaomi-tabldm

  • 权重:https://huggingface.co/ occams / Xiaomi-TabLDM

  • 技术报告:https://arxiv.org/ abs/2609.03880