ithome
科技
采集 2026-09-05T04:11:02+00:00
小米开源表格数据大模型Xiaomi-TabLDM
原始标题:小米表格结构化数据大模型 TabLDM 发布开源:四大基准评测第一梯队,回归能力登顶 OpenML-CTR23
来源
ithome
发布时间
2026-09-05T02:31:23
采集批次
2026-09-05-04
字数
1143
URL 指纹
7580cafdf1289446
📌 AI 总结(261 字)
小米发布并开源通用表格数据基础大模型Xiaomi-TabLDM,针对金融、医疗、制造、物流等领域长期存在的表格数据建模难题,提出「一次预训练、跨任务使用」的基础模型范式。该模型基于结构因果模型生成的合成数据预训练,引入双流特征分组、轻量级注意力残差和稀疏混合专家架构,并通过推理阶段增加算力持续提升性能。在四大公开基准评测中均跻身第一梯队,其中OpenML-CTR23回归榜排名第一。工业场景验证显示,材料性能预测精度提升130%,零件重量预测失误率降低约31%。模型提供scikit-learn兼容接口,支持pip安装。
📄 正文(1143 字)
IT之家9月5日消息,小米今日正式发布通用表格数据基础大模型Xiaomi-TabLDM。 据介绍,该模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。 长期以来,金融、医疗、制造、物流等领域大量核心数据以表格形式存在,但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型,存在多次训练及版本管理等繁重的部署代价。Xiaomi-TabLDM旨在将「一次预训练、跨任务使用」的基础模型范式带入结构化数据领域。 该模型从三个方向推进表格基础模型能力。预训练方面,Xiaomi-TabLDM完全基于结构因果模型(SCM)生成的大规模合成数据进行预训练,覆盖不同数据规模、变量类型、依赖关系和函数关系,扩大预训练任务分布。模型架构方面,引入双流特征分组(dual-stream feature grouping)、轻量级注意力残差(lightweight Attention Residual)和稀疏混合专家(sparse Mixture-of-Experts),从不同粒度建模特征关系,通过稀疏专家扩大模型容量。推理方面,该模型进一步探索了Test-Time Scaling,在保持预训练模型参数不变的情况下,通过增加推理阶段计算量持续提升预测性能。 在四大公开基准评测中,Xiaomi-TabLDM均跻身第一梯队。回归能力表现突出:在OpenML-CTR23回归榜排名第一;在TALENT、TabArena和BCCO的回归任务中均排名第二;在TALENT二分类任务中同样排名第一。在性能与效率的平衡上,以TabArena回归任务为例,Xiaomi-TabLDM取得第二高Elo评分的同时,训练时间比排名第一的TabFM减少82%,预测时间减少68%。 在真实工业场景验证中,Xiaomi-TabLDM相比传统机器学习展现出更高的预测精度和跨工况适应能力。材料性能预测场景下,该模型无需微调即可将预测精度提升130%,减少约90%的无效试模与装机测试。零件重量预测场景中,相比XGBoost,失误样本比例降低约31%。生产组分预测场景中,平均误差相比XGBoost降低约54%;当生产工况发生变化时,仅补充约30条新工况样本作为上下文,即可将平均误差降低约62%。 该模型提供scikit-learn兼容接口,可通过pip安装使用。目前,Xiaomi-TabLDM相关模型权重与代码已正式开源,代码发布在GitHub的xiaomi-research/xiaomi-tabldm仓库,权重发布在Hugging Face的occams/Xiaomi-TabLDM,技术报告发布在arXiv平台。