通信人家园

 找回密码
 注册

只需一步,快速开始

短信验证,便捷登录

搜索

军衔等级:

  大元帅

注册:2007-12-102858
跳转到指定楼层
1#
发表于 2026-9-7 10:03:03 |只看该作者 |倒序浏览

9月5日消息,小米正式发布通用表格数据基础大模型Xiaomi-TabLDM,该模型主打一次预训练之后,无需针对每一份数据集重新训练、调参或者模型集成,就可以直接完成分类、回归预测任务,把大模型范式延伸到金融、医疗、制造、物流广泛存在的表格结构化数据场景。


长期以来表格数据处理大多依靠XGBoost、LightGBM这类传统机器学习工具,每拿到一份新业务表格,就要重新完成训练调参,多套模型维护带来沉重部署成本,Xiaomi-TabLDM目标就是打破“一表一模型”的行业现状,实现单模型跨数据集直接使用。


模型技术路线围绕大规模合成数据预训练、高效模型Scaling、Test-Time Scaling三大方向展开,整套预训练全部依靠合成表格数据完成,覆盖多样的数据规模、变量类型与函数关系,扩大任务分布覆盖。


架构层面引入双流Feature Group、轻量级Attention Residual以及稀疏MoE专家混合机制,在扩大模型容量的同时,避免计算量同步暴涨,同时支持在不改动模型参数的前提下,依靠增加推理阶段计算资源,进一步拉高预测结果准确度。


在TALENT、OpenML-CTR23、BCCO、TabArena四大公开基准测试当中,Xiaomi-TabLDM整体进入第一梯队。


回归任务表现尤为亮眼,拿下TALENT二分类第一、OpenML-CTR23回归榜单第一,BCCO总体第二、TabArena回归任务第二,多项指标超过TabPFN-3、AutoGluon1.5 extreme等主流基线方案,同时兼顾预测性能与推理效率,在TabArena回归任务上取得1900 Elo得分,每1000样本验证耗时仅3.12秒。


工业真实场景测试进一步验证模型价值,材料性能预测场景无需微调,预测精度提升130%,减少九成无效试模测试;零件重量预测相比XGBoost,失误样本占比下降31%;生产组分预测平均误差降低54%。


遇到工况发生变化,仅补充三十条左右新样本作为上下文,模型平均误差就可以下降62%,对比传统算法需要两百家样本才能接近同等效果,小样本快速适配优势突出。


举报本楼

本帖有 4 个回帖,您需要登录后才能浏览 登录 | 注册
您需要登录后才可以回帖 登录 | 注册 |

版规|手机版|C114 ( 沪ICP备12002291号-1 )|联系我们 |网站地图  

GMT+8, 2026-9-12 05:07 , Processed in 0.118415 second(s), 16 queries , Gzip On.

Copyright © 1999-2025 C114 All Rights Reserved

Discuz Licensed

回顶部