天谋科技推出多模态时序数据管理方案,解决工业AI数据供给难?

企业问我们,我存了这么多年的数据,到底能不能发挥价值?

工业AI落地过程中长期存在一个结构性矛盾:企业积累了海量时序数据,但AI模型在实际生产中却难以有效调用这些数据。天谋科技CTO乔嘉林在近期一次技术分享中指出,问题的根源在于传统时序数据库仅支持数值型数据,而工业现场的真实分析需求往往涉及语音、图像、文档等多模态数据,这些数据分散在不同系统中,导致每一次分析都需重复进行数据搬运和拼装工作。

以航空企业的飞行姿态分析为例,工程师需要将气压、高度、电流等数值数据与驾驶舱语音、机载视频进行时标对齐。但数值数据存储在时序数据库,图片和文本散落在文件系统,部分数据存放于对象存储,跨系统整合成为高频且重复的劳动。乔嘉林认为,时序数据的类型不应仅限于数值,语音、图片、文档等数据同样具备时间维度属性,应纳入统一的时序数据管理体系。

天谋科技在解决多模态数据统一管理时,曾尝试将图片和文本作为二进制大对象(BLOB)存入数据库。实验表明,该方案在数据体量较小时可行,但当高分辨率卫星云图、高清视频等大文件进入数据库,单个对象达到数十MB甚至GB级别时,BLOB方案的写入性能和特征提取效率均无法满足需求。为此,天谋科技提出面向AI特征提取的数据类型OBJECT,该类型让数据库理解对象内部结构,支持在数据库内直接完成数据加工和处理,而非将整个对象搬运至客户端。目前该能力已在航空、气象、具身智能等领域落地。

数据统一管理解决了工业AI的第一层问题,但模型训练阶段仍面临数据供给困境。乔嘉林指出,传统数据库为应用系统设计,支持点查询和少量统计分析,而AI训练需要全量扫描和随机扫描,负载量级完全不同。此外,生产环境数据库通常隔离在内网,由DBA值守,随意增加计算负载或导出数据受到严格限制。在具身智能领域,企业普遍缺少的是机器人摔倒、碰撞、卡死等异常场景的稀有样本,而非正常行走数据。

针对数据供给问题,天谋科技采用AI Ready的开放式架构。当AI需要从数据库迁移大量数据时,无需通过查询引擎,只需拷贝底层时序数据文件TsFile即可形成AI可用的数据集,将数据库影响降至最低。据不完全统计,Apache IoTDB开源数据库累计下载量已超过1350万次,管理数据总量超过100PB,企业版激活套数超过5000套,时序大模型Timer累计下载量超过3000万次。

乔嘉林强调,将数据高效送达AI仅解决了数据可获取性问题,模型能否真正理解工业场景取决于企业积累的工况特征和领域知识。与ToC领域模型可从公开数据中学习不同,工业数据不公开且高度个性化,每套装备都有独特的数据特征,这些企业独有数据是时序大模型最稀缺的上下文。通用时序基础模型可处理通用分析,但解决专业问题仍需结合领域数据进行模型后训练和场景适配,形成专用模型。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
台积电回应欧洲先进制程建厂呼声:长期需求是核心前提
上一篇 1小时前
智谱AI入驻天猫开设官方旗舰店,大模型订阅套餐上线电商平台
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部