Linux基金会旗下的开源列式文件格式项目Vortex,正在尝试解决机器学习训练中数据加载环节的瓶颈问题。该项目提出了一种从对象存储S3到GPU显存的高吞吐数据通路方案,在不进行前置数据重处理的前提下,可实现最高60 Gbps的传输速率。
在机器学习训练流程中,数据加载长期被视为影响整体效率的关键环节。传统做法通常需要先将原始数据从S3等对象存储下载至本地,经过格式转换、预处理后再送入GPU,这一过程往往受限于CPU处理能力和NVMe磁盘I/O速度,造成训练流水线中GPU资源闲置。
Vortex的设计思路从文件格式层面入手。作为一种列式存储格式,Vortex通过级联轻量级编码策略,在数据写入时即完成初步压缩与优化,使数据在存储层就具备更紧凑的表示形式。同时,基于布局的段剪枝机制允许查询引擎跳过无关数据块,仅读取训练所需的最小数据子集,从而显著减少网络传输和内存拷贝的开销。
零拷贝内存流水线是另一项核心技术。该机制避免了数据在CPU内存与GPU显存之间的多次复制,使数据能够以接近直接内存访问的方式从网络接口流入GPU。据项目介绍,这一组合方案能够消除传统数据加载路径中的CPU与NVMe瓶颈,实现从S3到GPU的高效直连。
Vortex项目由Onur Satici主导开发,目前已在Linux基金会旗下进行开源治理。该项目面向的对象包括大规模模型训练平台、数据密集型AI应用以及需要高频数据访问的分布式训练集群。对于依赖云上对象存储进行训练数据管理的企业而言,这种无需预先转换数据格式的加载方式,有望降低数据工程环节的复杂度和存储成本。
数据加载效率的提升,对GPU利用率、训练任务完成时间和整体算力成本均会产生直接影响。随着模型规模持续扩大,训练数据量同步增长,对象存储与计算资源之间的数据搬运效率正成为AI基础设施优化的下一个重点方向。Vortex的实践为这一环节提供了新的技术路径参考。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。