阿里云升级全栈AI基础设施,提出“芯云模一体”应对Agent时代新负载

模型一旦长成 Agent,它就不再是一个躺在那里等你调用的接口,而更像一个会自己找数据、自己拆任务、自己并发试错、自己一直跑下去的数字员工。

在2026年云栖大会上,阿里云宣布对其AI基础设施进行全链路升级,覆盖从数据入湖、训练集生产、模型训练、推理服务到系统自我优化的完整环节。阿里云智能集团首席技术官李飞飞将智能体落地拆解为三个关键要素:Model决定智能上限,Context决定Agent能否理解业务,Harness决定其能否真正调用工具并持续运行。阿里云方面强调,仅靠做大单个模型远不足以同时满足这三项需求。

随着AI进入物理世界,数据形态发生显著变化。自动驾驶、具身智能和科学计算场景产生的视频、点云、运动轨迹和传感信号,与传统文本和代码数据存在本质差异。穹彻智能首席科学家吕峻指出,具身智能数据从采集到进入训练可能经过数十道处理工序,一次数据版本迭代短则两周、长则一个月。尽管长期看数据规模仍有两到三个数量级缺口,但现阶段更直接的问题已转向数据质量与精细标注能力。

针对这一数据生产链,阿里云升级了MaxCompute和EMR。MaxCompute将CPU、GPU和大模型Token纳入统一调度,MaxFrame和SQL AI Function可直接调用模型处理全模态数据。面向自动驾驶和具身智能的行业Skill将数据管线进一步封装,开发者可通过自然语言组织处理任务。EMR Serverless Spark支持Spark、Ray、Daft等全模态引擎,并与Paimon、Iceberg等开放湖表格式连接。据阿里云公布的数据,该方案可使具身智能数据处理耗时减少40%,PB级原始数据能够直接生成LeRobot、RLDS格式训练集。

训练端方面,PAI-DLC 3.0引入Xfuse,对算力底座、训练框架和任务运行状态进行联合分析,自动定位通信、数据读取、算子和资源调度中的问题。阿里云公布的测试结果显示,多模态模型端到端训练速度提升2.4倍。阿里云智能集团研发副总裁汪军华表示,一种模型架构即便效果足够好,如果与芯片缓存、通信方式和推理框架不匹配,落到真实硬件上仍可能付出很高成本,AI基础设施由此进入更强调联合设计的阶段。

Agent进入企业后,对数据平台的使用方式也带来改变。企业数据分散在数据湖、数仓、搜索和实时计算系统中,不同部门对同一指标可能存在不同口径。阿里云提出让OpenLake走向Agentic Lake,通过Skill、MCP和调用接口向Agent开放湖上计算引擎,DataWorks提供跨引擎语义层、数据治理与任务编排。新发布的AI原生大数据服务ADA采用多智能体协同,用户从自然语言入口提问,系统调动离线计算、实时分析、搜索和AI训推等不同引擎完成任务。

安全治理随之成为关键议题。阿里云资深产品解决方案总监魏文提到,Agent可拥有较高自主性,但涉及数据增删改查等高风险操作时,需在可控制、可回滚、可审计的数据沙箱中运行。企业的数据权限体系需要进一步细化,未来不仅要管理员工对表的访问权限,还需界定Agent在特定任务下可调用哪些数据、执行到哪一步,以及异常发生后由谁接管。

Agent的持续运行方式同样在改变推理基础设施。它可能围绕一个任务连续工作数小时,调用多个模型和工具,请求量随任务阶段剧烈波动。企业关注的指标从单次Token生成速度扩展至冷启动、缓存、扩缩容、服务稳定性和整体成本。PAI-InferX通过智能路由、Cache感知调度、KV Cache存储和模型预热等能力处理Agent的持续推理负载;PAI-RLS提供托管式强化学习服务,使企业可利用真实任务轨迹继续训练专属模型。在直播、风控等实时场景中,Flink Streaming Agent支持视频、音频和事件流的实时处理。

阿里云此次升级的核心逻辑在于“芯云模一体”,即推动芯片、云平台与模型走向协同设计,打通从原始数据到业务决策的全栈。当Agent从实验室走向真实业务,云计算平台需要承载的负载形态正在发生结构性变化,这对基础设施的调度能力、安全边界和成本模型都提出了新的要求。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
谷歌DeepMind推出SynthID Bio,首次实现AI生成蛋白质的数字水印验证
上一篇 3小时前
WPS超级会员3年+联合会员1年促销,折合72元/年
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部