Imagination Technologies日前在其GPU IP最新E系列产品展示会上,首次公开了该系列的性能数据。E系列通过强化矩阵乘法、低精度计算和卷积运算能力,将AI负载与图形处理整合至同一可编程架构,瞄准消费电子、汽车、机器人等智能终端的端侧AI计算需求。
Imagination首席营收官Jake Kochnowicz在会上强调,在真实部署中,软件成本甚至可能超过硬件本身。这一判断构成了E系列回归通用GPU架构的战略基础。此前在CNN主导端侧视觉AI任务的时期,Imagination曾同时尝试GPU参与AI计算与独立神经网络加速器两条路线。随着模型、算子和软件生态持续变化,专用硬件在模型适配和软件维护层面承受的压力日益加重,公司遂将AI战略重心收回至通用性更强的GPU。
E系列在图形场景中的表现成为其AI能力的直观验证。凭借四核E-Series配置,部分3A级桌面游戏帧率可超过60FPS。实现路径之一是引入Neural Core神经核,以AI超分技术减轻传统图形渲染负担。与让GPU负责渲染、NPU负责超分的传统异构方案不同,E系列由GPU自身独立承担图形计算和矩阵运算,避免图像数据在共享DDR内存中反复写入读出。Imagination还将矩阵计算能力深度整合进原有着色器执行体系,使图形计算产生的数据可就近进入矩阵运算。
结合自研压缩技术与神经超分辨率算法,E系列在单次神经网络处理中可降低超过一半的权重,减少模型存储和读取的数据量。具体性能表现为:单核E系列将画面从540p提升至1080p仅耗时2.3毫秒;在同一配置下将画面拉升至4K时,带宽消耗最高降低54%,帧率最高达到对照结果的2.5倍。
这一效果与E-Series继续沿用的TBDR处理机制有关。该机制将屏幕拆分为大量Tile逐块渲染,使更多中间数据保留在片上。分块思路与AI能力结合后,可围绕同一Tile连续完成图形和神经网络处理,进一步减少中间结果进出外部内存的频率。此外,E系列对GPU内部ALU执行机制进行了改造,将相关运算组织为连续工作组交给ALU,使中间结果更多保留在计算单元内部。Jake将此概括为最大化数据复用、最小化不必要的数据搬运,并称其带来最高39%的每瓦性能提升。
在AI负载方面,E系列首次引入LLM和大模型推理常用的MXFP8、MXFP4等低精度格式。较低位宽可提高矩阵运算吞吐,帮助Prefill阶段更快处理输入。据Imagination测算,相比上一代产品,E系列Prefill阶段表现提升4.7倍。低精度量化同时降低了模型权重及部分中间数据占用的字节数,缓解Decode阶段的带宽压力。E系列可通过AXI接口接入SoC内存子系统,适配LPDDR、GDDR和HBM等不同内存,最高可消耗768GB/s的读取带宽。
针对智能终端同时处理文字、图像、语音及传感器信息的多模态需求,E系列同步提升了卷积计算能力,性能达到上一代的4.4倍。开发者可通过OpenCL、Vulkan编写计算内核,也可接入Llama.cpp、ONNX、PyTorch等上层软件生态。Imagination希望借助跨代统一的软件栈,使优化工作能够迁移和复用,而非每代GPU都需从头适配。
当GPU能够处理更多AI任务后,软件连续性开始影响SoC内部的硬件分工。Jake透露,部分嵌入式SoC客户已开始询问GPU能否接手原本交给NPU的工作,以避免为另一类加速器单独开发、适配和长期维护软件。但他同时强调,不同任务仍有各自更合适的计算单元。在Agent PC场景中,CPU负责驱动GPU和NPU、协调工具调用、管理数据和任务流程,模型计算则由GPU或其他AI处理器承担加速。在自动驾驶和机器人等更复杂的终端里,GPU同样只是异构SoC中的一环,需与其他感知、控制及专用计算单元配合。E系列已为此准备了硬件mailbox传递状态和指令、通过共享内存减少重复拷贝等机制。
Imagination CEO Markus Mosen总结称,通过将图形、计算和AI功能整合到一个可编程架构中,公司为芯片设计厂商提供了一款值得长期构建和演进的平台型处理器。在端侧AI负载日益繁重的背景下,E系列的市场验证将取决于开发者能否在统一软件栈上持续获得可迁移的性能收益。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。