首页 > 资讯 > Imagination E系列性能首秀:用AI把分辨率翻倍仅需2.3毫秒,Prefill性能提升4.7倍

Imagination E系列性能首秀:用AI把分辨率翻倍仅需2.3毫秒,Prefill性能提升4.7倍

雷锋网 2026-09-28 09:21 4 阅读 查看原文

作者 | 陈悦琳

编辑 | 包永刚

 


越来越繁重的AI计算正被引入终端。

 

运行本地大模型和Agent、同时处理视觉、语音和多种传感器数据……这些开始由消费电子、汽车、机器人等智能终端承担的新负载,最终都要交付给底层的SoC来执行。

 

要么引入新的专用AI加速器,要么扩展系统内已有模块的职责——围绕AI能力如何融入SoC,Imagination Technologies(以下简称“Imagination”)两条路都走过。在此前CNN主导大量端侧视觉AI任务的时期,这家深耕GPU IP三十余年的公司既尝试让GPU参与AI计算,也推出过独立的神经网络加速器。

 

然而,当模型、算子和软件生态持续变化,Imagination开始意识到专用硬件对模型适配和软件维护的不堪重负,逐渐把AI战略重心收回至通用性更强的GPU。

 

日前在Imagination GPU IP最新E系列的产品展示会上,Imagination首席营收官Jake Kochnowicz再次强调,在真实部署里,软件甚至可能成为比硬件更大的成本。

 

基于GPU的可编程架构和已有软件生态,瞄准高性能应用的E-Series强化了矩阵乘法、低精度计算、卷积运算等能力,一边承接新的AI负载,另一边也持续押注图形处理这一GPU的老本行。

 

Imagination CEO Markus Mosen总结:“通过将图形、计算和AI功能整合到一个可编程架构中,我们为芯片设计厂商提供了一款值得长期构建和演进的平台型处理器。”

 

这意味着,Imagination真正想验证的是,当一颗GPU开始覆盖越来越多AI任务,能否借助同一套硬件和软件体系,让算力利用得更充分、数据少搬一些,软件开发和维护也少做一些重复工作。

 

3A桌面游戏帧率突破60FPS,离不开一颗神经核

E系列强化AI能力后,用户最容易感知到的变化,仍然发生在GPU擅长的游戏场景。凭借四核E-Series,部分3A级桌面游戏的帧率可以超过60FPS。

 

提高帧率的其中一条路径,是减轻传统图形渲染的负担。引入Neural Core(神经核)的E系列,用AI超分技术来实现这一目标。相比原生高分辨率渲染需要直接生成更密集的画面信息,AI超分的方式允许GPU先按较低分辨率渲染,再由神经网络重建高分辨率画面。

 

Jake指出,传统异构路径会选择让GPU负责渲染、NPU(神经网络处理器)负责超分,这意味着图像可能需要先写入共享的DDR内存后再由NPU读出、处理并写回。而E系列直接让GPU自身独自承担图形计算和矩阵运算,大大缩减了距离成本。与此同时,Imagination还进一步打通E系列内部两类计算单元的“最后一公里”,将矩阵计算能力深度整合进原有着色器执行体系,图形计算产生的数据可以就近进入矩阵运算。

 

硬件架构之外,结合其独有的压缩技术,Imagination自研的神经超分辨率算法在单次神经网络处理中可以降低超一半的权重,减少模型需要存储和读取的数据量。

 

种种优化也体现在具体的游戏体验中:单核E系列将画面从540p提升至1080p时,仅耗时2.3毫秒;在同一配置下,画面继续拉升至4K时,带宽消耗最高降低54%,帧率最高达到对照结果的2.5倍。

 

这样的效果也与E-Series继续沿用的TBDR(Tile-Based Deferred Rendering,基于分块的延迟渲染)处理有关。Jake解释,相比部分友商将整帧画面一次性展开处理,这种处理方式先把屏幕拆成大量Tile逐块渲染,让更多中间数据留在片上。此外,这套分块思路又可以和AI能力结合,围绕同一个Tile接连完成图形和神经网络处理,进一步减少中间结果频繁进出外部内存。

 

数据搬运被反复提及,既切中用户对低延迟的要求,也关乎边端设备最在意的功耗。除了植入神经核以及其配套的算法外,E系列的亮点还在于对GPU内部ALU(算术逻辑单元)执行机制的改造。通过把相关运算组织成连续的一组工作交给ALU,中间结果可以更多留在计算单元内部,减少反复访问寄存器和搬运数据。Jake将其概括为“最大化数据复用、最小化不必要的数据搬运”,并称其由此带来最高39%的每瓦性能提升。

 

新增低位宽计算,Prefill性能提升4.7倍

除了支撑游戏中的AI超分,E系列的AI计算能力还瞄准了当下最热的AI负载——Agent应用。

 

在Agent一系列工作任务背后,大语言模型推理仍是核心。具体到模型推理阶段,Prefill阶段直接影响TTFT(Time To First Token,首Token延迟),Decode阶段的运算则关乎TPOT(Time Per Output Token,每Token输出时间)。两种任务模式截然不同,却都指向“让Token尽可能快地吞吐”这一目标。而E系列的低精度矩阵计算能力,恰好能同时服务这两个阶段。

 

据Jake介绍,E系列第一次引入LLM和大模型推理常用的MXFP8、MXFP4等低精度格式。在相应硬件支持下,较低位宽可以提高矩阵运算吞吐,帮助Prefill更快处理输入。据Imagination测算,相比上一代产品,E系列Prefill阶段表现提升了4.7倍。

 

在采用低精度量化后,模型权重以及部分中间数据占用的字节数也会下降,每一步需要读取的数据随之减少,从而缓解Decode阶段的带宽压力。不过,实际系统能提供多少带宽,仍取决于最终采用的内存、控制器和SoC配置。E系列可通过AXI(Advanced eXtensible Interface,高级可扩展接口)接入SoC内存子系统,适配LPDDR、GDDR和HBM等不同内存,最高可消耗768GB/s的读取带宽。

 

除了运行语言模型之外,智能终端还需要同时处理文字、图像、语音以及传感器信息。虽然矩阵运算仍然占据重要位置,但视觉识别、感知和图像处理等多模态AI处理又会大量涉及另一项AI基础运算——卷积计算,因此E系列同步提升此项能力,性能是上一代的4.4倍。

 

软件栈可灵活调优,但GPU还是需要「搭子」

从语言模型到多模态任务,E系列都保留了足够的通用性,具体到不同模型,开发者仍需要针对算子、精度和执行方式继续优化。

 

Jake介绍,目前开发者可以通过OpenCL、Vulkan编写Kernel(计算内核),也可以接入Llama.cpp、ONNX、PyTorch等更上层的软件生态。虽然模型还在演进,但Imagination希望借助跨代统一的软件栈,让这些优化能够继续迁移和复用,而不是每换一代GPU都要从头再来。

 

当GPU能够处理更多AI任务后,这种软件连续性又开始影响SoC里的硬件分工。Jake观察到,一些嵌入式SoC客户已经开始询问GPU能否接手部分原本交给NPU的工作,避免为另一类加速器单独开发、适配和长期维护软件。

 

但仍需要强调的是,不同任务仍有各自更合适的计算单元。Jake首先以Agent PC为例,指出CPU负责驱动GPU和NPU、协调工具调用、管理数据和任务流程,进入模型计算后,再由GPU或其他AI处理器承担加速。在自动驾驶和机器人等更复杂的终端里,GPU同样只是异构SoC中的一环,还需要和其他感知、控制及专用计算单元配合。

 

E系列也已经为这种分工做足准备,如用硬件mailbox传递状态和指令;通过共享内存减少重复拷贝数据,并缩短任务从一个处理器切换到另一个处理器的等待时间;此外,客户还可以把GPU软件集成进自己的SDK,由系统软件根据任务特点调用不同计算资源。

 

在对的时间、用对的处理器、出对的结果,并发挥GPU在融合计算中的最大作用,这才是Imagination E系列押注GPU的本质所在。

 雷峰网雷峰网