9月23日,GMIF 2026全球存储器行业创新峰会上,Arm全球存储业务负责人John Xavier Lionel发表主题演讲《从数据到 Token:重塑边缘 AI 的计算与存储架构》,提出在生成式AI规模落地背景下,存储正成为影响AI系统能力的关键因素。
他指出,AI推理过程中解码(Decode)阶段需要持续访问KV Cache,存储的容量、带宽和数据传输效率直接影响系统性能与吞吐量。Token正在成为衡量AI运营成本的重要单位——以100万台设备每天进行20次AI交互、每次生成500个Token估算,每天将产生约100亿个Token,每一次交互对应计算、内存、存储、网络和能耗等成本。
在AI工作负载分配上,John Xavier Lionel提出,唤醒词检测、异常检测等轻量级任务适合在低功耗终端设备运行;AI助手、多模态交互等适合在手机、PC、XR设备和机器人等高性能边缘设备执行;行业模型与本地化AI服务可依托边缘基础设施运行;超大模型、复杂推理、模型训练等仍更适合部署在云端。(纪川)