|
|
|
www.design-reuse-china.com |
|

Arm"边缘AI架构观":计算、内存与存储实现高效协同
Sept. 29, 2026 –
过去三年,AI产业的注意力几乎全部集中在GPU算力上。TOPS数字年年翻新,芯片制程不断逼近物理极限。然而,当大模型从数据中心走向手机、PC、机器人和工业传感器,一个更为棘手的矛盾开始浮出水面:限制边缘AI落地的核心瓶颈,从"算得快不快"转向"存得下、搬得动、喂得饱"。
正如Arm全球存储业务负责人John Xavier Lionel在GMIF 2026提出的核心判断:"边缘AI的机遇最终不是一个TOPS问题,而是一个系统设计挑战。"这不是一句口号,而是一个被产业数据反复验证的结构性事实。
要理解这场存储觉醒,首先需要看清AI推理的真实成本结构。
当一台设备每天执行20次AI交互,每次生成500个输出token,一百万台设备每天将产生100亿个token。按照当前主流商业API定价,如果以每百万token 10美元计算,仅输出token的日成本就达到10万美元,年化运营支出高达3650万美元。这还只是输出端––尚未计入输入token、缓存上下文效应、重试开销、网络传输和编排成本。
数字背后是一个朴素的商业逻辑:当AI使用量从"试用"走向"日常",token生成就从一次性研发投入变成了一项持续性的运营支出。 而任何持续性支出,都会自动寻找最经济的承接方式。
这正是边缘AI从"技术可能性"变为"经济必然性"的底层驱动力。Arm演示文稿中给出的对比框架清晰地揭示了两种路径的成本差异:纯云端路径需要经过"本地数据→网络传输→云端推理→返回token"四个环节,每个环节都在消耗带宽、延迟和金钱;而边缘优先路径则将数据和模型留在本地,仅在能力不足时才向云端升级。
研究数据支持这一判断。Deloitte的分析显示,采用边缘、云混合策略的组织相比纯云架构可实现15%至30%的总成本节约。更激进的数据来自实际部署,某AI主机方案相比纯云端可降低词元成本80%以上,对工厂质检、门店客服等高频场景,"边侧省词元"已经从概念变成了每月成本表上可直接核对的一栏。
成本之外,还有一个更根本的技术约束在重塑边缘AI的架构逻辑。
大模型推理的瓶颈不在计算,而在内存访问。自回归解码阶段,模型需要逐token生成输出,每生成一个token,都要重新读取全部模型权重和KV缓存。这意味着推理吞吐量本质上由内存带宽决定,而非算力峰值决定。



Back