铭鸿体育资讯网

你需要知道的 AI 内存知识

自己在家运行 AI 模型,可以选择两种硬件。一种是独立显卡,目前最顶级的消费级显卡是英伟达的 RTX 5090,带有 3

自己在家运行 AI 模型,可以选择两种硬件。

一种是独立显卡,目前最顶级的消费级显卡是英伟达的 RTX 5090,带有 32GB 显存,售价3万元人民币左右。

另一种是采用板载芯片组(CPU + 板载显卡 + 板载内存)的家用电脑,比如采用 AMD 公司 Strix Halo 芯片组(具体型号 Ryzen AI Max+ 395)的迷你电脑,自带 128GB 内存,售价2万元人民币左右。

我问大家,哪种硬件更好?

大部分人可能不假思索,就会选择独立显卡,毕竟独立显卡的算力远大于板载芯片组。

根据我查到的资料,下面是两者的单精度32位浮点数算力(FP32)。

•独立显卡(RTX 5090):104.8 TFLOPS

•板载芯片组(AMD Ryzen AI Max+ 395):14.8 TFLOPS

可以看到,独立显卡的算力,足足是板载芯片组的7倍。如果是更小位数的浮点数计算(比如 FP16 和 FP4),算力差距就更大了。

但是,我告诉你,正确的答案其实是“不确定”。很多时候,板载芯片组的迷你 PC,才是更好的本地 AI 模型解决方案。

原因很简单,大多数的 AI 模型(只要参数规模稍大),RTX 5090 根本运行不了。

问题出在它的 32GB 显存实在太少了。一个 70B 参数的模型,如果每个参数使用4位精度,那么将所有参数的权重读入内存,大约需要 32.6GB 的内存,这超出了 RTX 5090 的显存大小,它根本跑不起来。

相比之下,AMD 迷你电脑的板载内存有 128GB,载入模型毫无困难。板载芯片组的内存是显卡和 CPU 共用的,所以称为“统一内存”。它的好处是可以分出尽可能多的内存给单个处理器,所以能处理内存消耗量很大的 AI 模型。

苹果的 M 系列芯片一直是这种“统一内存”架构,其他厂商现在也跟进了,AMD 的 Strix Halo、NVIDIA 的 DGX Spark、Intel 的 Core Ultra 和高通的 Snapdragon X 都采用这种架构。除了内存容量大,它的价格也比独立显卡低。

读到这里,你可能会问,既然板载芯片组有这些优点,还有必要购买独立显卡吗?

回答是,内存有两个指标,除了容量大小,还有一个指标“内存带宽”。板载芯片组的弱点,恰恰就是内存带宽。

所谓“内存带宽”,指的是内存向处理器传送数据的速度。虽然 RTX 5090 显存不多,但是内存带宽极大,达到了 1792GB/s,而 AMD 的内存带宽只有 256GB/s。

AI 模型每生成一个 Token,需要处理器从内存中读取整个模型,进行计算。如果内存带宽是 256GB/s,那么 40GB 大小的模型,处理器一秒只能读取6次(256除以40),也就是说每秒只能生成6个 Token(这是理论值,实际可能还达不到)。这样的龟速,谁能忍受?

即使是内存带宽最大的苹果 M3 Ultra 芯片,带宽为 819GB/s,每秒可以生成20个 Token,远不如 RTX 5090 的 1792GB/s。

所以,内存大小和内存带宽,两者都是 AI 模型的瓶颈。这也是高带宽内存(HBM)价格涨疯了的原因。

如果你选择板载芯片组的迷你电脑,就要做好心理准备,忍受非常慢的 Token 生成速度。

好在为了节省计算量,出现了“混合专家模型(MoE)”这种架构,它计算 Token 时,不需要读取全部参数,只需要激活一部分参数即可。

以 Qwen3-30B-A3B 模型为例,它包含 30B 个参数,但每次只激活 3B 个参数,因此每个 Token 需要读取的数据量不是 20GB,而是 2GB。那么在 AMD 迷你电脑上,每秒理论上可以生成100多个 Token,这样的速度就相当不错了。

因此,如果你用“统一内存”模式的迷你电脑,就选用 MoE 模型吧。

另外,迷你电脑还有一个很大的缺点,跟内存无关,而跟它的算力慢有关。

我们知道,模型必须先处理用户的提示词,然后才能生成 Token。因为迷你电脑的算力慢,所以它处理提示词也很慢。

根据实际测算[1],AMD 迷你电脑使用 70B 的模型,提示词处理速度是每秒95个 Token。那么,用户提交4000个 token 的一个文档,大约需要40秒才能处理完,然后才能输出第一个 Token。

可以想象,一旦用户往上下文窗口塞入更多的内容,单单是处理提示词,就会变成几分钟到几十分钟。

总之,现阶段想在本地电脑运行大模型,无论是独立显卡还是板载芯片组,都有缺陷。你最多只能运行一些中等规模的 MoE 模型,而且提示词不能很长。

References

[1] 实际测算: https://vettedconsumer.com/unified-memory-explained-why-mini-pcs-can-run-70b-models-a-big-gpu-cant-and-where-they-slow-down/