博主Alex Ziskind近日公布一组本地AI推理对比数据:搭载RTX 5090移动版(24GB 显存)的雷蛇灵刃18,与拥有128GB统一内存的苹果M5 Max同台测试。
在12B至35B规模的中小模型下,RTX 5090优势明显。Gemma 4 12B模型中RTX 5090跑出4110 tokens/sec,相较M5 Max的1762tokens/sec领先约133%;Qwen3.5 27B领先109%,即便到35B级的Qwen3.6 35B A3B,RTX 5090仍有32% 的提示处理优势。
一旦进入超大模型与超长上下文场景,结果出现反转。在Qwen3 4B的26万超长上下文测试中,RTX 5090的24GB显存迅速告急,生成速度骤降至25.28 tokens/sec;而M5 Max仍能稳定输出181.40 tokens/sec,领先幅度接近7倍。
同一张显卡的对比更直观:在68K上下文下尚可跑出160.36 tokens/sec,当上下文扩至262144,受24GB显存上限约束,性能直接暴跌84.2%,吞吐量仅剩21—25 tokens/sec。
测试结论指出,若AI应用侧重高频短文本生成,RTX 5090仍是优选;但若涉及超长文档分析,显存容量的权重可能要排在算力之前。




