突破极限:在 AMD Ryzen AI Max+ 395 上运行 98GB 超大模型 (Vulkan + llama.cpp)

在 Ubuntu 24.04 环境下,通过优化内核参数与 Vulkan 驱动,成功在 AMD Ryzen AI Max+ 395(128GB UMA)上运行 98GB 超大模型。关键步骤包括禁用 IOMMU、调整 TTM 与 GTT 内存上限、启用 zswap 压缩,并编译支持 Vulkan 的 llama.cpp 版本。结合 `--no-mmap`、`--ctx-size 81920` 及 `--n-gpu-layers -1` 等配置,实现全模型载入物理内存,突破传统显存限制,验证了 RDNA 3.5 架构在 Linux 下作为百 GB 级 AI 推理平台的潜力。