在 Ubuntu 22.04 上,最稳健、性能最好的方法是自己编译(这非常简单,只需要 3 条命令)。
请按照以下步骤操作,100% 能行:
第一步:安装必要的编译工具和 CUDA 库
打开终端,运行:
# 1. 更新软件源
sudo apt update
# 2. 安装基础编译工具 (git, make, g++)
sudo apt install -y git build-essential
# 3. 安装 CUDA Toolkit (为了让 llama.cpp 能调用显卡)
# 注意:这步可能需要下载 2GB 左右的数据,请耐心等待
sudo apt install -y nvidia-cuda-toolkit
第二步:下载源码并编译 (只需 1 分钟)
# 1. 回到你的工作目录
cd ~/ai-server
# 2. 拉取最新源码
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
# 3. 开始编译 (关键参数 LLAMA_CUDA=1 表示开启显卡加速)
make LLAMA_CUDA=1
如果编译成功,你会看到最后生成了 llama-server 文件。
第三步:启动服务
现在你的 llama-server 文件在源码目录里。请使用以下命令启动(注意路径变化):
# 确保你在 llama.cpp 目录里
cd ~/ai-server/llama.cpp
# 启动命令 (注意:模型路径需要指向上一步你存放的位置)
./llama-server \
-m ../models/qwen3-vl-30b-q4.gguf \
--mmproj ../models/mmproj-Qwen3VL-30B-A3B-Instruct-F16.gguf \
--host 0.0.0.0 \
--port 8080 \
-c 4096 \
-ngl 99
总结
推荐使用编译方法(第一步和第二步)。这是在 Linux 上玩 AI 模型的标准姿势,能确保程序完美匹配你的显卡驱动,速度最快。