Ubuntu 22.04 + RTX 4090 48G 部署 vLLM 运行 Gemma 4 31B 完整实录

在RTX 4090 48GB显存环境下部署Gemma 4 31B模型,需选用AWQ 4-bit或INT8量化版本,避免使用GGUF格式。推荐通过ModelScope下载HuggingFace格式的量化模型,并配置阿里云或DaoCloud镜像加速以解决国内拉取慢的问题。部署时需确保挂载路径与容器内路径一致,命令行避免使用续行符,端口映射与服务端口需匹配,量化参数必须与模型格式对应。最终采用vLLM官方镜像,配合合理内存与并发参数,可实现长上下文支持与稳定推理,适用于本地大模型部署及多轮对话场景。