Ubuntu 22.04 + RTX 4090 48G 部署 vLLM 运行 Gemma 4 31B 完整实录

在RTX 4090 48GB显存环境下部署Gemma 4 31B模型,需选用AWQ 4-bit或INT8量化版本,避免使用GGUF格式。推荐通过ModelScope下载HuggingFace格式的量化模型,并配置阿里云或DaoCloud镜像加速以解决国内拉取慢的问题。部署时需确保挂载路径与容器内路径一致,命令行避免使用续行符,端口映射与服务端口需匹配,量化参数必须与模型格式对应。最终采用vLLM官方镜像,配合合理内存与并发参数,可实现长上下文支持与稳定推理,适用于本地大模型部署及多轮对话场景。

MongoDB缩放oplog大小

通过调整 oplog 大小至 5-10GB 并执行 compact 操作,可有效释放磁盘空间。在主节点执行 replSetResizeOplog 命令缩小上限,会截断旧日志,需确保所有副本节点状态正常且业务低峰期操作。随后对 oplog.rs 执行 compact 整理碎片,提升存储利用率。整个过程无需重启服务,完成后 oplog 物理大小将显著降低,建议结合 rs.status() 验证集群状态,确保同步正常。