在ubuntu 24.04上安装amdgpu-top

Ubuntu 24.04 用户若无法通过 apt 安装 amdgpu-top,可直接下载作者提供的 .deb 包快速部署。对于需要跨架构支持且界面友好的场景,nvtop 是更优选择,且已内置于官方源。开发者也可通过 Cargo 从源码安装。若遇到权限问题,需将用户加入 video 和 render 组并重新登录生效。根据需求,amdgpu-top 适合深度监控,nvtop 侧重可视化与易用性,rocm-smi 则适用于自动化脚本。

在 Windows11 + AMD ROCm 环境下部署 LlamaFactory 0.9.4 完整补丁代码合集

在 Windows 11 与 AMD ROCm 环境下运行 LlamaFactory 0.9.4 时,因缺失分布式模块导致启动失败。通过伪造 `torch.distributed` 及其依赖子模块(如 `_shard`、`fsdp`、`_distributed_c10d` 等),构建完整 stub 环境,实现单机模式下的正常运行。配合简易批处理脚本,可快速绕过分布式相关报错,无需修改原项目代码,适用于无 GPU 多进程支持的开发与测试场景。

在 Windows11 + AMD ROCm 环境下部署 LlamaFactory 0.9.4 的排错与解决方案

在 Windows 11 与 AMD AI Max 395 搭配 ROCm 环境下部署 LlamaFactory 0.9.4 时,因 Windows 版 PyTorch 缺失分布式支持,导致导入 `GatherOptions` 等符号失败。通过伪造 `torch.distributed` 及其子模块(如 `_c10d`、`fsdp`、`sharded_tensor`)的缺失类和方法,可绕过 import 错误,实现 WebUI 启动。该方案适用于单机运行,但不支持分布式训练与 FSDP 功能。建议有完整训练需求者优先采用 Linux + ROCm 环境,以获得更稳定可靠的支持。

在 Windows11 + AMD ROCm 环境下部署 LlamaFactory 0.9.3

在 Windows 11 上直接使用系统 Python 安装部署 Llama-Factory,需确保 Python 3.12 环境并升级 pip。通过命令行安装 Llama-Factory 及对应 PyTorch 版本,重点在于为 Windows 兼容性添加 `sitecustomize.py` 补丁,屏蔽不完整的分布式接口以避免报错。推荐使用 `python -m llamafactory.cli webui` 启动 WebUI,实现单机模式下的模型训练与管理。全程无需虚拟环境,适用于本地快速搭建大模型开发环境。