Ubuntu22.04 安装 Ollama(PVE显卡直通虚拟机,N卡,已经装好nvidia驱动)
Ollama 会自动识别NVIDIA CUDA,不用手动装CUDA toolkit,只要
nvidia-smi正常就可以GPU跑模型。
1. 一键官方安装脚本
curl -fsSL [https://ollama.com/install.sh](https://ollama.com/install.sh) | sh
脚本自动:
- 下载二进制程序
- 创建
ollama用户 - 生成 systemd 服务,自动开机启动
2. 验证安装
ollama --version
# 查看服务状态
sudo systemctl status ollama
看到 active (running) 就是成功。
3. 拉取模型 & 运行
# 拉取通义千问2.5 7B(Q4量化,显存要求低,推荐)
ollama pull qwen2.5:7b-q4_K_M
# 直接交互式对话
ollama run qwen2.5:7b-q4_K_M
启动时看日志,如果输出
using cuda代表显卡直通生效,GPU推理;否则走CPU。
4. 开放局域网API(别的机器访问这个虚拟机Ollama,很常用)
编辑ollama服务环境变量:
sudo nano /etc/systemd/system/ollama.service
在 [Service] 段增加环境变量:
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=*"
重载systemd并重启服务
sudo systemctl daemon-reload
sudo systemctl restart ollama
测试API(宿主机/其他节点可以调用)
curl http://虚拟机IP:11434/api/tags
5. 修改模型存放目录(可选,模型很大,放NFS/数据盘)
同样在 ollama.service 的 [Service] 添加:
Environment="OLLAMA_MODELS=/mnt/nfs/ollama/models"
⚠️注意:目录权限,
ollama用户要有读写权限,否则拉模型报错。
6. 常用管理命令
# 列出本地模型
ollama list
# 删除模型
ollama rm qwen2.5:7b-q4_K_M
# 停止ollama服务
sudo systemctl stop ollama
# 实时看ollama日志
journalctl -u ollama -f
✅ 关键检查(你PVE直通环境重点)
- 虚拟机内先执行:
nvidia-smi,必须正常显示显卡,否则Ollama只能CPU跑 - 虚拟机配置:PVE硬件,删掉默认VGA,只保留直通GPU,否则容易异常
- 显存参考:
- 7B Q4:≈4.5G显存
- 14B Q4:≈9G显存
- 32B Q4:≈20G显存
常见坑
- 启动模型只用CPU:
nvidia-smi没正常识别显卡,检查驱动、Secure Boot - 拉模型很慢:国内网络,可配置ollama镜像代理
- OOM显存溢出:换更小量化版本(q4_K_M)或者更小参数模型
推荐模型清单(国内中文好)
qwen2.5:7b-q4_K_M通义千问7B,中文很强,入门首选qwen2.5:14b-q4_K_M14B,更强,显存9G+deepseek-r1:7b-q4_K_M深度求索推理模型,适合思考/代码
提醒:虚拟机内跑Ollama不影响PVE宿主机集群,只要别重启宿主机,现在集群还在心跳震荡。
作者:月影鹏鹏 创建时间:2026-10-04 01:04
最后编辑:月影鹏鹏 更新时间:2026-10-04 01:05
最后编辑:月影鹏鹏 更新时间:2026-10-04 01:05