Ubuntu22.04 安装 Ollama(PVE显卡直通虚拟机,N卡,已经装好nvidia驱动)

Ollama 会自动识别NVIDIA CUDA,不用手动装CUDA toolkit,只要nvidia-smi正常就可以GPU跑模型。

1. 一键官方安装脚本

curl -fsSL [https://ollama.com/install.sh](https://ollama.com/install.sh) | sh

脚本自动:

  • 下载二进制程序
  • 创建 ollama 用户
  • 生成 systemd 服务,自动开机启动

2. 验证安装

ollama --version
# 查看服务状态
sudo systemctl status ollama

看到 active (running) 就是成功。

3. 拉取模型 & 运行

# 拉取通义千问2.5 7B(Q4量化,显存要求低,推荐)
ollama pull qwen2.5:7b-q4_K_M
# 直接交互式对话
ollama run qwen2.5:7b-q4_K_M

启动时看日志,如果输出using cuda代表显卡直通生效,GPU推理;否则走CPU。

4. 开放局域网API(别的机器访问这个虚拟机Ollama,很常用)

编辑ollama服务环境变量:

sudo nano /etc/systemd/system/ollama.service

在 [Service] 段增加环境变量:

Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=*"

重载systemd并重启服务

sudo systemctl daemon-reload
sudo systemctl restart ollama

测试API(宿主机/其他节点可以调用)

curl http://虚拟机IP:11434/api/tags

5. 修改模型存放目录(可选,模型很大,放NFS/数据盘)

同样在 ollama.service 的 [Service] 添加:

Environment="OLLAMA_MODELS=/mnt/nfs/ollama/models"

⚠️注意:目录权限,ollama 用户要有读写权限,否则拉模型报错。

6. 常用管理命令

# 列出本地模型
ollama list
# 删除模型
ollama rm qwen2.5:7b-q4_K_M
# 停止ollama服务
sudo systemctl stop ollama
# 实时看ollama日志
journalctl -u ollama -f

✅ 关键检查(你PVE直通环境重点)

  1. 虚拟机内先执行:nvidia-smi,必须正常显示显卡,否则Ollama只能CPU跑
  2. 虚拟机配置:PVE硬件,删掉默认VGA,只保留直通GPU,否则容易异常
  3. 显存参考:
    • 7B Q4:≈4.5G显存
    • 14B Q4:≈9G显存
    • 32B Q4:≈20G显存

常见坑

  1. 启动模型只用CPU:nvidia-smi 没正常识别显卡,检查驱动、Secure Boot
  2. 拉模型很慢:国内网络,可配置ollama镜像代理
  3. OOM显存溢出:换更小量化版本(q4_K_M)或者更小参数模型

推荐模型清单(国内中文好)

  • qwen2.5:7b-q4_K_M 通义千问7B,中文很强,入门首选
  • qwen2.5:14b-q4_K_M 14B,更强,显存9G+
  • deepseek-r1:7b-q4_K_M 深度求索推理模型,适合思考/代码

提醒:虚拟机内跑Ollama不影响PVE宿主机集群,只要别重启宿主机,现在集群还在心跳震荡。

作者:月影鹏鹏  创建时间:2026-10-04 01:04
最后编辑:月影鹏鹏  更新时间:2026-10-04 01:05