Ollama 命令速查手册

适用:Linux / Mac / Windows

一、基础信息

ollama -v                # 查看ollama版本
ollama --help            # 全部帮助文档

二、模型管理(高频)

ollama list                         # 列出本地已下载模型
ollama pull qwen2.5:7b              # 拉取/下载模型(推荐q4_K_M量化:qwen2.5:7b-q4_K_M)
ollama rm qwen2.5:7b                # 删除本地模型
ollama show qwen2.5:7b              # 查看模型详情(参数、量化、系统提示词)
ollama cp qwen2.5:7b mymodel:v1     # 复制模型,自定义别名
ollama push mymodel:v1              # 推送到ollama仓库(自己上传模型用)

三、对话交互

ollama run qwen2.5:7b                          # 进入交互式多轮对话(记住上下文)
ollama run qwen2.5:7b "写一个PVE集群脑裂排查脚本" # 单次提问,不进入交互

>>> /help        # 交互内查看内置指令
>>> /bye         # 退出ollama交互终端
>>> /clear       # 清空当前对话上下文
>>> /show model  # 查看当前模型的系统prompt
>>> /set         # 修改参数(temperature等)

四、模型运行控制

ollama stop qwen2.5:7b        # 停止加载模型,释放显存
ollama ps                     # 查看当前正在内存/GPU中加载的模型

五、自定义模型(Modelfile,微调/改系统提示词)

ollama create mybot -f Modelfile   # 根据Modelfile创建自定义模型
# Modelfile示例
# FROM qwen2.5:7b
# SYSTEM """你是Linux运维专家,擅长PVE、Docker、集群排错,回答简洁带可直接复制命令"""

六、服务控制(systemd,你当前部署方式)

systemctl status ollama          # 查看ollama服务状态
systemctl start ollama
systemctl stop ollama
systemctl restart ollama
journalctl -u ollama -f          # 实时查看ollama日志(排错神器)

环境变量(service里配置)

  • OLLAMA_MODELS=/mnt/ssd/ollama/models 模型存放目录
  • OLLAMA_HOST=0.0.0.0:11434 开启局域网访问
  • OLLAMA_NUM_PARALLEL=2 最大并发请求数

七、API接口(端口11434,curl测试)

# 单次生成
curl [http://127.0.0.1:11434/api/generate](http://127.0.0.1:11434/api/generate) -d '{
  "model":"qwen2.5:7b",
  "prompt":"解释PVE脑裂"
}'

# 多轮对话chat
curl [http://127.0.0.1:11434/api/chat](http://127.0.0.1:11434/api/chat) -d '{
"model":"qwen2.5:7b",
"messages": [{"role":"user","content":"解释PVE脑裂"}]
}'

八、常用参数(可在Modelfile或者交互内/set设置)

参数 作用
temperature 温度,01,越低越严谨,越高越有创造力;运维排错建议0.10.3
num_ctx 上下文窗口大小,7B模型一般设4096 / 8192
num_gpu 使用GPU层数,显卡不足时调低

九、RTX2080(8G) 推荐模型清单

ollama pull qwen2.5:7b-q4_K_M        # 中文全能,运维首选
ollama pull deepseek-r1:7b-q4_K_M    # 代码、排错、推理强
ollama pull llava:7b-q4_K_M          # 多模态,图片识别

十、排错速查

# 查看ollama进程环境变量,确认OLLAMA_MODELS是否生效
cat /proc/$(pidof ollama)/environ | tr '\0' '\n'

# 端口监听检查
ss -tlnp | grep 11434

十一、快捷键&小提示

  1. 模型下载慢:配置OLLAMA_HOST镜像
  2. OOM显存溢出:换q4_K_M量化版本,不要用q5/q8
  3. 局域网访问:防火墙放行11434,service配置OLLAMA_HOST=0.0.0.0:11434
作者:月影鹏鹏  创建时间:2026-10-05 00:12
最后编辑:月影鹏鹏  更新时间:2026-10-05 00:13