Ollama 新手完全指南:一条命令把大模型跑在自己电脑上

从安装到 API 调用,10 分钟跑通第一个本地大模型。附常用命令清单和最常见的三个坑。

如果你只想用一个工具把大模型跑在本地,选 Ollama 大概率不会错:安装简单、命令直观、自动管理显存,还自带 API 服务。这篇带你从零跑通。

安装

去官网下载对应系统的安装包(Windows/macOS 直接安装,Linux 一行脚本),装完终端里出现 ollama 命令即成功。Windows 版安装后会常驻后台,托盘图标可以看到状态。

第一条命令

ollama run qwen2.5:7b

运行后它会自动下载模型(几 GB,等待时间取决于网速),然后直接进入对话界面。退出输入 /bye。就这么简单,没有 Python、没有环境配置。

高频命令清单

  • ollama pull 模型名:只下载不运行
  • ollama list:查看已下载的模型和体积
  • ollama ps:查看当前加载情况(CPU/GPU 分配)
  • ollama rm 模型名:删除模型,释放磁盘
  • ollama serve:以服务方式启动(一般后台已自动运行)

把它当 API 用

Ollama 默认在 http://localhost:11434 提供 OpenAI 兼容接口,你的其他应用(笔记软件、翻译插件、代码助手)都可以直接对接:

curl http://localhost:11434/api/chat -d '{
  "model": "qwen2.5:7b",
  "messages": [{ "role": "user", "content": "你好" }]
}'

很多桌面客户端(如 Open WebUI、ChatBox)填入这个地址就能变成漂亮的聊天界面。

新手最常踩的三个坑

  1. 下载太慢:模型托管在海外,网络环境差时可以考虑配置镜像或代理后再 pull。
  2. 显存不足:Ollama 会自动把放不下的层挪到内存,速度明显变慢属正常现象,换个更小的量化模型即可。
  3. 模型名记不住:模型名格式是”家族:参数量”,去模型库页面搜索,复制完整标签最保险。

跑通这一步,你就已经有了 80% 的本地 AI 体验,剩下的按需折腾就好。

Leave a Reply

Your email address will not be published. Required fields are marked *