如果你只想用一个工具把大模型跑在本地,选 Ollama 大概率不会错:安装简单、命令直观、自动管理显存,还自带 API 服务。这篇带你从零跑通。
安装
去官网下载对应系统的安装包(Windows/macOS 直接安装,Linux 一行脚本),装完终端里出现 ollama 命令即成功。Windows 版安装后会常驻后台,托盘图标可以看到状态。
第一条命令
ollama run qwen2.5:7b
运行后它会自动下载模型(几 GB,等待时间取决于网速),然后直接进入对话界面。退出输入 /bye。就这么简单,没有 Python、没有环境配置。
高频命令清单
ollama pull 模型名:只下载不运行ollama list:查看已下载的模型和体积ollama ps:查看当前加载情况(CPU/GPU 分配)ollama rm 模型名:删除模型,释放磁盘ollama serve:以服务方式启动(一般后台已自动运行)
把它当 API 用
Ollama 默认在 http://localhost:11434 提供 OpenAI 兼容接口,你的其他应用(笔记软件、翻译插件、代码助手)都可以直接对接:
curl http://localhost:11434/api/chat -d '{
"model": "qwen2.5:7b",
"messages": [{ "role": "user", "content": "你好" }]
}'
很多桌面客户端(如 Open WebUI、ChatBox)填入这个地址就能变成漂亮的聊天界面。
新手最常踩的三个坑
- 下载太慢:模型托管在海外,网络环境差时可以考虑配置镜像或代理后再 pull。
- 显存不足:Ollama 会自动把放不下的层挪到内存,速度明显变慢属正常现象,换个更小的量化模型即可。
- 模型名记不住:模型名格式是”家族:参数量”,去模型库页面搜索,复制完整标签最保险。
跑通这一步,你就已经有了 80% 的本地 AI 体验,剩下的按需折腾就好。