Ollama 是本地大模型运行工具,完全离线、零费用。下面是 5 步上手:
1️⃣ 安装 Ollama
访问 ollama.com/download,按系统下载安装包。
- Windows / Mac:双击安装包
- Linux:
curl -fsSL https://ollama.com/install.sh | sh
2️⃣ 启动 Ollama(⚠️ 必须设 CORS)
浏览器会拦截跨源请求,必须带 OLLAMA_ORIGINS=* 启动:
# Windows (PowerShell)
$env:OLLAMA_ORIGINS="*"; ollama serve
# Windows (CMD)
set OLLAMA_ORIGINS=* & ollama serve
# macOS / Linux
OLLAMA_ORIGINS=* ollama serve
💡 想永久生效?编辑 ~/.ollama/config.json,加 "origins": ["*"],免每次带参数。
3️⃣ 拉一个模型
ollama pull llama3.2 # 3B 轻量(约 2GB)
ollama pull qwen2.5 # 阿里通义(中文好)
ollama pull nemotron-3-ultra # Nvidia 云端版(默认)
模型列表见 ollama.com/library。
4️⃣ 在序言里配置
在弹窗顶部的"🔌 服务"区域:
- Provider: Ollama(默认)
- Base URL:
http://localhost:11434/v1(默认)
- 模型: 你拉的模型名(如
llama3.2)
- 点"测试连接"看到 ✅ 即成功
5️⃣ 常见问题
- ❌ CORS 拦截
- 浏览器禁止 https 页面访问 http 服务 → 启动时加
OLLAMA_ORIGINS=*。
- ❌ 连接超时
- ① Ollama 未启动
ollama serve ② 端口被占用 ③ 防火墙拦截 11434。
- ❌ 模型不存在
- 提示
model 'xxx' not found → 先 ollama pull xxx。
- 🐢 生成很慢
- 本地模型依赖显卡/内存。换更小的模型(如 1.5B),或调小
maxTokens。
📚 进阶
- 生产环境推荐:Ollama 走 https 反向代理(Caddy / Nginx)
- 多用户隔离:
OLLAMA_ORIGINS 限定域名(如 https://lab.catslinc.com)
- 云端 fallback:配 OpenAI / Claude provider,Ollama 失败时自动降级