返回笔记
应用实战

大模型部署实战:Ollama + Open WebUI + Nginx

Ollama Open WebUI 本地部署 大模型 Nginx

想在自己的服务器上部署一个私有大模型?这套方案 10 分钟搞定。

方案选型

为什么不直接用 HuggingFace?因为太重了。Ollama 把这些都封装好了,一行命令就能跑模型。

安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

然后拉一个模型:

ollama pull qwen2:7b        # 中文友好
ollama pull llama3:8b       # 英文优秀
ollama pull mistral:7b      # 综合平衡

安装 Open WebUI

Open WebUI 是一个美观的 ChatGPT 风格前端,专为 Ollama 设计:

docker run -d -p 3000:8080   -v open-webui:/app/backend/data   --name open-webui   --restart always   ghcr.io/open-webui/open-webui:main

Nginx 反向代理

把 WebUI 和 API 通过域名暴露出来:

server {
    listen 80;
    server_name ai.example.com;
    location / {
        proxy_pass http://127.0.0.1:3000;
    }
}

模型推荐

7B 级别模型在消费级硬件上体验最好:

  • Qwen2 7B:中文能力极强,阿里通义千问团队出品
  • LLaMA 3 8B:综合能力最强,英文尤其突出
  • Mistral 7B:同等参数下表现最优,法国出品
  • DeepSeek-V2-Lite:MoE 架构,16B 参数只激活 2.4B

性能建议

  • 7B 模型需要约 8GB 显存(FP16),或 4GB(INT4 量化)
  • 使用 SSD 存储模型文件,加快加载速度
  • Nginx 加上 gzip 压缩减少传输量
  • 设置 nginx 缓存静态资源