返回笔记
应用实战
大模型部署实战:Ollama + Open WebUI + Nginx
Ollama
Open WebUI
本地部署
大模型
Nginx
想在自己的服务器上部署一个私有大模型?这套方案 10 分钟搞定。
方案选型
为什么不直接用 HuggingFace?因为太重了。Ollama 把这些都封装好了,一行命令就能跑模型。
安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
然后拉一个模型:
ollama pull qwen2:7b # 中文友好
ollama pull llama3:8b # 英文优秀
ollama pull mistral:7b # 综合平衡
安装 Open WebUI
Open WebUI 是一个美观的 ChatGPT 风格前端,专为 Ollama 设计:
docker run -d -p 3000:8080 -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Nginx 反向代理
把 WebUI 和 API 通过域名暴露出来:
server {
listen 80;
server_name ai.example.com;
location / {
proxy_pass http://127.0.0.1:3000;
}
}
模型推荐
7B 级别模型在消费级硬件上体验最好:
- Qwen2 7B:中文能力极强,阿里通义千问团队出品
- LLaMA 3 8B:综合能力最强,英文尤其突出
- Mistral 7B:同等参数下表现最优,法国出品
- DeepSeek-V2-Lite:MoE 架构,16B 参数只激活 2.4B
性能建议
- 7B 模型需要约 8GB 显存(FP16),或 4GB(INT4 量化)
- 使用 SSD 存储模型文件,加快加载速度
- Nginx 加上 gzip 压缩减少传输量
- 设置 nginx 缓存静态资源