为什么需要本地大模型

云端大模型三个痛点:数据隐私(对话内容上传服务器)、长期成本(持续付费)、无网络时不可用。DeepSeek R1是开源高性能推理模型,本地部署后:数据不出本机、零边际成本、断网可用。Ollama是最简单的一键部署工具,5分钟即可跑通。

第一步:硬件需求

DeepSeek R1有多个量化版本,显存要求:

  • 1.5B——4GB显存,最低配置,能力一般
  • 7B——8GB显存,推荐入门,能力够日常用
  • 14B——12GB显存,能力接近GPT-3.5
  • 32B——24GB显存,能力接近GPT-4o
  • 671B——多卡服务器,消费级跑不动

推荐起步7B(适合8GB显存的RTX 3070/4060)。

第二步:安装Ollama

Windows安装:

  1. 访问 ollama.com/download
  2. 下载Windows版(约300MB)
  3. 双击安装
  4. 命令行输入 ollama –version 验证

Ollama启动后会在后台运行,监听11434端口。

第三步:下载DeepSeek模型

命令行执行:

ollama pull deepseek-r1:7b

自动从Ollama模型库下载(约4.7GB)。完成后即可用。

其他可选:

  • ollama pull deepseek-r1:14b(更高能力)
  • ollama pull llama3.3:70b(云端模型)
  • ollama pull qwen2.5:32b(阿里开源)

第四步:第一次对话

命令行执行:

ollama run deepseek-r1:7b 你好,请自我介绍

Ollama自动加载模型并响应。响应中会看到模型的thinking过程(R1特色)。

第五步:安装WebUI

命令行不如WebUI直观。推荐Open WebUI:

  1. 确保已安装Docker Desktop
  2. 命令行执行:
    docker run -d -p 3000:8080 –add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data –name open-webui –restart always ghcr.io/open-webui/open-webui:main
  3. 浏览器访问 http://localhost:3000
  4. 首次注册管理员账号

Open WebUI自动检测Ollama的本地模型,直接对话。

第六步:配置知识库

Open WebUI支持上传文档作为知识库:

  1. 新建Knowledge
  2. 上传PDF/DOCX/MD/TXT文件
  3. 在Workspace添加Knowledge到对话
  4. 对话时AI会引用知识库内容回答

适合做企业内部知识库问答、产品手册问答、个人资料检索。完全本地处理,数据不出公司内网。

第七步:API服务调用

Ollama默认暴露OpenAI兼容API:

curl http://localhost:11434/v1/chat/completions -H ‘Content-Type: application/json’ -d ‘{“model”:”deepseek-r1:7b”,”messages”:[{“role”:”user”,”content”:”你好”}]}’

可在自己的应用中调用,与OpenAI API兼容。

第八步:性能优化

  • 显存不足——用更小模型或量化版(q4_K_M)
  • 响应慢——检查GPU是否被识别(任务管理器性能)
  • 中文支持——R1对中文支持好,但有时混英文回答是模型特性
  • 工具调用——用 qwen2.5 模型替代DeepSeek,工具调用更好

第九步:多模型协作

下载不同模型应对不同场景:

  • 日常对话——deepseek-r1:7b(中文强、推理好)
  • 代码生成——qwen2.5-coder:14b(专门代码)
  • 长文档——llama3.3:70b(上下文128K,需强显卡)
  • 轻量任务——phi3:mini(最快)

适用场景

  • 个人隐私——日记、邮件、敏感对话AI辅助
  • 企业知识库——内网部署,数据不出公司
  • 开发者调试——本地API无限次调用,零成本
  • 学习研究——无审查限制,深度讨论任何话题

成本对比

云端GPT-4o:$20/月起,按token计费。
本地DeepSeek 7B:硬件一次投入3000-8000元(显卡),之后电费每月几十元。对话次数不限。

长期使用本地更划算,对数据敏感场景必须本地。