之前分享了 Ollama 下载加速的帖子,很多人私信问怎么部署具体的模型。那今天就写一个完整教程,手把手教大家用 Ollama 本地部署 DeepSeek。
选 DeepSeek 的原因:
- 国产开源模型,中文能力非常强
- DeepSeek V3/R1 在各种榜单上表现优秀
- 社区活跃,更新频繁
- 对硬件要求相对友好
下面是完整步骤,我用的 Windows + RTX 4060(8GB显存),大家根据自己的配置选择对应的模型版本。
第一步:安装 Ollama
去 ollama.com 下载安装包,双击安装。安装完打开终端验证:
ollama --version
第二步:拉取 DeepSeek 模型
# 7B版本(推荐8GB显存以上)
ollama run deepseek-r1:7b
# 1.5B版本(入门配置也能跑)
ollama run deepseek-r1:1.5b
# 14B版本(需要16GB以上显存)
ollama run deepseek-r1:14b
第一次运行会自动下载模型,如果下载慢参考之前的镜像加速帖。
第三步:测试对话
模型下载完会自动进入对话模式,试着问几个问题看看效果。
大家部署过程中遇到什么问题可以在下面留言,我尽量解答!
4 个赞
补充一下各版本的硬件需求和实际体验:
| 模型版本 |
显存需求 |
内存需求 |
推理速度 |
中文能力 |
| 1.5B |
2GB+ |
8GB+ |
很快(>30 tok/s) |
一般 |
| 7B |
6GB+ |
16GB+ |
较快(15-25 tok/s) |
好 |
| 14B |
12GB+ |
24GB+ |
中等(8-15 tok/s) |
很好 |
| 32B |
24GB+ |
32GB+ |
较慢(3-8 tok/s) |
非常好 |
如果显存不够,Ollama 会自动 offload 到内存/CPU,还是能跑,就是慢一些。
个人建议:大部分人选 7B 版本就好了,性价比最高。
部署好了!RTX 3060 12GB跑 7B 版本,速度大概20 tokens/秒,体验还不错。中文回答质量比我想象的好,日常对话完全够用了。就是遇到复杂的编程题会拉胯,这个跟模型大小有关,不是部署问题。
1 个赞
我踩了个坑分享一下:Windows 上如果遇到 CUDA 相关错误,检查两个东西:
- NVIDIA 驱动要更新到最新版
- 确认 Ollama 识别到了你的显卡:
ollama ps 看一下是不是 GPU 加速
另外 DeepSeek R1 跟普通的 DeepSeek V3 不太一样,R1 是专门优化过推理能力的,做数学题和逻辑推理比 V3 强不少。如果你主要用来写代码建议用 DeepSeek Coder V2。
楼主教程很清楚!我在Mac M2上也成功部署了,苹果芯片跑Ollama体验很好,不需要显卡就能跑7B模型,速度也能接受。
2 个赞
说一个进阶玩法:部署好 DeepSeek 之后,可以通过 OpenClaw 来调用本地 Ollama 模型。这样你就有了一个免费的、完全本地的AI助手,还能用上各种 Skill 技能扩展。
配置方法:在 OpenClaw 设置里把模型地址指向 http://localhost:11434 就行。Molili 也支持接本地 Ollama,这样你就可以在 Molili 的界面里用本地模型了,隐私和便利性兼得。
2 个赞
我部署了好几个模型对比过,推荐排名:DeepSeek R1 7B > Qwen 2.5 7B > LLaMA 3.1 8B。中文场景下 DeepSeek 和 Qwen 明显好于 LLaMA。