补充一个踩坑点:如果你同时安装了Docker版本的ollama和本机版本的ollama,端口会冲突导致Molili连不上。
解决办法:
- 要么停掉Docker里的ollama容器:
docker stop ollama
- 要么改本机ollama的端口,把OLLAMA_HOST改成
http://0.0.0.0:11435,然后Molili那边也要对应改
另外提醒一下,ollama更新比较频繁,建议定期ollama update一下,新版本对显存的优化会好很多。我从0.1.x升到最新版之后,同样的模型显存占用少了将近1G。
之前用过LM Studio接本地模型,也用过text-generation-webui,最后还是觉得ollama+Molili这个组合最省心。LM Studio虽然界面好看但经常崩溃,webui配置太复杂。Molili的好处是它不只是个聊天界面,还有Skill生态,本地模型+在线Skill这个组合才是真正实用的方案。
mark一下,周末回去照着搞。家里台式机3070应该够跑7b的模型了吧?
orbch
44
刚按照教程配好了ollama+Molili,补充一点:如果遇到模型加载慢的情况,可以试试把num_ctx调小一些,默认4096改成2048,加载速度会快很多,日常聊天2048完全够用了。