各位推荐一个 32G macbook air M5 可以跑的 moe 模型

27B/31B 甚至 35B 的 4bit 都可以, 测试了好久, 也下载了几十个了,都不太行, 感觉降智了, 这些刚出来的时候我这个配置能跑到 35tokens/s.

准备直接抄作业, 请给 huggingface 连接, 我的本地推理框架是 omlx, 感谢感谢.

有没有试过LM Studio里面那个Q4_K_M的版本,我16G的M1 Pro跑起来还行。

这种东西看参数的,之前下过一个27B的,跑起来跟智障一样。

是不是因为显存不够啊?我也是M5的Air但只有16G,不太确定32G能不能撑住35B的。

  1. 去HuggingFace搜“TheBloke/[模型名]-GGUF”
  2. 找q4_k_m或者q5_k_m的版本
  3. 用ollama直接pull也行,命令是ollama run [模型名]:q4_K_M

mark一下,同求一个能跑的,手头M3 Max试了好几个也感觉降智。

楼主说的“刚出来的时候”是指哪个版本啊?具体是哪个模型文件?我怀疑是量化方式变了,之前用q4_0现在很多都转q4_k_m了,速度可能不一样。

昨天刚在Reddit看到有人推NousResearch的Capybara-34B,说在32G的Mac上能跑,但我没试过链接你搜一下TheBloke应该就有GGUF的。

你们有没有觉得现在的模型越更新越回去了,我年初还能流畅跑个代码生成,现在同参数版本反应慢好多,不知道是模型问题还是框架问题。

又来了,这种帖子每个月都能看见,Mac用户总想用小飞机拉大炮,老老实实上服务器吧。

话说大家最近有看新出的M4芯片评测吗?据说神经网络引擎强了不少,不知道对跑本地模型有没有帮助。

感觉是量化方式变了,q4_0换成q4_k_m手感差挺多

ollama pull是真省事,比手动转模型方便

TheBloke停更后量化版选择就少了,得找新人接力

M5的32G跑27B GPU内存压得很紧

TheBloke的q4_k_m质量稳定,我常用

q4_k_m现在主流,速度比q4_0慢点但质量好不少

M5 Air跑35B现在确实吃力,量化版才有希望

M5 Air内存带宽撑35B本来就紧

32G撑35B的Q4勉强可以,速度别太指望