DeepSeek V4 Flash在5090上跑起来了 llama.cpp更新后一百万上下文可用了

之前V4 Flash在本地体验一般 卡顿明显。llama.cpp那波改动之后 明显顺了不少 我拿5090跑了下 配上百万级上下文 居然真能用起来 不是那种跑得动但推不动的样子。用的是Unsloth那版量化权重 配置我调了一阵 显存和上下文长度得平衡着来。给同样想在本地折腾长上下文的兄弟提个醒 先把llama.cpp更到最新 老版本白费劲

厉害了啊

更新前那卡顿 我差点弃坑

能本地跑长上下文 香 省API钱