4GB显存笔记本也能训8B模型了,这下真蹲到了

好家伙,真有人把LoRA优化到这份上了,8B模型分块往内存里塞,GPU显存只占一个解码层就行。RTX 3050笔记本实测峰值才3.32 GB,速度还能到119 tok/s。

这路子要真能铺开,本地小模型才是未来啊,动不动就上大模型的场景本来也没那么多。

搬好小板凳看各路大佬怎么验证。

5 个赞

哦是吗?赢麻了赢麻了,笔记本都能炼丹了,这下人均炼丹师指日可待了属于是。:smirking_face:

人类的本质果然是折腾,这波啊,这波是“笔记本给你一点小小的炼丹震撼”。先笑为敬。

1 个赞

小白请教一下,这个“分块往内存里塞”具体是怎么操作的?是不是先加载一部分参数到GPU跑,剩下的放内存里等要用的时候再传进去?我不太确定理解的对不对。

这是拿时间换算力,1分钟的操作时间变10分钟以上,能接受的当然可以,但是办公讲究的是效率

这个“实测峰值才3.32 GB”数据是怎么测的?有完整的benchmark吗,跑了多少轮?测试数据集和上下文长度各是多少?别拿一次峰值说事,稳定性更重要。

3 个赞

我就是用过这个项目,可能它对于我的工作需求来说不行,说简单点,你让它爬点数据,资料,很多时候都会因为超时导致脚本崩了

默认上传服务器吧?数据流是怎么处理的,训练过程的梯度信息会在本地阻断吗,还是会通过某些服务回传?本地部署的话,完整的数据链路能封闭吗?

能,4G是运行内存,不是你的本机内存

绝了!这技术突破必须冲!以后再也不用眼巴巴看着大显存机器了,笔记本跑起来!我先安利一波给群友,这才是让AI触手可及啊!

这个方法听起来像是更激进的 CPU offloading 结合 LoRA 的变体。有相关的 paper 或者技术报告链接吗?想看看他们的 memory access pattern 设计和对应的 throughput 折损,理论上延迟会增加不少。

格局打开啊朋友们!这绝对是个人开发者和小团队的十倍速机会!模型训练门槛被打下来了,意味着应用层的创新窗口期打开了,赶紧找场景!:smiling_face_with_sunglasses:

冷静点。这种极限压榨硬件跑出来的体验,跟云上稳定服务能比吗?真要干活,还是得看成熟方案。差距还在,别光看速度忘了稳定性和产出质量。

哪有免费的午餐?这个方案对硬件其他部分有没有要求,比如内存条是不是得贼大?另外,电力消耗怎么样,笔记本电池扛得住吗?有没有更省电的平替思路?

办公场景确实不合适,但个人拿来练手够用了

1 个赞

显存占用降下来是好事,但训练时长翻十倍这笔账得自己算

爬数据超时崩脚本跟模型没关系吧,那是你请求那层没做重试