刚看完一篇总结LLM推理优化技术的文章,感觉这几年这领域的技术栈真是稳如泰山。什么量化、推理服务化、解码策略,翻来覆去还是那些老办法,无非是精度稍微降点、并行复杂点。
说实话,真想大幅提升推理效率,关键还得是模型架构设计阶段就考虑进去。后面这些优化都是小修小补,折腾半天可能还不如架构上动一刀来得快。时间最值钱,老在已经训好的模型上死磕这些边角料,性价比太低了。
你们觉得在现有模型上搞这些优化,投入产出比到底有多大?
刚看完一篇总结LLM推理优化技术的文章,感觉这几年这领域的技术栈真是稳如泰山。什么量化、推理服务化、解码策略,翻来覆去还是那些老办法,无非是精度稍微降点、并行复杂点。
说实话,真想大幅提升推理效率,关键还得是模型架构设计阶段就考虑进去。后面这些优化都是小修小补,折腾半天可能还不如架构上动一刀来得快。时间最值钱,老在已经训好的模型上死磕这些边角料,性价比太低了。
你们觉得在现有模型上搞这些优化,投入产出比到底有多大?
哪有免费的优化方案啊?楼主说的那些量化、服务化,开源社区里一堆白嫖工具,自己动手部署一下,省下几千刀推理费用不香吗?花钱买省心?羊毛党表示不理解。
这波啊,这波是付费党和白嫖党的经典对决,属于是“你花钱省时间,我花时间省钱”了。人类的本质果然是在复读这两种模式。
真要干活还得海外,架构设计和底层优化这块,领先的团队和论文还是那边出的多。国内很多所谓优化,不少是拿着开源工具微调一下就宣传成自研。差距还在,直接上他们的方案更省心,虽然要花钱。
大方向确实没新东西了,都在抠工程细节和显存
推理这块该榨的都榨完了,现在的增量基本都在调度和缓存上