MiniMax开源了个400多亿参数的巨无霸模型,能写代码还能看图!

刚刷到MiniMax把他们最新的M3模型开源了,参数规模直接飙到428B,虽然激活参数是23B,但这体量也够吓人的。关键是这模型好像是个“六边形战士”,不光能写代码(SWE-Bench Pro得分59%),还能当智能体操作终端,甚至原生支持多模态能处理图片!最让我惊讶的是它那个1M token的上下文窗口,用了个叫稀疏注意力的技术实现的,这得吃掉多少显存啊……

感觉最近开源大模型的竞争越来越白热化了,各家都在拼命堆参数、拼能力。MiniMax这次直接把看家本领拿出来开源,魄力不小。我挺好奇他们说的那个MiniMax Code工具和API平台用起来到底怎么样,是不是能真的降低开发门槛。

不过话说回来,模型这么大,对我们普通开发者来说,就算权重开源了,有没有足够的算力去跑起来都是个问题。难道以后都得靠云API了?大家觉得这种超大参数模型的开源,对我们实际做项目的人来说,最大的价值和挑战分别是什么?

MiniMax API到底啥价格啊?为啥官网只写申请不写具体数字,是还在内测还是说打算按调用量阶梯收费?有没有已经拿到试用权限的老哥透露下。

这东西就那样,别指望自己部署。

mark,先收藏了,回头再看。

稀疏注意力具体是怎么实现的?帖子里就提了一句,是类似Mixture of Experts那种路由机制吗,还是完全不同的路子?有没有论文或者技术报告链接可以看看?

上周正好用他们的测试接口跑过一个代码补全任务,确实挺猛的。但生成速度感觉不算特别快,可能跟网络有关系。自己部署的话,估计光是加载模型就得等半天,对硬件要求太高了,个人玩家基本不用想。

又来这种帖子了,动不动就几百亿参数,吓唬谁呢。跑分高有啥用,实际用起来还不是一堆bug,到时候debug的时间比写代码的时间还长。

我主要关心那个1M的上下文窗口,如果真能稳定支持,处理长文档和代码库就方便多了。不过实际有效长度有多少,会不会后半部分就开始胡言乱语了?之前试过几个号称长上下文的,效果都不太行。

这周末准备试试他们的Demo,看看图片理解能力到底怎么样。感觉现在多模态模型都吹得天花乱坠,一用就发现连图里几个杯子都数不清。

同问,有没有已经用上的兄弟聊聊体验?另外,最近天气不错,适合跑模型,散热压力小点。

四百多亿激活才二十几亿,这设计挺聪明,本地基本别想了太大

长上下文我也最在意,号称1M但后半段容易开始胡说

长上下文标称很大没用,得看有效长度,很多模型过半就开始飘了

我也跑过他们的测试接口,补全质量不错就是速度一般,自部署硬件劝退

428B激活才23B,稀疏路由玩得溜推理成本能压不少

四百多亿参数自己部署基本没戏,光显存就劝退普通人

四百多亿激活才二十三亿,这种MoE设计现在基本是主流了

小白问一下,这么大的模型,如果我想在本地用,是不是得买好几张4090才够啊?不太确定……

他们API我申请到了,是阶梯计价,量大单价降,不过得排队审核

428B体量开源是猛,但本地部署对显卡要求太劝退