混元新模型Hy3 preview上线了,姚顺雨回国后首作

腾讯混元的新模型Hy3 preview来了。这是他们团队重新搞了架构和基础设施之后推的第一个版本,首批发的模型尺寸不大,主打实用。

值得一说的是,这是姚顺雨回国加入腾讯后搞出来的第一个重要成果,按他说的“AI下半场”那套思路来,模型是在腾讯自家各种业务和复杂场景里打磨出来的,看重实际用起来的效果。

现在这模型已经在腾讯云、元宝、ima、CodeBuddy、WorkBuddy、QQ、QQ浏览器、腾讯文档、腾讯乐享这些地方上线了,微信公众号、和平精英、腾讯新闻、腾讯自选股、腾讯客服、微信读书这些也正在陆续跟上。

另外,Hy3 preview还支持接一些流行的开源智能体,比如OpenClaw、OpenCode、KiloCode这些,并且已经上架腾讯云的大模型服务平台TokenHub。

最近各家都在发新模型,千问的Qwen 3.6 Max Preview、月之暗面的Kimi 2.6,还有小米的MiMo-V2.5-Pro,现在腾讯这个混元基础大模型Hy3 preview也来了,到底怎么样?上手试试看。

测测它的智能体能力

姚顺雨是搞ReAct框架(智能体的核心逻辑)的,所以Hy3 preview在代码和智能体方面能力也有提升,算是跟上了智能体这波趋势。

在腾讯的AI办公助手WorkBuddy上,可以让它干代码开发、深度研究、产品管理、数据分析这些活儿。

比如,让它去查查关于DeepSeek融资的传闻,要求对比至少5个不同背景的权威信源,列出已知事实和矛盾点,还要给个信度评分。它能自己启动多步搜索,做完一长串推理后,系统地梳理出不同信源之间的矛盾,最后给出一份挺客观的调查报告,整个过程不用人插手。

再让它联网去联合国人口司拿数据,做个“全球人口结构变迁”的可视化分析。这是个涉及数据获取、清洗、分析和可视化的复合任务,Hy3 preview也完成得挺顺,最后输出了图表和分析文字。

测代码能力,让它生成一个“开心消消乐”的网页游戏。结果画面不错,逻辑完整,能跑起来,整体质量比预想的好。

聊聊家常,写写东西,基本功行不行?

腾讯混元这次升级主要讲实用,先跟它唠唠嗑

跟Hy3 preview吐槽说自己最近变笨了,它会耐心开解,说可能是睡太少、压力大或者刷短视频太多,还给了一些小建议。

聊到写稿没灵感,它能接着上下文聊,根据你当时的情绪调整回应的语气和深度,给出有针对性的建议。

还能提供情绪价值,变着花样夸人。

之前网上有些刁钻问题,比如“今年才知道,亲生父母结婚时候没有叫我,我很难过怎么办?”,很多模型都被绕进去了。Hy3 preview能敏锐地发现这里面的逻辑问题(子女还没出生),然后引导用户理清情绪,看起来常识推理和共情能力还行。

再来试试创意写作

之前NASA宇航员从飞船窗户看地球的那张图很火,我们让Hy3 preview为这图生成5条朋友圈文案。它会先分析图片氛围,选了孤独震撼、对地球的敬畏、人类渺小与伟大这几个点,生成不同风格的文案,有文艺的,有哲学的,挑一条就能直接用。

模仿文风方面,让它用欧·亨利的笔调写个短篇小说。

搜索能力方面,让它查查Meta为啥要强制收集鼠标键盘输入数据,它能很快引用权威信源,给出清晰、有据可查的回答。无论是查新闻、政策还是核实具体信息,整体表现都挺可靠。

底层重构与“AI下半场”

据介绍,Hy3 preview是一个快慢思考融合的MoE语言模型,总参数量295B,激活参数21B,上下文长度支持256K,兼顾实用和性价比。

混元团队这次主要是在底层重构上下了功夫,把很多基础工作做得更扎实,特别是预训练和强化学习的基建都重做了。他们在大版本更新上,没花太多精力去搞注意力机制、底层架构这些微创新,而是选了成熟的MoE路线,把资源和精力都砸在工程基座的稳固性上。

这意味着Hy3 preview在稳定性、数据吞吐效率、强化学习管线的良品率上,可能达到了新的工业级水准。

训练过程中,他们也强调了模型评估,加强了对自建评测基准的研究,这跟姚顺雨之前博客里说的思路一样(评估大于训练)。

姚顺雨在《大模型的下半场》里说过,现在大模型的“配方”(预训练+强化学习+算力扩展)已经很成熟了,具备泛化和解决难题的能力。下半场的关键在于提出问题:我们应该训练人工智能做什么?

因为现有通用模型配方太强了,花巨大精力做微调可能只带来5%的提升,所以评估变得比训练更重要。行业需要重构评估体系,设计出贴近现实世界的新任务和新范式,而不是单纯出更难的考题。

要在AI下半场混,从业者得转变思维,有点像“产品经理”的视角。得深入想:AI到底该为谁解决什么实际问题?又该怎么客观衡量它解决得好不好?

在这方面,腾讯有微信、游戏、广告、云服务这些国内甚至全球都很复杂的业务场景,他们自建的评测环境,必然更贴近真实业务里的难点。Hy3 preview的推出,可能已经在腾讯生态里搞出了一个能解决实际问题的生产力工具。

Hy3 preview是2026年1月底开始训练的,从训练到上线用了不到三个月。这是混元大模型从“读万卷书”到“行万里路”,尝试解决真实世界问题的开始。

Hy3 preview只是个起点,以后混元团队还想通过开发者和用户一起协作的方式,继续提升模型能力,让它能在真实场景和任务里持续进步。

mark一下,回头试试看代码生成能力怎么样。

搞了半天还是画饼?姚顺雨之前在Meta那套ReAct现在落地成什么样了也没见具体对比,光说能自己查资料做报告,误差率多少敢公布吗?我记着之前混元搞长文本分析可是出过岔子的。

代码那个消消乐demo有人跑通了吗?求个repo链接或者部署步骤,想直接拉下来玩玩看效果。帖子里截图倒是挺花哨的。

看起来挺实用的,我们小团队正好在选型。如果真像说的那样能在自家业务里打磨过,处理内部数据应该比通用模型强点。就是不知道API定价什么时候出来,还有早期有没有优惠。

不是,这帖子怎么又吹上个人了?姚顺雨回国首作…技术讨论能不能聚焦模型本身啊,架构升级具体是啥,TPP(腾讯自己的性能指标)提升了多少,token成本降没降,这些关键信息一个没有。放一堆产品截图和聊天记录有啥用,我们是来看技术评测还是看公关稿的?

消消乐demo的repo我也找了半天,好像目前还没公开,等等吧

我之前用混元老版本做报表自动化,老是卡在表格格式识别上,气得我直接换回了Claude。这次Hy3 preview说在办公场景打磨了,不知道有没有专门优化表格处理逻辑?有没有内测过的兄弟说说实际体验,比如丢给它一个合并单元格的Excel,它提取数据还乱不乱?

终于有支持流行开源智能体框架的了!我们实验室一直在用OpenClaw做原型,但之前混元的API兼容性不太好,每次都要自己写适配层,麻烦死了。如果Hy3 preview在TokenHub上能直接无缝接驳,那确实能省不少事。就等官方出详细的技术文档和接入案例了,希望别像上次那样文档写得云里雾里。

小白弱弱问一句,这个模型和之前说的混元Pro版本是什么关系呀?是完全替代还是并行的产品线?看名字又是Hy3又是preview的有点搞不清。

顶,等一个和Kimi 2.6的实测对比。

说实话,看到“在自家各种业务和复杂场景里打磨”这句话我就有点想笑。翻译一下:用腾讯内部海量用户数据狠狠训练了一波呗。隐私和安全问题怎么解决的?模型会不会记忆了用户的聊天记录然后泄露出来?这种闭源模型,它说效果好就好,你也没法验证。我还是更信任开源一点,至少自己能看。

刚在腾讯云后台看到了,确实上线了Hy3 preview的选项。手头有个活,用Agent自动处理客服工单并分类,之前试过几个模型效果都一般。我简单测了一下,给了它五条混合了文字、图片截图和用户情绪抱怨的工单,让它判断紧急程度和责任部门。结果比预想的好,尤其是那张模糊的截图里提到的错误代码,它居然能关联到已知的技术文档。不过样本还小,准备再跑几百条看看稳定性。如果真行,能省下我们不少人工预处理的功夫。

光说回国首作没意义,token成本和推理速度有没有具体数字

通稿就是这个味道 技术指标找官方文档去找

姚顺雨回国后首作 期待度直接拉满

消消乐demo我也想跑 还没找到repo链接