腾讯混元的新模型Hy3 preview来了。这是他们团队重新搞了架构和基础设施之后推的第一个版本,首批发的模型尺寸不大,主打实用。
值得一说的是,这是姚顺雨回国加入腾讯后搞出来的第一个重要成果,按他说的“AI下半场”那套思路来,模型是在腾讯自家各种业务和复杂场景里打磨出来的,看重实际用起来的效果。
现在这模型已经在腾讯云、元宝、ima、CodeBuddy、WorkBuddy、QQ、QQ浏览器、腾讯文档、腾讯乐享这些地方上线了,微信公众号、和平精英、腾讯新闻、腾讯自选股、腾讯客服、微信读书这些也正在陆续跟上。
另外,Hy3 preview还支持接一些流行的开源智能体,比如OpenClaw、OpenCode、KiloCode这些,并且已经上架腾讯云的大模型服务平台TokenHub。
最近各家都在发新模型,千问的Qwen 3.6 Max Preview、月之暗面的Kimi 2.6,还有小米的MiMo-V2.5-Pro,现在腾讯这个混元基础大模型Hy3 preview也来了,到底怎么样?上手试试看。
测测它的智能体能力
姚顺雨是搞ReAct框架(智能体的核心逻辑)的,所以Hy3 preview在代码和智能体方面能力也有提升,算是跟上了智能体这波趋势。
在腾讯的AI办公助手WorkBuddy上,可以让它干代码开发、深度研究、产品管理、数据分析这些活儿。
比如,让它去查查关于DeepSeek融资的传闻,要求对比至少5个不同背景的权威信源,列出已知事实和矛盾点,还要给个信度评分。它能自己启动多步搜索,做完一长串推理后,系统地梳理出不同信源之间的矛盾,最后给出一份挺客观的调查报告,整个过程不用人插手。
再让它联网去联合国人口司拿数据,做个“全球人口结构变迁”的可视化分析。这是个涉及数据获取、清洗、分析和可视化的复合任务,Hy3 preview也完成得挺顺,最后输出了图表和分析文字。
测代码能力,让它生成一个“开心消消乐”的网页游戏。结果画面不错,逻辑完整,能跑起来,整体质量比预想的好。
聊聊家常,写写东西,基本功行不行?
腾讯混元这次升级主要讲实用,先跟它唠唠嗑。
跟Hy3 preview吐槽说自己最近变笨了,它会耐心开解,说可能是睡太少、压力大或者刷短视频太多,还给了一些小建议。
聊到写稿没灵感,它能接着上下文聊,根据你当时的情绪调整回应的语气和深度,给出有针对性的建议。
还能提供情绪价值,变着花样夸人。
之前网上有些刁钻问题,比如“今年才知道,亲生父母结婚时候没有叫我,我很难过怎么办?”,很多模型都被绕进去了。Hy3 preview能敏锐地发现这里面的逻辑问题(子女还没出生),然后引导用户理清情绪,看起来常识推理和共情能力还行。
再来试试创意写作。
之前NASA宇航员从飞船窗户看地球的那张图很火,我们让Hy3 preview为这图生成5条朋友圈文案。它会先分析图片氛围,选了孤独震撼、对地球的敬畏、人类渺小与伟大这几个点,生成不同风格的文案,有文艺的,有哲学的,挑一条就能直接用。
模仿文风方面,让它用欧·亨利的笔调写个短篇小说。
搜索能力方面,让它查查Meta为啥要强制收集鼠标键盘输入数据,它能很快引用权威信源,给出清晰、有据可查的回答。无论是查新闻、政策还是核实具体信息,整体表现都挺可靠。
底层重构与“AI下半场”
据介绍,Hy3 preview是一个快慢思考融合的MoE语言模型,总参数量295B,激活参数21B,上下文长度支持256K,兼顾实用和性价比。
混元团队这次主要是在底层重构上下了功夫,把很多基础工作做得更扎实,特别是预训练和强化学习的基建都重做了。他们在大版本更新上,没花太多精力去搞注意力机制、底层架构这些微创新,而是选了成熟的MoE路线,把资源和精力都砸在工程基座的稳固性上。
这意味着Hy3 preview在稳定性、数据吞吐效率、强化学习管线的良品率上,可能达到了新的工业级水准。
训练过程中,他们也强调了模型评估,加强了对自建评测基准的研究,这跟姚顺雨之前博客里说的思路一样(评估大于训练)。
姚顺雨在《大模型的下半场》里说过,现在大模型的“配方”(预训练+强化学习+算力扩展)已经很成熟了,具备泛化和解决难题的能力。下半场的关键在于提出问题:我们应该训练人工智能做什么?
因为现有通用模型配方太强了,花巨大精力做微调可能只带来5%的提升,所以评估变得比训练更重要。行业需要重构评估体系,设计出贴近现实世界的新任务和新范式,而不是单纯出更难的考题。
要在AI下半场混,从业者得转变思维,有点像“产品经理”的视角。得深入想:AI到底该为谁解决什么实际问题?又该怎么客观衡量它解决得好不好?
在这方面,腾讯有微信、游戏、广告、云服务这些国内甚至全球都很复杂的业务场景,他们自建的评测环境,必然更贴近真实业务里的难点。Hy3 preview的推出,可能已经在腾讯生态里搞出了一个能解决实际问题的生产力工具。
Hy3 preview是2026年1月底开始训练的,从训练到上线用了不到三个月。这是混元大模型从“读万卷书”到“行万里路”,尝试解决真实世界问题的开始。
Hy3 preview只是个起点,以后混元团队还想通过开发者和用户一起协作的方式,继续提升模型能力,让它能在真实场景和任务里持续进步。