一、事件速览:一次“技术+价格+生态”的三连击
8月28日,腾讯混元正式发布并开源新一代旗舰大模型 Hy4 preview。这并非一次普通的版本迭代:总参数 770B、激活参数 49B、上下文突破 100 万 token,同步牵手沐曦、燧原推进国产 GPU 适配,并以 WorkBuddy/CodeBuddy 双周免费活动推动应用落地。模型已上线腾讯云 TokenHub、OpenRouter,以及元宝、ima、WorkBuddy 等产品线,采用 Apache-2.0 协议开放权重。
同一天,行业并不平静:智谱 GLM-5.3 权重落地、Anthropic 发布 MHS 硬件标准、OpenAI 曝光 Astra 多智能体系列。腾讯混元选择在这一天发布,显然是有意将火力对准“开源模型第一梯队”的争夺战。
二、技术亮点拆解:从参数到上下文的三个硬指标
1. 770B 总参 / 49B 激活:MoE 路线的“开源军备竞赛”新刻度
Hy4 preview 采用混合专家(MoE)架构,总参数 770B 但每次推理仅激活 49B,相当于每 token 只需驱动约 6.4% 的参数。这个配比直接对标当前开源旗舰的密度竞争——智谱 GLM-5.3 总参 753B(Flash 版 320B/18B 激活),同为 MoE 路线。
对开发者而言,49B 激活意味着单卡或中小规模集群即可部署,相比同代闭源旗舰动辄数百 GB 显存需求,本地化与私有化部署的门槛显著降低。这与 GLM-5.3-Flash 全程运行在国产 AI 芯片上的思路殊途同归:开源 MoE 正在成为国产算力与中小开发者之间的“最大公约数”。
2. 1M 上下文:从“能读一本书”到“能读整个代码仓库”
上下文从主流旗舰的 128K~256K 跃升至 1M token,量级变化带来的是质变级的应用场景:
- 代码工程:完整加载大型代码仓库、跨文件依赖追踪、全量代码审查成为可能,不再依赖 RAG 的截断式检索;
- 长文档分析:整本技术手册、全套合规文档、完整法律合同可一次性纳入,规避分块处理导致的上下文碎片化;
- Agent 任务:长时程自主执行时,多轮工具调用与中间状态可长期驻留上下文,减少“遗忘”导致的重复劳动。
值得注意的细节:腾讯宣称 Hy4 preview 在软件工程、游戏、金融、安全等多个领域的专家数据上做了专项训练。这意味着 1M 上下文不是“硬塞进窗口”,而是配合领域数据做深度适配,工程含量高于单纯扩窗。
3. 163 名专家盲测:46.8% 胜率如何解读
腾讯混元组织了 163 名内部专家对 203 个工程任务进行盲测,Hy4 preview 综合表现“略优于”GLM-5.3 和 Kimi K3:胜率 46.8%、平局 12.8%、负率 40.4%。
解读这个数字要谨慎:胜率未过半,说明在工程任务上与最强开源竞品处于同一梯队、互有胜负,而非碾压式领先;但 46.8% vs 40.4% 的胜差在 203 个任务样本下已具备统计意义。内部盲测的天然局限在于样本来源单一(腾讯内部工程场景),其结论更适合解读为“工程场景下的竞争力锚点”,而非普适 benchmark 的替代品。
三、定价与生态策略:一场“以价换量、以免费换反馈”的组合拳
1. API 定价:输入 6 元 / 输出 18 元,缓存命中 0.3 元
换算下来,输入约 0.84 美元/百万 token、输出约 2.5 美元/百万 token,处于开源大模型商业化的“平价款”区间,显著低于 Claude Sonnet 5 的 2/10 美元定价(8月31日还将上调至 3/15 美元),也低于多数同级闭源旗舰。缓存命中 0.3 元/百万 token 的定价尤其激进——低至输入价的 5%,这在长上下文场景下具有放大效应:1M 上下文的重复查询(如固定代码库反复问答)成本将被大幅摊薄,鼓励开发者把“长上下文常驻”用起来。
2. WorkBuddy/CodeBuddy 双周免费:收集真实反馈的“数据飞轮”
WorkBuddy/CodeBuddy 面向用户开展为期 2 周的限时免费,此前 Hy3 的免费期则延长至 9 月 30 日。这不是简单的促销:免费窗口期恰恰是模型收集真实用户偏好数据、验证 Agent 场景长尾需求的最佳时机。在 1M 上下文 + 双 Agent 工具组合下,腾讯能拿到“开源模型在真实生产力工具中的行为数据”,这是纯 API 调用数据难以替代的。
3. 牵手沐曦、燧原:国产 GPU 适配的战略卡位
在 AMD 同日发布 ROCm 10.0、国产算力生态加速成熟的背景下,腾讯混元同步完成沐曦、燧原的适配,意图明显:一是对冲海外 GPU 供给的不确定性,二是为政企客户提供“模型+国产算力”的一站式方案。对开源社区而言,这也意味着 Hy4 preview 的权重将更容易在国内算力平台上跑通,降低部署摩擦。
四、递归自我改进闭环:最值得关注的技术信号
此次发布中最具想象力的部分是:Hy4 preview 首次参与自身研发全链路,包括训练方法、数据策略、评估体系和底层算子的自动优化——模型提出方案、运行实验、依据结果迭代,初步形成“递归自我改进闭环”。
横向看,Anthropic 的自动化对齐研究员已跑赢人类基线,Google DeepMind 也开始了前沿模型双盲评测。腾讯混元把“模型写代码改进自己”从 demo 推进到训练链路的关键环节,尽管目前仍是“初步形成”,但其战略指向明确:下一阶段开源模型的竞争,将从参数与 benchmark 的比拼,转向“自我进化效率”的比拼。对开发者而言,这意味着开源模型的迭代周期可能被进一步压缩,今天部署的模型可能在数周内就被“自我改进”后的版本取代。
五、对 OPC 与开发者的影响
1. 开源许可与部署自由度
Apache-2.0 协议延续了腾讯混元一贯的开源姿态(此前 Hy3 已开源),商业使用、修改、再分发均无合规障碍。对 OPC(开放源码与开发者社区)而言,770B 权重 + 1M 上下文 + Apache-2.0 的组合,直接为“私有化部署旗舰级模型”提供了新选项——此前这一档位主要由闭源 API 或受限许可证模型占据。
2. 开发者工作流的三个实操影响
- 代码库级智能体:1M 上下文使“整仓理解”成为 Agent 的默认能力,CodeBuddy 等工具可从“补全代码”升级为“跨模块重构 + 全量审查”,长时程编码任务的可靠性与上下文预算矛盾将明显缓解;
- 成本结构重构:输入 6 元/百万 token 的价格 + 0.3 元缓存价,使“把整份业务文档/整个代码库常驻上下文”从奢侈变为常规操作,RAG 方案在部分场景可让位于直读;
- 国产算力部署:沐曦/燧原适配完成后,政企与高校开发者可在国产芯片上跑通旗舰级开源模型,数据合规与算力供给两条线同时闭环。
六、结语
Hy4 preview 的发布,本质上是腾讯混元在“开源旗舰”赛道上的一次全面加注:技术端以 770B/49B 与 1M 上下文卡位参数与能力高地,商业端以激进定价与双周免费构建数据飞轮,生态端以国产 GPU 适配打通供给链路,技术叙事端以“递归自我改进闭环”锚定下一代竞争维度。
对开发者的启示也很直接:开源旗舰模型的能力上限与价格下限正在同步刷新,且迭代速度正在从“季度级”走向“周级”。当模型开始参与改进自己,留给开发者“观望”的时间窗口只会越来越短——尽早把 1M 上下文与 MoE 架构纳入技术选型评估,比纠结 benchmark 上的几个百分点更有价值。
本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理