2026年8月20日,一个名为"stealth/ox-alpha"的匿名模型悄然上线OpenRouter,没有发布会、没有技术报告、没有公司署名。但两天之内,它就让整个AI圈炸开了锅:独立测试显示,它在DeepSWE基准上Pass@1达到80%,优于Claude Fable 5与GLM-5.3;更令人浮想联翩的是,它的视频编码器与分词器指纹,高度指向智谱尚未发布的多模态旗舰。
一、硬核数据:一个匿名者的"登顶"
先看规格。OxAlpha支持文本、图像、视频三种模态输入,上下文窗口高达104.8万token(约百万级),最大输出13.1万token,定位明确指向长周期编码、智能体工作与生产级任务;发布方宣称每日可处理100万亿token吞吐,且整整一周完全免费,限流宽松到接近"几乎无限使用",免费期间不保留用户数据。这样的规格与手笔,远超一般匿名试水。
再看成绩。独立研究人员Ben Davis的测试显示,OxAlpha在DeepSWE基准Pass@1达80%,优于Claude Fable 5与GLM-5.3;在Kingbench排行榜上拿到87.5分,紧追GLM-5.3的91.25分——考虑到GLM-5.3是8月14日刚发布的编程专模,一个匿名模型能以如此逼近的成绩出现,本身就是强烈信号。
二、技术指纹:为什么指向智谱
社区很快展开指纹比对,结论惊人地一致:OxAlpha的视频编码管线、分词器数学特征、字符级响应风格,都与智谱(Z.ai)的GLM系列高度相似;Ben Davis更是直言自己"99%确定"该模型来自智谱,尽管官方尚未确认。
逻辑上也能自洽。公开版本的GLM-5.3暂不支持原生视频能力,而OxAlpha主动宣传多模态输入——这正符合"智谱未发布的升级版多模态GLM"的画像。智谱有过匿名试水先例:此前曾用"PonyAlpha"代号测试GLM-5。而其他候选实验室被逐一排除:DeepSeek虽有"HunterAlpha"试水传统,但近期因算力紧张上调V4-Flash价格,且上下文与分词行为与OxAlpha明显不同;其他实验室的政策边界与训练数据特征,也更指向本土模型。
三、算力佐证:谁养得起百万级上下文免费跑
OxAlpha最反常识的地方,是"每日100万亿token + 一周全免费"的成本结构。能支撑这种吞吐的实验室屈指可数。智谱恰好具备条件:已运营多个万卡集群,并刚投运一座吉瓦级数据中心,理论上具备一天处理100万亿token的能力。当模型能力、技术指纹与算力底座三条线索交汇,"智谱未发布旗舰"的推断便从猜测升级为高置信度判断。
四、匿名发布的动机拆解
匿名试水并非新鲜事。过去一年,多家实验室习惯用匿名"Alpha"代号在第三方平台投放未发布模型:测试真实负载、收集反馈、避免过早引发竞争对手关注。OxAlpha把这一策略推到了新高度——用近乎无限的免费额度,换取大规模真实使用数据。
这背后是一套精明的商业逻辑:其一,真实流量是任何内测都替代不了的压测环境,百万级上下文模型的稳定性需要海量并发验证;其二,开发者用脚投票的数据(哪些任务被高频调用、哪些场景吃香)是下一代模型训练的免费情报;其三,若模型表现惊艳,免费窗口本身就是一次"零成本宣发",窗口期结束、正式版本上线时,用户迁移成本已天然形成。8月27日的免费截止日,正是这场高调实验的收网时刻。
五、对编程Agent竞争格局的影响
OxAlpha出现的时点耐人寻味。同一周内:OpenAI Codex周活用户突破2000万并全面开源Codex Harness;DeepSeek发布实验性视觉模型V4-Flash-Vision-Exp;智谱GLM-5.3以CyberGym漏洞识别84.5%的成绩刷新编程安全基准。编程Agent已成为大模型竞争最激烈的正面战场,而OxAlpha的匿名亮相揭示了一个新趋势:身份不再是能力门槛。
当模型可以匿名上线、凭DeepSWE 80%的Pass@1直接叫板头部闭源产品时,竞争的焦点从"谁发布的"转向"能不能稳定服务"。对开发者而言,这是难得的红利期——百万级上下文加多模态,正好覆盖复杂工程任务;免费窗口意味着可以零成本验证其真实水平。对行业而言,它再次证明:算力储备与模型迭代速度,才是竞争的关键变量。
六、结语
无论OxAlpha最终是否确认为智谱的下一代GLM,它都已经把"免费高吞吐试水"做成了一次教科书级的公开实验。匿名身份让模型自己说话,真实流量让能力无处遁形。可以预见,这类匿名发布会越来越常见:实验室用真实数据换迭代速度,开发者用免费额度换前沿体验,而真正决定胜负的,始终是模型落地后的长期表现与可持续服务能力。8月27日之后,答案自会揭晓。
本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理