导航菜单
首页 服务 OPC项目 AI资讯 AI应用市场 OPC市场 OPC导航 工具推荐 关于 OPC城市 北京OPC 上海 广州 深圳 杭州 注册指南 OPC完全指南 AI副业
⚡ 创客OPC ← 返回资讯

在基础模型训练配方日趋封闭的当下,斯坦福大学基础模型研究中心(CRFM)主任 Percy Liang 领衔的 Marin 项目,正在做一件反潮流的事:把一场十亿美元量级的模型训练,变成一场全程公开的科学实验。2026 年 8 月,团队正式启动 Marin 535B-A23B 的“主模型训练”,11 台 NVIDIA GB200 NVL72、约 3 个月周期、18.75 万亿 tokens——这不是又一个“开放权重”模型,而是一次“开放训练全程”的范式试验。

一、规模拆解:535B MoE 的硬核配置

Marin 535B-A23B 的核心是一个 MoE 架构:535B 总参数、约 23B 激活参数,48 个 Transformer Block、384 个专家、Top-8 路由加 2 个共享 SwiGLU 专家,隐藏维度 6144、48 个注意力头。它采用 80% 预训练加 20% 中期训练的阶段划分,全程约 2.7 乘以 10 的 24 次方 FLOPs——这是迄今规模最大的公开预训练 run,超越 BigScience 的 BLOOM 176B。

工程布局同样讲究:64 路专家并行(EP64)被限制在每个 72-GPU 机架内部,11 个机架互为数据并行副本,全局 batch 为 11264 序列乘以 4096 tokens。把专家并行限定在机架内、让机架间只做数据并行,是典型的“通信换算力”设计——高带宽域内做最重的通信,跨机架只传梯度,大幅降低对网络带宽的依赖。

二、透明度机制:把训练黑箱变成开放实验室

Marin 与以往“开源模型”的本质区别,在于它开放的不是结果,而是整个科学旅程。数据构成每小时更新,可在 Google Cloud 存储桶查看,连领域配比调整和 commit message 都一并公开;实时 loss、模型状态、中间预测在 Weights & Biases 上实时可见;所有配置、代码、实验设计与技术讨论汇聚在 GitHub Issue 8435 这个工程总控台。

更关键的是它建立了一套“开放实验室”流程:先在 GitHub Issue 预注册实验目标与假设,再提交 PR 提供可复现代码,实验执行后结果汇总到 W&B report,所有成功、失败、中途修改的痕迹都被完整记录。研究者可以像参与开源软件一样,看 Issue、提交代码、Review、复现 Bug——这是以往任何前沿模型训练都不具备的协作机制。

正式训练之前,团队还跑了一套 4 级缩放梯(Scaling Ladder),从 1.6B-A61M 逐级到 27.7B-A1.2B,用 926B tokens 的小成本实验提前踩坑、拟合 loss 与规模的关系,从而对主模型每个 checkpoint 的 loss 做“在轨预测”。社区也真的参与进来了:有网友发现第约 500 step 附近 norms 出现峰值,最终定位为 MoE 中 router_bias 这一硬编码偏置所致——这种实时协查,在封闭训练时代根本无法想象。

三、工程亮点:为公开训练自研的硬核技术

从 TPU 转向 GB200 GPU 集群,Marin 团队遭遇的第一个障碍是:JAX/XLA GPU 环境下找不到现成的高性能专家并行方案。他们于是自行实现了专家并行,并配套了三个值得关注的创新:LatentMoE 在 dispatch 前把 token 表示从 6144 维压缩到 3072 维,让专家 all-to-all 传输字节减半;直方图分位数路由器通过施加零均值 bias 平衡专家选择,而不改动路由器梯度;容量因子 1.15 加三波静态专家调度,约束计算与传输缓冲区。此外还有务实的应急预案:若前 25% token 预算内出现硬件故障或利用率下降,团队会缩短最终 token 量并重调学习率衰减与数据配比,而不是机械维持原计划——公开训练的“透明度”甚至包括公开自己的容错策略。

四、对比分析:从开放权重到开放配方

把 Marin 放进开源谱系里看,坐标非常清晰。Llama、Gemma 只开放权重,训练数据、代码、日志一概保密;OLMo、BLOOM、Pythia 开放了数据、代码与检查点,但仍是“产物开放”;Marin 则进一步开放了流程与失败记录,让社区能参与提出实验、评审、甚至运行实验。从“开源”到“开实验室”,这是一次质的跳跃。吴恩达公开力挺,称 Marin 是当下捍卫 AI 开放性的“珍贵示范”——它不仅开放模型,更公开了数据、训练配方与实验流程。

五、对开源社区与开发者选型的深远意义

对开源社区而言,Marin 最大的贡献是把“训练”从黑箱变成可学习、可复现、可批判的公共知识。以前中小团队面对前沿模型只有两个选择:要么信任厂商的 benchmark,要么自己烧钱踩坑。现在,Marin 的实时 loss 曲线、数据配比调整记录、工程决策讨论,都是免费的教学材料——一支 20 人团队完全可以照着 Marin 的公开日志,用 1/100 的算力复刻出“缩小版”训练,避开它已经踩过的坑。

对“一人公司开发者”和独立开发者来说,Marin 的意义则更实际。其一,它提供了可靠的选型参考:一个 535B-A23B 量级的 MoE,激活参数只有 23B,这意味着开源生态很快会出现能在消费级硬件上运行的蒸馏或量化版本,中等规模的 agent 应用可以按“激活参数”而非“总参数”来做成本预算。其二,它证明了开源社区可以独立完成前沿规模的训练组织——11 台 GB200 的算力并非只有巨头能调度,开放协作模式正在降低前沿模型的门槛。其三,训练透明度本身就是一种信任资产:当你要把模型接入商业产品时,能审计训练数据与流程的模型,在合规与风险控制上天然优于黑箱权重。

六、结语

Marin 535B-A23B 的训练还在进行中,最终权重能否达到前沿水平尚待观察,但它已经完成了一次更重要的验证:模型训练可以像软件工程一样开放协作,实验失败可以公开讨论,训练曲线可以成为公共知识。当 OpenAI、Anthropic 们的训练室大门紧闭时,Percy Liang 团队选择把整间实验室的窗户全部打开——无论这 535B 参数最终收敛到什么水平,这种“公开科学”的姿态本身,就已经在重塑开源社区对“前沿”的定义。

本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理

微信搜一搜「北京安迪哥OPC」
上一篇
Perplexity Portable Computer 深...
下一篇
AI 前沿资讯:OpenAI 发布 Astra,249 页手...
需要落地支持?

从网站 / 小程序开发到 AI 工具链企业培训,提供全栈交付与落地方案;也可以先看看一个人如何用 AI 工具链撑起专业级交付。本页内容整理的是一线实践,具体项目按需评估。

查看服务与报价 → AI 工具链 + FDE 实战 →