导航菜单
首页 OPC项目 北京OPC OPC完全指南 AI资讯 AI应用市场 OPC市场 OPC导航 工具推荐 关于

# 从Transformer到RL:大模型训练范式正在被重写

摘要

大模型技术正经历一场从预训练为中心到强化学习主导的范式迁移。在WAIC 2025的圆桌论坛上,阶跃星辰张祥雨、上海AI Lab陈恺、智谱王绍兰、第四范式陈雨强与英伟达Neil Trevett展开了一场30分钟的尖锐辩论,直指大模型训练的四大核心命题:预训练与强化学习的平衡、Transformer架构的边界、合成数据的双刃剑效应,以及基础模型与应用落地的路线之争。这些分歧不仅关乎技术路线,更映射出AI产业未来的走向。


一、范式转折:从预训练到强化学习的必然迁移

"大模型技术发展到今天,可以说是在繁花似锦的背后,我们也进入到了一个十字路口。"商汤科技首席科学家林达华在主持圆桌时的一番话,准确概括了当下大模型领域的集体焦虑。

这场焦虑的源头,是OpenAI一年之内完成的一次范式切换。从GPT-4o到o1,OpenAI将训练范式的重心从预训练转向了强化学习后训练(Post-Training)。o1技术博客中展示的那张经典图表——准确度与测试时计算之间存在对数线性关系——传达了一个令人不安的信号:未来,强化学习计算可能会取代预训练,成为模型能力提升的主导力量。

阶跃星辰首席科学家张祥雨给出了技术层面的深刻剖析。他承认"预训练→监督微调→RL"这套范式的合理性——预训练本质是语料压缩,在模型内部形成紧凑的世界知识表示。但问题在于,预训练基于Next Token Prediction,这本质上是"行为克隆"。而行为克隆有一个致命缺陷:"无论你用了多少数据、模型做得多大,它都很难真正建立起目标导向的推理能力。"推理要求模型找到一条逻辑自洽的因果链,而非复现已有内容,这正是RL介入的逻辑原点。

但张祥雨同时指出,当前的RL仍局限于数学、代码等确定性反馈场景。如何将RL扩展到能够接受自然语言反馈——比如"这个回答逻辑不通"或"这个观点不够有说服力"——将决定这一范式的天花板。

上海AI Lab陈恺则从另一个角度补充:RL之所以"大放异彩",是因为它站在预训练的肩膀上。预训练提供的冷启动能力,让RL有了探索多种可能性的空间。他同时发出警告:RL的成功向基础设施提出了严峻挑战——如果未来RL依赖更多环境交互反馈,算力需求将指数级攀升,这可能是比算法本身更难逾越的障碍。

从行业动态来看,这一范式迁移已然加速。2025年7月,中国AI公司密集发布推理模型:阿里的Qwen3推理模型、智谱的GLM-4.5、阶跃的Step 3均将推理能力作为核心卖点。阶跃星辰更宣称,Step 3在国产芯片上的推理效率最高可达DeepSeek-R1的300%。训练范式的迁移,正在重塑从算法研发到硬件适配的每一环。

二、Transformer vs 新架构:RNN会卷土重来吗

2017年至今,Transformer统治AI领域已八年。从GPT-2到ChatGPT再到DeepSeek-V3,模型能力跨越阶梯式提升,但底层架构惊人地稳定。然而,随着参数量飙至万亿级、上下文窗口拉伸至百万Token,自注意力机制的O(n²)扩展性正逼近物理极限。

圆桌讨论中,张祥雨提出了一个颇具颠覆性的判断:"模型架构并不是最重要的决定因素,架构是为系统和算法服务的。Transformer架构本身没有问题。"但他话锋一转——问题在于,当算法向RL迁移、应用场景从推理时代转向智能体时代时,对架构的底层需求发生了根本变化。

智能体的核心特征是"自主性",它必须能够主动与环境交互并从中学习。这要求模型具备"无限流或无限上下文"的建模能力。在这种需求下,张祥雨认为传统Transformer已遇到阻碍,"像是传统的RNN架构,未来短时间内可能会重新成为下一代主流架构的设计考虑之一。"

这不是张祥雨一个人的直觉。业界已经在行动。Mamba系列通过状态空间模型(SSM)实现线性复杂度的长序列建模;RetNet、RWKV融合了RNN的记忆优势与Transformer的并行性;AI21 Labs的Jamba则直接走混合架构路线。Thread Inference Model(TIM)甚至提出了通过分层子任务实现无限记忆和结构化推理的蓝图。

但陈恺在讨论中保持谨慎——他虽未在架构问题上直接表态,但对基础设施的反复强调暗示了一个现实判断:架构创新不能脱离工程约束。强化学习已经让算力捉襟见肘,如果新架构无法在工程效率上证明自己,再优雅的理论也会被算力账本淘汰。

一个有趣的注脚来自DeepSeek V3:它证明了即使只优化现有Transformer架构,也能大幅度降低成本,而性能并不逊色。这或许是当前更务实的答案——架构创新是方向,但优化现有系统仍是大规模部署的现实选择。

三、数据之争:合成数据是解药还是毒药

如果说架构是骨骼,数据就是血液。而当下,这具巨人的造血系统正面临衰竭风险。

有研究预测,如果LLM保持现有发展势头,到2028年,已有数据储量将被全部耗尽。高质量人类生成语料正以肉眼可见的速度走向枯竭,而版权与隐私限制进一步收紧了可用数据的阀门。合成数据,由此被推上风口浪尖。

英伟达全球开发者生态副总裁Neil Trevett在圆桌上坦承,英伟达在图形生成和物理仿真方面也面临数据困扰——尤其是那些无法获取、获取成本高昂或涉及伦理风险的数据。他的解决方案是物理仿真:通过构造真实世界难以采集的边缘案例(交通事故、机器人异常应对),为模型训练提供补充数据。但他同时警告:"不能完全依赖合成数据。生成模型本身可能存在偏差、误差或盲区,需要建立真实世界的验证机制和反馈闭环。"

这个警告有学术支撑。2024年《自然》封面论文的发现令人警惕:如果放任大模型用自身生成的数据进行训练,AI可能在短短几代内将原始内容迭代成无法挽回的胡言乱语——这就是所谓的"模型崩溃"。

智谱总裁王绍兰则直指问题的另一面。他认为所谓"数据耗尽"的说法有被夸大之嫌。"互联网数据耗尽是一个量的问题,但更关键的是质的问题。"当初大模型海量吞入的互联网语料,质量是否真的够好?这本身就需要重新审视。他进一步指出,行业数据还大量沉淀在产业中未被利用,大模型要真正落地,必须用行业数据进行预训练。

王绍兰还抛出了一个在现场引起掌声的建议:对于行业中非敏感、非涉密的关键数据,应考虑在行业内部建立数据共享机制或联盟组织,为大模型的应用落地提供更可靠的"弹药库"。这个提议点破了当下的尴尬——高质量数据的最大储量不在互联网,而在被围墙隔开的产业孤岛中。

结合三位嘉宾的观点,一幅数据策略的完整图谱浮现:合成数据是补丁而非万能钥匙,其有效性的前提是真实数据的高质量基座和严格的验证闭环;而更大维度的突破,在于打破数据孤岛,让沉积在行业中的高质量数据流动起来。

四、基础模型与Agent:向左向右从未是单选题

2025年最明显的行业趋势是什么?基础模型研发速度放缓,Agent应用集中爆发。

OpenAI推出Operator和深度研究模式,智谱发布AutoGLM沉思,Manus推出并行Agent产品Wide Research——国内外厂商不约而同地将Agent作为应用落地的核心形态。王兴兴在WAIC上坦言:"现在我很多代码都偷懒不写了,交给大语言模型来写。去年的成功率还不高,而今年生成一个抽奖软件,成功率可以达到90%以上。"

这种趋势将每个AI公司推向一个两难抉择:是把资源继续砸向基础模型研发以追求AGI,还是转向Agent应用落地以构建商业闭环?

智谱王绍兰的回答斩钉截铁:"两者并不冲突。"

他给出了一个形象的类比:如果参照自动驾驶的分级,当前大模型大致处于L3阶段——已完成预训练、对齐与基础推理,刚刚进入具备反思与沉思能力的深度推理阶段。"即使是OpenAI即将发布的GPT-5,与AGI仍有距离。"基础模型的探索必须继续,但模型的价值"不应只停留在纯理论研究层面,大模型要用起来,直至变成生产力革命的那一天。"

第四范式陈雨强的视角更偏向产业务实。他强调在技术高速迭代的当下,最关键的能力是"用好已有的开源或闭源模型",而不是重复造轮子。这个判断在2025年7月得到了充分印证——开源生态正在以前所未有的速度追赶闭源:Kimi K2以1TB参数规模成为全球最大开源模型,月之暗面将其全面开源;阶跃星辰开源Step 3;阿里的Qwen3-Coder在编程基准上匹配Claude Sonnet 4。

基础模型与Agent之间,正在形成一个正向循环:更强的基座模型催生更强的Agent,Agent在落地中产生的反馈数据又反哺基座模型的迭代。正如王绍兰所言,这是一道"从未是单选题"的命题——真正的分水岭不在于选哪条路,而在于是否具备同时走两条路的能力与决心。

五、结语

WAIC 2025这场30分钟的圆桌,"吵"出了当下大模型行业最核心的分歧,也"吵"出了一些方向性的共识。

共识在于:预训练不会被抛弃,但RL将占据越来越大的比重;数据策略必须从"规模驱动"转向"质量驱动",合成数据与真实数据需要形成闭环验证而非替代关系;基础模型的探索与Agent的落地并行不悖,开源生态的爆发正在加速这一进程。

分歧同样真实:Transformer是否到了需要被替代的时刻?合成数据能走多远?行业数据共享机制能否落地?这些问题没有标准答案。

但可以确定的是,大模型训练范式正在被重写。从预训练中心到RL主导,从单一Transformer到混合架构探索,从数据规模驱动到数据质量驱动——每一个方向性的调整都在重新定义AI行业的竞争格局。而WAIC 2025这场属于顶级科学家与产业领袖的"吵架",或许正是这个改写进程中最诚实的一幕。


*本文仅代表作者个人观点(仅供参考)*

来源:创客OPC原创整理

上一篇
全球大模型7月激战:Grok 4、Kimi K2、Qwen3...
下一篇
中国AI开源生态崛起:从DeepSeek到Qwen3,开源如...