2026 年 8 月 7 日,Sebastian Raschka 的 LLMs-from-scratch 在 GitHub 上突破 100,000 Star。一个教人"从零手写大语言模型"的开源仓库能做到十万级星标,本身就是值得拆解的现象。它不只是一个教程,更像一面镜子:照出了整个 AI 社区在学习方式上的集体转向——越来越多的人不想再满足于"调 API、跑框架",而是想真正理解模型内部发生了什么。
一、十万 Star 意味着什么
在开源世界里,一万 Star 已经算明星项目,十万 Star 则属于金字塔尖的极少数,很多被广泛使用的生产级框架也只有数万 Star。LLMs-from-scratch 靠"教学"达到这个量级,说明受众远不止研究员——大量工程师、学生、转行者都在跟进。这侧面反映一个趋势:LLM 已成"全民想搞懂的基础设施",而市面上的资料要么太浅、要么太散,缺的正是这样一条完整可执行的路径。
二、这条路径到底教了什么
仓库的厉害之处在于"全链路覆盖"。它不是教你调框架,而是从最底层开始:分词怎么做、注意力机制怎么算、预训练怎么跑,一路走到分类微调和指令微调,每一章都有配套代码、能真正跑起来。
结构上分两条线。一条是"主流架构复现":Llama、Qwen、Gemma、Olmo 的小型变体都被拆开重写,让学习者看到不同模型的骨架差异。另一条是"前沿技术拆解":GQA(分组查询注意力)、MLA(多头潜在注意力)、滑动窗口注意力、DeepSeek 稀疏注意力、跨层 KV 共享、MoE(混合专家)这些论文里的名词,都被落到可运行的代码里逐一讲清。工程实践同样没有缺席:KV 缓存优化、DPO 对齐、LoRA 微调、显存高效加载,覆盖从训练到部署的全流程。
更难得的是作者明确表示将继续增加注意力变体与架构学习材料,让仓库成为持续生长的学习生态。配套的 AI-Learning 知识图谱、llm-from-scratch 等衍生项目,进一步把"单仓库学习"扩展成"知识网络"。
三、为什么 10 万人要手写 LLM
这个问题的答案,恰恰是这次开源浪潮最有意思的部分。
第一,手写是打破黑箱焦虑的唯一方式。今天用 Hugging Face、LangChain 搭一个 LLM 应用可能只需要几行代码,但绝大多数使用者说不清注意力矩阵怎么流动、KV 缓存省在哪里、LoRA 改了哪些参数。对靠技术吃饭的人来说,"能跑"和"懂"之间的差距是职业天花板。手写一遍,哪怕只是玩具规模的模型,黑箱也会变成灰箱。
第二,它是应对"框架通胀"的锚点。AI 生态的框架更新极快,今天的接口明天可能就废弃,但底层的 tokenizer、注意力、预训练目标这些知识几乎不变。手写 LLM 学的不是某个框架的 API,而是"十年后还有用"的底层原理,是一种抗贬值的学习投资。
第三,低成本时代的路径红利。复现一个小型变体(千万到亿参数级别)在单卡甚至 CPU 上就能完成,加上 DeepSeek 等团队公开的稀疏注意力、MoE 实现细节,现在"从零写一个能跑的 LLM"的硬件与资料成本都降到了个人开发者可承受的范围。手写不再是科研院的专利,而成了普通工程师的进阶必修课。
四、与框架黑箱的对比:两条路线之争
业内长期存在两条学习路线:一条是"框架优先",先学会用 Transformers、vLLM、LangChain 解决问题,再按需补原理;另一条是"原理优先",像 LLMs-from-scratch 这样从底层写起。
两条路线并非对立,而是互补,但顺序很重要。先手写、再上框架的人,看文档时知道每个参数在改什么,排错时能定位到机制层,遇到新架构(比如 MLA、MoE 变体)能快速迁移理解。先框架、再补原理的人,上手快但容易长期停留在"会调不会改"的状态。十万 Star 的投票,说明社区已经明显倾向"先懂原理再谈工具"。
五、对 AI 教育与求职的启示
这件事对 AI 教育的启示是深远的。过去两年的培训市场充斥着"提示词工程""LangChain 速成"类课程,教的是使用方法而不是理解能力。LLMs-from-scratch 的火爆说明学习者正在用脚投票:他们要的是能穿透黑箱的硬知识,而不是换个框架就失效的软技能。
对求职者而言,这个仓库几乎成了一份"公开的面试题库"。分词边界怎么处理、旋转位置编码和 RoPE 的关系、GQA 与 MHA 的参数量差异、LoRA 低秩近似的原理——这些高频面试题都有从零实现可循。能讲清并复现实现细节,才是区分度所在。对企业来说,能手写小型 LLM 的候选人,通常意味着更强的代码阅读能力、更深的系统理解力和更快的上手速度。
六、结语
十万 Star 不是终点,而是信号。它宣告"手写 LLM"从极客爱好变成了主流学习路径,也宣告 AI 学习正式进入"祛魅阶段":模型不再是咒语,而是可以被拆解、被复现、被理解的工程对象。与其追逐每天都在变的框架,不如花几个月时间,从分词器开始,亲手写一个属于自己的小型 LLM。这笔投资,大概率是未来十年回报率最高的技术学习。
引用来源:
1. https://agihunt.info/e/19fdcae6545b60fb8b5bf66f42c
2. https://www.zingnex.cn/forum/thread/python-baeb380f
3. https://www.zingnex.cn/forum/thread/ai-learning
本文仅代表作者个人观点(仅供参考) 来源:创客OPC原创整理