
最近关注AI教育动态的人,大概都会注意到一个挺有意思的巧合:中美两所顶尖高校几乎在同一个时间窗口里,不约而同地把从零构建大模型这件事搬进了正式课堂,而且都引发了圈内不小的轰动。一个是斯坦福的CS336,课程名叫Language Modeling from Scratch;另一个是清华大学计算机系教授、智谱AI创始人唐杰刚刚开讲的《高级机器学习》。这两件事表面上看是各自独立的教育新闻,但如果把课程大纲摊开来对比,会发现它们背后其实是同一股行业暗流在推着走——大模型这个领域正在经历一次从会用到会造的门槛重新洗牌,而顶尖高校的课堂,往往是这种行业焦虑最先被制度化表达出来的地方。这篇文章想把这两门课的细节、背景、争议和延伸的行业信号,尽量完整地捋一遍。先说斯坦福那边的CS336。这门课挂在斯坦福计算机科学系下面,编号CS336,课程性质是高阶专业选修课,面向本科高年级学生和研究生,并非必修,但因为内容硬核,在学生圈子里的口碑传播速度很快。主讲人阵容相当有分量,是Percy Liang和Tatsunori Hashimoto两位教授联合授课两人都是当代NLP和机器学习领域绕不开的名字,Percy Liang长期在斯坦福以色列学院(Stanford HAI)从事基础模型研究,是foundation model这个术语在学术界普及的关键推动者之一;Tatsunori Hashimoto则在模型评估、可信AI和高效训练方面有大量高引用工作。课程配置了四名助教,分工细致,office hour安排得密密麻麻,几乎每天都有固定答疑时段,这种配置本身也说明学校对这门课的投入并不小。上课形式是线下面授,固定在Skilling Auditorium进行,周一周三下午三点到四点二十,同时所有讲座都会录像并上传到YouTube播放列表,理论上任何人都可以免费看到全部课程内容,这也是后面会提到的自学替代方案的基础。课程学分是5个学分,官方特别标注这是一门implementation-heavy、也就是高度依赖动手实现的课程,并且明确提醒学生要为此预留足够的时间。先修要求列得非常细致:首先是精通Python,官方原话说得很直接,大部分其他AI课程给的脚手架代码比较多,学生只需要填空式地完成关键模块,但CS336几乎不提供这种便利,学生要写的代码量至少比其他课程高一个数量级,所以软件工程能力和Python熟练度是硬性门槛。其次是要有深度学习和系统优化的实战经验课程明确说会涉及大量让神经网络语言模型在多机GPU集群上跑得又快又省的内容,这就要求学生对PyTorch有很强的熟悉度,并且要理解内存层级(memory hierarchy)这种偏系统底层的概念换句话说,这不是一门纯算法课,而是把AI和系统编程焊在一起的交叉课程。数学基础方面,要求达到大学微积分和线性代数水平,比如斯坦福自己的MATH51,以及基础的概率统计知识,类似CS109的水平,要理解高斯分布、均值、标准差这些统计学基本概念。机器学习基础方面,官方列出了一长串可以接受的先修课程,包括CS221、CS229、CS230、CS124以及大名鼎鼎的CS224N(自然语言处理与深度学习),意味着学生至少要对机器学习和深度学习的基本框架有过系统学习,不能是零基础闯入。课程作业体系是整门课的核心,官方把课程比喻成操作系统课程的镜像版本——就像CS140那种课教你从零写一个OS内核一样,CS336要求学生把语言模型的每一层都亲手搭一遍。第一个作业名叫Basics,公开在GitHub仓库assignment1-basics里,要求学生实现训练一个标准Transformer语言模型所需的全部组件,包括分词器(tokenizer)、模型架构本身以及优化器,并且真正训练出一个可用的最小语言模型。这个作业单独看似乎不算太夸张,但据完整走完全程的旁听生Andy Timm在博客里透露,这个作业的完成周期只有两周,而且要求的实现深度远超能跑起来就行的标准,学生需要真正理解BPE分词、位置编码、注意力机制、层归一化这些组件在底层是怎么一行行代码写出来的不是调用现成的Hugging Face接口。第二个作业名叫Systems,聚焦在让模型训练变快变高效这件事上。根据Andy Timm的复盘文章,这个作业同样是两周时间,要求学生用Triton这门专门为GPU编程设计的语言,手写实现Flash Attention——这是当前几乎所有主流大模型训练和推理都依赖的核心加速技术,原因在于传统注意力机制的显存占用和计算复杂度会随序列长度平方增长,Flash Attention通过巧妙的分块计算和显存访问模式优化,大幅降低了这个开销。让学生自己实现一遍,意味着必须真正搞懂GPU的显存层级、计算单元调度这些偏硬件底层的知识,而不是停留在知道这个技术存在的层面。同一个作业里还要求学生手撸一版分布式数据并行(DDP)的实现,这涉及到多GPU之间如何同步梯度、如何降低通信开销这些工程难题在真正的大模型训练场景里,单卡训练早就不现实,分布式训练能力是从写得出一个模型到能训出一个真正有用的模型之间的关键分水岭。第三个作业围绕Scaling Laws展开也就是深度学习圈子里近几年被反复讨论的缩放定律。缩放定律描述的是模型性能如何随参数量、数据量、计算量的增长而变化,这套规律最早由OpenAI在GPT系列论文里系统性地提出,后来又经过Chinchilla论文的修正,成为所有大模型训练团队做资源分配决策的核心依据。Andy Timm在文章里提到,这个作业的设计意图是让学生亲手感受这些规律是怎么从小规模实验里被拟合出来、又被外推去预测大规模训练结果的——这恰好呼应了业内一句半开玩笑的说法:“如果你真的要为一次大规模训练做决策,你会先跑哪些小实验来验证你的判断”,这门课想让学生真正带着这种决策压力去理解Scaling Law,而不是把它当成教科书上的一条曲线公式来记忆。由于原始资料在这部分被截断,后续作业的具体内容没有完全展示,但从课程整体设计逻辑推断,应该还涉及模型对齐、微调方法比较以及最终的评估部署环节,基本覆盖了一个语言模型从预训练到能真正拿出来用的全生命周期。关于费用和面向社会人士的开放渠道,情况值得单独说清楚。斯坦福在校生选修这门课是正常注册流程,费用已经包含在学费体系里但对于非在校的社会人士,斯坦福设有一个叫Stanford Online的平台,理论上会把CS336包装成对外开放的付费在线课程,课程格式是100%在线、按需学习,周期设定为10周,每周需要投入20到25小时的学习强度,这个强度本身就说明这不是一门可以随便学学的水课。学费方面,官方标注的价格是7875美元,并且特别注明可能调整。更关键的是,截至查询时,这个在线课程的报名通道处于暂不开放的状态页面上只放了一个通知我的按钮,想要真正进入候补名单,还需要填写一份专门的Google表单申请。而且申请门槛不低:需要已经获得学士学位并且本科GPA达到3.0以上还要求学过CS224N或者同等水平的NLP进阶课程,再加上扎实的编程和人工智能背景这种比较主观但门槛不低的描述性要求。也就是说,这门课虽然理论上对社会开放,但实际操作起来更像是一个筛选严格的申请制项目,而不是随手报名就能学的大众公开课。关于这门课的真实学习体验,除了官方描述,第三方视角的评价更有参考价值。前面提到的Andy Timm,身份是旁听生(auditor),并非正式注册学生,他在2026年1月完整走完整门课程之后写了一篇很长的复盘文章,标题带着一点黑色幽默——“如果你想从零造一个LLM,你必须先发明系统层面的考量”这句话本身就点出了这门课的核心矛盾:很多人以为造语言模型是个纯算法问题,但真正做起来会发现,系统工程、硬件资源约束、通信开销这些脏活累活占据了工作量的绝大部分。Andy在文章里给出的核心判断是,这门课成功地解决了一个他自己长期观察到的行业趋势:随着AI工具链越来越成熟,研究者和工程师正变得越来越依赖高层抽象——调用现成的库、调用现成的API、用现成的预训练模型做微调,这样固然能提升开发效率,但代价是大家对底层实现细节的理解正在系统性地流失深度理解、研究直觉、真正的实现能力,这些东西正变得越来越容易被跳过而永远学不会。CS336存在的意义,就是强迫学生把这条捷径堵死,回到最底层重新走一遍。Andy给出的结论相当正面:他认为完整的课程体系很少能超越自我驱动的自学项目带来的收获,这在他个人的学习经历里几乎是一条铁律,但CS336是少数打破这条铁律的例外,值得强烈推荐给任何想要深入理解LLM底层机制的人。另外还有一位以数据科学家身份转型进入AI领域的博主Lulu Yan,写过一篇把CS336和UC伯克利同类课程CS294/194-196放在一起对比的文章,标题起得也很有画面感,叫斯坦福CS336:硬件与谦逊交汇之处。这篇文章的视角更偏向职业转型人群的实际考量——比起纯粹讨论课程内容本身,她更关心的是像这类硬核课程,对于想要真正转行进入LLM相关岗位的人来说投入的时间成本和金钱成本能不能换来对应的职业回报,这种性价比视角,对于正在纠结要不要报名这类课程的普通人来说,或许比单纯的课程内容介绍更有决策参考价值。说完斯坦福,再把视线转回国内。就在最近这几天,一条关于清华大学的教育新闻在国内科技媒体圈迅速传播开来——9月17日,清华大学计算机系教授、智谱AI创始人唐杰开设的《高级机器学习》课程完成首讲,112人容量的教室被学生站满,连走道都挤满了人。这条新闻被多家媒体转载报道包括开源中国、新浪财经、快科技等平台都在9月17日到18日之间跟进了这条消息,足见其在国内AI圈引发的关注度。唐杰在课堂上的开场判断,明显带着他作为大模型公司创始人的行业洞察,而不是一个纯学院派教授的常规讲法。据媒体报道,他表示AGI(通用人工智能)和ASI(超级人工智能)将是接下来大模型发展的主要目标他用了一句相当有冲击力的判断——“Chat这一仗基本打完了”意思是说,过去几年整个行业围绕怎么做一个更会聊天、更像人类对话伙伴的模型这个赛道的竞争已经进入尾声,各家大模型在对话体验层面的差距正在快速收窄,继续在这个维度上死磕边际收益已经不高。他判断2026年真正值得投入的方向,是把智能水平往上推一个台阶,让模型具备自我记忆、自我进化、独立完成长程复杂任务的能力,这几个关键词——自我记忆、自我进化、长程任务——恰恰也是当前大模型研究圈子里讨论度最高的几个前沿方向,分别对应着模型的长期记忆机制、模型自我迭代改进的能力,以及超越简单问答、能够多步骤规划执行复杂目标的Agent能力。虽然这门课挂靠的课程名称听起来还是传统的机器学习,但唐杰在课堂上直接说明,16周的教学内容已经完全围绕上述前沿方向重新设计过,不再是传统机器学习课程里那种从线性回归、决策树、SVM按部就班讲起的路数。据参与这门课的学生在社交平台上的爆料,唐杰在开课之初就明确给学生打了预防针,直言这门课的作业量会非常大,某种程度上是刻意用高强度的作业设置去劝退一部分只是想混学分的学生,把真正愿意投入时间精力的人筛选出来。具体到作业内容,几家媒体的报道细节高度一致,可以拼出一个相当完整的课程要求清单。首先,学生需要从零编写Tokenizer和Transformer架构,并端到端训练出一个0.1B参数规模的模型——这个规模虽然远远达不到工业界主流大模型的体量但对于课堂教学场景来说已经足够让学生完整体验一次从代码到能跑通的模型的全过程,而且0.1B这个体量的选择也很讲究,既能让学生在有限的算力资源下(通常是几张消费级或者教学用GPU)完成训练,又足以暴露出真实训练过程中会遇到的各种坑,比如学习率调度、梯度爆炸、显存溢出这些工程问题,不是简单跑个玩具模型就能糊弄过去的。其次,要求学生手写Triton attention kernel,并且要自己动手测试多卡训练和推理场景下的性能增益——这一点和斯坦福CS336第二个作业里的Flash Attention实现几乎是同一个技术点,说明这已经成为业内公认的理解现代大模型训练必须跨过的一道坎。第三,学生需要从raw dump——也就是未经处理的原始网络爬取数据——里清洗出可用的训练语料,并亲手拟合scaling law,进行外推预测,这个环节和斯坦福CS336的第三个作业在设计思路上高度重合,都是要求学生真正经历一次从脏数据到可用语料再到用小规模实验预测大规模效果的完整流程,而不是直接拿现成的干净数据集做实验。第四个环节是要求学生在同一个基座模型上,分别实施SFT(监督微调)、DPO(直接偏好优化)和RLVR(带可验证奖励的强化学习)三套主流的模型对齐方法,并做横向对照实验。这三种方法代表了当前大模型从预训练完成的裸模型进化到真正能用、符合人类偏好、行为可控的成品模型过程中最常用的几条技术路径,SFT是最基础的监督式微调,用人工标注的高质量问答对去教模型模仿理想回答;DPO是近两年兴起的一种更高效的偏好对齐方法,不需要像传统RLHF那样训练一个独立的奖励模型,而是直接用偏好数据优化策略;RLVR则是更前沿的方向,通过设置可以自动验证结果正确性的奖励信号(比如数学题答案对不对、代码能不能跑通),让模型通过强化学习自主提升在这些可验证任务上的表现,这也是2025年以来包括OpenAI的o系列模型、DeepSeek的R1系列在内,推理能力大幅提升背后的关键技术路径之一。要求学生在同一个基座上把这三种方法都亲手做一遍对照,意味着学生不仅要理解每种方法的原理,还要真正体会到它们在实际效果、训练稳定性、计算成本上的差异,这种对比实验的设计思路,本身就带着很强的研究方法论训练色彩,而不只是工程实践训练。最后一个环节,是要求学生搭建一套可验证的训练环境和harness(测试框架),训练具备长程任务处理能力的Agent,并且鼓励学生在这个基础上加入self-judge loop——也就是让模型具备自我评判、自我修正输出结果的闭环机制。这个环节直接对应了唐杰在开场判断里提到的让模型自己完成长程任务、自我进化这个前沿方向,也是整门课程设计里最能体现2026年往哪个方向走这个行业判断的部分。相比斯坦福CS336目前公开的课程大纲,这个环节明显更进了一步——CS336的作业体系截至公开资料显示,重点还是放在预训练、系统优化、Scaling Law这些相对偏基础设施层面的能力上,而唐杰这门课直接把RLVR和长程Agent训练也纳入了必修的教学范畴,这某种程度上反映出中美两边对什么才是当下最值得教给学生的核心能力这个问题上,判断有细微但值得关注的差异——国内这门课的设计,更贴近当前最热的Agent和推理强化学习这条战线。唐杰本人的背景,是这条新闻能引发如此大关注度的关键原因之一。公开资料显示,他2006年从清华大学计算机系拿到工学博士学位,毕业后放弃了外部提供的高薪机会,选择留校任教,长期主攻社会网络分析、数据挖掘和知识图谱这几个方向的研究,并带领团队做出过在学术圈知名度很高的科技情报平台AMiner这个平台曾经是国内学者查论文、查学术关系图谱的重要工具之一。2019年,唐杰做出了一个关键的职业转折——把实验室多年积累的技术成果转化为产业实践,创办了智谱AI这家公司秉持的理念是在中国追求通用人工智能创新,2021年发布了中国首个专有预训练大模型框架GLM,并推出了模型即服务(MaaS)的产品化和商业化平台。2022年,智谱开源了当时规模高达1000亿参数的GLM-130B模型,这在当时国内大模型开源生态还相当稀薄的阶段,是一件颇具分量的事情。此后GLM系列大模型持续迭代,一直到最新的GLM-5.1版本,智谱始终是国内大模型第一梯队里绕不开的名字。今年1月8日,智谱正式在港交所挂牌上市,被市场称为全球大模型第一股这个上市节点距离唐杰这次在清华开课,时间上非常接近,某种程度上也解释了为什么这条教育新闻能获得远超一般高校课程报道的媒体关注度——一个刚刚带公司完成上市的技术创始人,亲自回到讲台上,把自己团队正在啃的最前沿技术难题,原封不动地搬给学生当作业,这种身份重叠带来的可信度和话题性,是普通学院派教授很难复制的。值得一提的是,这不是唐杰第一次在清华开设引发热烈反响的课程。此前他主讲的清华x-labAI创业精英训练营,据报道也曾经出现报名竞争异常激烈的情况这说明唐杰个人的号召力,以及他所代表的从产业一线回归讲台这种身份组合,在国内学生和从业者群体里已经形成了相当稳固的品牌效应。这次《高级机器学习》课程开课即爆满,某种程度上也是这种长期积累的信任度的延续,而不完全是单次新闻事件的偶然爆红。把斯坦福CS336和唐杰在清华开设的这门课并排放在一起观察,能读出几层挺清晰的信号。第一层信号是,无论中美,顶尖高校和头部产业研究者已经形成了高度一致的共识——大模型技术这几年发展太快,整个行业的工具链和抽象层已经变得异常成熟,一个刚入行的工程师完全可以在不理解任何底层原理的情况下,靠调用现成API、微调现成开源模型就完成不少工作,这种便利性固然提升了整体的开发效率,但也在快速掏空新一代从业者对底层原理的理解深度这两门课的设计者都在用一种近乎逆流而上的姿态,强迫学生放下现成工具,重新回到最原始的代码层面,把每一个组件都亲手实现一遍,这本质上是在对抗行业里正在发生的能力空心化趋势。第二层信号是,两门课程的具体技术选型高度重合,这种重合不是巧合,而是反映了当前全球AI研究和工程社区对什么是真正核心的硬技能已经形成了相当统一的判断——手写Tokenizer和Transformer、实现Flash Attention和分布式训练、拟合Scaling Law、做SFT/DPO/RLVR的对齐方法对比,这些技术点几乎逐一对应,说明不管在硅谷还是在国内,业内对于一个真正懂大模型的人应该会什么这件事,认知已经高度趋同,分歧只存在于具体的教学节奏和进度安排上。第三层信号,也是相对更值得关注的一点,是唐杰这门课在长程Agent和RLVR这个环节上,明显比目前公开的CS336课程大纲走得更远、更贴近当下最热的技术前沿。这背后其实反映的是唐杰作为一家正在一线参与大模型商业化竞争的公司创始人,对下一步该往哪走这件事的判断更加激进和具体——他直接把Chat已经打完这个略带争议性的行业判断作为课程设计的出发点,这种判断本身在业内也不是没有争议,毕竟仍然有大量用户和场景需要的正是更好的对话体验但作为一种教学层面的方向选择,这种激进判断恰恰给了学生一个明确的信号:不要满足于能训出一个聊天机器人这种已经相对成熟的能力,而要往模型自主性、自我进化这些更难、更前沿、也更有想象空间的方向去投入精力。从普通人能不能蹭这类课程的角度来看,两边的现实情况也存在有趣的对照。斯坦福CS336如果想以非在校生身份修读,门槛设置得相当明确——本科学位、GPA3.0以上、NLP进阶课程基础、外加接近八千美元的学费,并且目前处于暂不开放注册、只能进候补名单的状态,这意味着即便你愿意付费,也未必能立刻拿到入场资格。唐杰在清华开设的这门课,截至目前公开的报道信息来看,还是一门标准的校内课程,没有看到对外开放的社会化版本或者线上付费渠道的报道,但考虑到他此前主讲的创业训练营就曾经出现过报名爆满的情况,不排除未来会有相关的公开课录播、讲义资料,或者类似的社会化教学产品流出。对于确实够不到官方报名门槛,又真心想学这些内容的人来说,斯坦福CS336已经示范了一条相对现实的替代路径——把讲座录像完整公开在YouTube播放列表上,把每一份作业的代码仓库开源挂在GitHub上,让全球任何一个愿意投入时间的自学者,都可以按照官方节奏,免费走完整门课程的全部内容从Andy Timm这样的旁听生反馈来看,这种自学路线的实际效果丝毫不逊色于正式注册学生的体验,这也从另一个角度说明,这类课程真正的核心价值,从来不在于坐进那间挤满学生的教室里,而在于是否真的愿意打开编辑器,一行一行地把那些论文里被高度浓缩总结的技术细节,重新用代码实现出来。这大概也是从零造大模型这四个字,不管挂在斯坦福的教学楼里还是清华的教室里,想要传递给这一代学生最核心的东西。