從零開始訓練一個大型語言模型 | Stanford 公開課 |上集

從零開始訓練一個大型語言模型 | Stanford 公開課 |上集

The Only Bamboo
The Only Bamboo
71 影片觀看·2026年9月2日  #AI #CS336 #大語言模型

大家好,我是 Jim,這裡是 AI Notebook。史丹佛有一門公開課,叫 CS336,從第一行程式開始,帶你把一個語言模型從零蓋出來。整門課有二十講左右,我會分成上中下三集講完,今天是上集,內容是前六講。這六講講一件事,成本。訓練一個模型要跑幾天,一張顯示卡塞得下多大的模型,這些聽起來很內行的問題,答案其實都只是幾個乘法跟除法,可以在一張餐巾紙上算出來。你也會發現一件很反直覺的事,這整條路上的瓶頸,幾乎從來不在你以為的那個地方。

📎 資料來源
• Stanford CS336 Language Modeling from Scratch, Spring 2025, Lecture 1: Overview, tokenization https://www.youtube.com/watch?v=SQ3fZ1sAqXI
• Stanford CS336, Spring 2025, Lecture 2: PyTorch, resource accounting https://www.youtube.com/watch?v=msHyYioAyNE
• Stanford CS336, Spring 2025, Lecture 3: Architectures, hyperparameters https://www.youtube.com/watch?v=ptFiH_bHnJw
• Stanford CS336, Spring 2025, Lecture 4: Mixture of experts https://www.youtube.com/watch?v=LPv1KfUXLCo
• Stanford CS336, Spring 2025, Lecture 5: GPUs https://www.youtube.com/watch?v=6OBtO9niT00
• Stanford CS336, Spring 2025, Lecture 6: Kernels, Triton https://www.youtube.com/watch?v=E8Mju53VB00
• Stanford CS336 course website (Spring 2025) https://stanford-cs336.github.io/spring2025/

---
Jim AI Notebook | Note the Future
每日深度解析 AI 最新進展

#AI #CS336 #大語言模型 #史丹佛 #GPU #MoE

📖 章節
0:00 開場:這門課在教什麼
0:37 一張餐巾紙算出 GPT-4 的成本
2:22 為什麼要從零學一次
4:11 Tokenization 與 BPE:文字怎麼變成 token
6:56 6ND 公式:70B 模型要訓 144 天
9:36 顯存帳單與 H100 規格陷阱
13:27 19 個模型的架構趨同
19:02 搬資料才是成本
19:59 KV cache:推理為什麼貴
21:49 MoE:參數變多算力不變
25:15 GPU 剪刀差與 Kernel 加速
30:37 上集總結:三個帶走的判斷