田渊栋从表征学习出发,解释神经网络为何会从记忆跃迁到泛化:Grokking 并非神秘时刻,而是数据分布、优化 landscape 与隐含偏好共同塑造出的结果。对话还追问 Scaling Law、Loss Function 和“优雅”在模型学习中的位置。
适合研究大语言模型、关注 Scaling Law,或正在使用 GPT-5 辅助科研的人;它帮助你判断继续扩大数据和算力,与打开黑箱研究表征机制,各自能解决什么问题。
• Grokking 从记忆到泛化的变化,如何由数据分布和不同表征对应的“山峰”解释?
• 表征学习为什么同时容纳直观学习与抽象学习,而不必二选一?
• 当数据遇到瓶颈,理解模型内部机制能否替代单纯的 data augmentation?
• Loss Function 只是代理时,训练过程中的 implicit bias 如何偏向更简洁、优雅的解释?
• 人类研究员怎样向 GPT-5 注入关键 Insight,并持续识别它的错误与矛盾?
00:00:00 — 从 Meta 裁员谈研究团队的价值
00:04:10 — 研究员如何从稀疏数据中获得 Insight
00:06:11 — 研究品味与直觉意味着什么
00:08:14 — Grokking:模型怎样从记忆走向泛化
00:10:55 — 表征学习为何会出现飞跃
00:12:05 — 压缩、泛化与优雅解释
00:13:05 — Scaling Law 与理解内部机制的两条路径
00:18:41 — 大语言模型的输出是记忆还是泛化
00:20:41 — 用优化 landscape 解释“顿悟”
00:23:10 — Loss Function 为什么只是代理
00:32:05 — 如何与 GPT-5 协作做研究
00:36:05 — 人类研究员负责注入关键 Insight
田渊栋博士,本期围绕神经网络的 Grokking、表征学习、泛化机制,以及与 GPT-5 协作研究分享观点。
田渊栋:模型的顿悟,AI的优雅,模型表征与人类心智模型的关系,优秀研究员的意义:
https://youtu.be/zAzsDHpR4xs
加入Superlinear Academy免费社区
拿出你的模型实验结果或研究疑问,讨论数据分布、优化过程与表征机制。
https://www.superlinear.academy/
孙煜征(课代表立正),康奈尔大学经济学博士、Superlinear Academy创始人。曾任Amazon经济学家、Meta数据科学家和腾讯IEG副总监,也是OpenAI收购团队早期成员。
《课代表立正》关注AI如何改变工作、职业与商业,以及人在变化中最需要保留的判断力。