为什么我想做这一集
过去一个月,我在斯坦福度过了不少时间。走过李飞飞教授的办公室,听她谈人工智能,也重新读了她的回忆录《The Worlds I See》。
我们每天都在谈 AI。
谈 ChatGPT,谈模型,谈算力,谈哪些工作会消失,也谈下一个改变世界的产品会是什么。但我越来越好奇的,反而是另一个问题:
那些真正改变技术方向的人,是怎样形成自己的判断的?
这也是我开始做 Finding Genius 的原因。
我并不想做一个关于“成功人士”的节目。这个世界已经有太多成功故事。我更想借一本书、一个人的经历,去理解一些更缓慢、也更难被看见的东西:一个人的好奇心从哪里开始?她如何面对不知道答案的问题?当周围的人并不认同她的时候,她为什么仍然愿意继续走下去?
李飞飞是我想讲的第一个人。
今天,我们知道她是 ImageNet 背后的科学家,是现代计算机视觉的重要推动者,也是 Stanford Human-Centered AI Institute 的创始领导者之一。
但《The Worlds I See》真正打动我的,并不是这些成就。
而是一个女孩如何不断进入陌生的世界。
从中国到美国,从物理到神经科学,从理解人类视觉到让机器学习“看见”,再到今天重新追问:如果人工智能越来越强大,它最终应该为谁服务?
所以这一集,与其说是在讲人工智能,不如说是在讲一种理解世界的方法。
在看见世界之前,我们也许要先学会理解。
本期简介
李飞飞是现代人工智能发展中最重要的科学家之一。
但她的故事并不是从硅谷开始的。
她出生于北京、成长于成都,十几岁随家人移民美国。从一个需要重新学习语言和文化的移民女孩,到普林斯顿的物理学生,再到研究人类视觉、计算机视觉和人工智能,她一直在追问一个看似简单的问题:
我们究竟是怎样理解眼前这个世界的?
这个问题后来把她带向 ImageNet。
2009年,李飞飞和团队发表 ImageNet 工作,希望建立一个前所未有的大规模视觉数据库,让机器不再只依赖人为写下的规则,而能够通过大量真实世界的图像学习。
几年以后,ImageNet成为深度学习革命的重要基础设施之一。
但李飞飞后来的注意力逐渐从“机器能够做什么”,转向另一个问题:
我们希望机器为人类做什么?
从 Human-Centered AI,到医疗领域的 ambient intelligence,再到今天 World Labs 对 spatial intelligence 和 world models 的探索,她的研究看似一直在变化,背后却有一条非常稳定的线:
从 seeing 到 understanding,再从 understanding 到 acting in the world。
这一期 Finding Genius,我们从《The Worlds I See》出发,聊李飞飞,也聊 ImageNet、人工智能、移民、女性、好奇心、判断力,以及在一个技术快速改变世界的时代,我们怎样保留自己的 human agency。
本期提到的书《The Worlds I See》
完整书名: The Worlds I See: Curiosity, Exploration, and Discovery at the Dawn of AI
作者: Dr. Fei-Fei Li
出版社: Flatiron Books / A Moment of Lift Book
出版时间: November 7, 2023
页数: 336 pages
这不是一本传统意义上的 AI 科普书。
李飞飞把自己的个人经历与现代人工智能的发展史交织在一起:童年、移民、父母、求学、ImageNet、Google、Stanford,以及她后来对 Human-Centered AI 的思考。
如果只能从这一期节目延伸阅读一本书,我仍然会首先推荐这一本。
李飞飞的几个重要研究与项目01|ImageNet
ImageNet 是李飞飞最具历史影响力的工作之一。
2009年发表的 ImageNet 论文提出建立一个以 WordNet 为语义结构的大规模图像数据库。当时发表的数据集已经包含 5,247个类别和约320万张图片,目标则更加庞大。
ImageNet后来不只是一个数据库,也成为计算机视觉研究的重要 benchmark。
2012年的 ImageNet Challenge 中,AlexNet 使用深度卷积神经网络和 GPU 大幅改善图像识别表现。它通常被视为现代深度学习爆发的重要节点。
ImageNet的重要性不只在于“大”。
它代表了一次研究思路的变化:
也许让机器变得更聪明,不只是需要更聪明的算法;机器还需要足够丰富的经验去认识世界。
02|Computer Vision:让机器从“看到像素”走向“理解场景”
李飞飞长期研究 computer vision、cognitively inspired AI、machine learning 与视觉认知。
她关心的问题并不只是“这张照片里有没有一只猫”。
更深的问题是:
机器能不能理解物体之间的关系、场景、人的动作以及发生在视觉世界里的事件?
这也是为什么她今天研究 spatial intelligence 并不是一次突然的转向。
从 ImageNet 到 world models,可以看到一个延续了二十多年的问题:
机器怎样从看见,走向理解?
03|Human-Centered AI
李飞飞是 Stanford Institute for Human-Centered Artificial Intelligence(Stanford HAI)的创始领导者之一。
Human-Centered AI 的重要之处,在于它把问题从:
“AI还能变得多强?”
转变成:
“我们希望AI如何增强人的能力?”
这意味着 AI 不只是计算机科学的问题,也涉及医学、教育、经济、法律、伦理、政策以及人与人之间的关系。
04|Ambient Intelligence 与医疗
李飞飞的研究团队也长期探索 AI 在医疗环境中的应用。
她与合作者提出利用非接触式传感器和机器学习构建“ambient intelligence”——让医院、ICU、手术室等空间本身拥有一定的感知能力。
目标不是用机器替代医生。
恰恰相反,是希望技术帮助医生减少一些机械性的观察和记录工作、改善病人安全,并让医疗工作者把更多注意力重新放在人身上。
这是我认为理解她所谓 Human-Centered AI 非常好的一个具体例子。
05|AI4ALL
2015年,李飞飞、Olga Russakovsky 和 Rick Sommer 在 Stanford 创建了一个面向高中女生的 AI 夏季项目。
它后来发展成为 AI4ALL。
这个项目背后的想法其实非常重要:
如果人工智能未来会影响所有人,那么创造人工智能的人也不应该只来自非常有限的一群人。
AI4ALL后来从 Stanford 扩展到多个大学项目,希望让过去在 AI 和计算机科学领域代表不足的学生更早接触这个领域。
06|Spatial Intelligence & World Labs
这是李飞飞现在最值得继续关注的方向。
她与 Justin Johnson、Ben Mildenhall 和 Christoph Lassner 创立了 World Labs,研究 spatial intelligence——空间智能。
如果大型语言模型学习的是:
words → language
那么 world models 想解决的是:
pixels → objects → space → worlds → action
也就是说,AI不只是描述一张桌子的照片,而是理解桌子存在于一个三维空间里;如果移动它,会发生什么;人可以怎样绕过它;一个机器人又应该怎样与它互动。
World Labs 已经推出生成和操作三维世界的模型与产品 Marble,并在2026年继续推进机器人模拟和 world models。
从这个角度看,李飞飞二十多年前开始提出的问题其实还没有结束。
ImageNet问:
机器怎样看见世界?
今天她问的是:
机器怎样理解、模拟,并最终与这个世界互动?
最近值得听/看的李飞飞访谈Huberman Lab — August 10, 2026
Using AI to Increase Your Intelligence & Enrich Humanity | Dr. Fei-Fei Li
如果听完这一期 Finding Genius 还想继续,我会首先推荐这场。
讨论从 AI 的发展一路延伸到医疗、教育、科学发现、human agency,以及为什么塑造 AI 的未来不能只是科技公司的责任。
a16z — July 2026
Fei-Fei Li on Spatial Intelligence and Robotics
Fei-Fei Li、World Labs/SceniX 的 Yunzhu Li 与 a16z 的 Martin Casado 讨论 spatial intelligence、simulation、robotics,以及为什么训练机器人可能与训练语言模型完全不同。
如果想理解她 ImageNet之后正在做什么,这一场非常值得听。
Scientific American — June 16, 2026
Fei-Fei Li
这场访谈把她放回科学研究本身,讨论基础科学、人工智能和技术进步。
它也提醒我们:在今天所有关于 AI 产品和公司的讨论之外,李飞飞首先仍然是一位科学家。
Bloomberg Live — June 4, 2026
World Labs' Fei-Fei Li on Creating Large World Models
重点是 World Labs、large world models 和 spatial intelligence。
如果对“为什么语言模型之后可能是世界模型”感兴趣,可以从这里继续。
Possible — January 15, 2025
Fei-Fei Li on Spatial Intelligence and Human-Centered AI
Reid Hoffman 和 Aria Finger 与李飞飞讨论 ImageNet、World Labs、spatial intelligence、AGI、AI治理以及 human-centered AI。
这一场特别适合与《The Worlds I See》一起听,因为它把她过去的工作与正在发生的下一阶段连接了起来。
关于 Finding Genius
Finding Genius 想做的,不是寻找“天才的成功公式”。
每一期,我们借一本书、一次研究、一段人生,去认识一个真正改变过自己所在领域的人。
我更感兴趣的,是成功之前的部分。
他们在想什么?
他们看到了什么别人没有看到的问题?
是什么经历塑造了他们的判断?
而当答案还不存在的时候,他们为什么愿意继续走下去?
Finding Genius,不是寻找成为天才的方法。
而是试着理解,那些改变世界的人,是怎样理解世界的。