扫码下载
搜索“Fei-Fei Li(李飞飞)谈下一代 AI:空间智能是 AI 的最终前沿”共有1条相关结果
撰文:Techub News 整理 导语 2025 年 7 月,「AI 教母」、斯坦福大学终身教授李飞飞博士(Fei-Fei Li)出现在 Y Combinator 的访谈中,罕见地分享了她从学术界转向创业一线的心路历程。这场对话的背景,正是她离开斯坦福,创立专注于空间智能与 3D 世界模型的初创公司 World Labs。作为 ImageNet 的缔造者、深度学习和计算机视觉发展的核心推动者之一,李飞飞的每一次职业转向都深刻影响着 AI 领域的轨迹。此次她选择在 AI 技术爆炸性增长、大语言模型成为绝对焦点的当下,毅然投身于一个更基础、更困难,且被她视为「AGI 拼图中不可或缺部分」的领域——空间智能,其洞察与决策无疑为业界提供了至关重要的前瞻视角。 摘要 空间智能是通往 AGI 的终极挑战:李飞飞认为,缺乏理解和生成 3D 空间能力的人工智能是不完整的,这一挑战远超当前主流的大语言模型。 从 ImageNet 到 World Labs:回顾了 ImageNet 如何通过开源和数据驱动范式引爆 AI 革命,并以此为起点,勾勒出其职业生涯如何从对象识别、场景描述,最终演进到对 3D 世界建模的终极追求。 为何空间智能如此之难:相比语言的「一维」和纯生成特性,3D 世界建模面临维度爆炸、2D 投影信息丢失、数据稀缺(现实世界数据未完全数字化)以及需兼顾生成与重建等多重根本性挑战。 创业者精神与无畏品质:李飞飞分享了她从移民、经营洗衣店到成为顶尖学者的独特经历,强调「智力上的无所畏惧」是她寻找合作伙伴和团队成员的核心标准,也是应对最艰难挑战的关键心态。 ImageNet:数据驱动的 AI 范式革命 访谈从李飞飞职业生涯的标志性成就 ImageNet 开始。2007 年前后,作为普林斯顿大学的助理教授,她与她的学生面临着一个根本性问题:当时的计算机视觉算法泛化能力极差,而核心原因在于数据的极度匮乏。「我们当时相信,机器学习需要一场范式转变,而这场转变必须由数据驱动,」李飞飞回忆道。在当时互联网刚刚兴起的背景下,她和团队做出了一个大胆的决定:从网络上下载海量图片,并构建一个覆盖全世界视觉类别的庞大分类体系。这就是 ImageNet 的雏形。 这个项目在 2009 年以一个「小小的 CVPR 海报」形式首次亮相,并随即向整个研究社区开源,同时设立了年度挑战赛。起初几年,识别错误率高达 30% 以上,进步缓慢。转机出现在 2012 年。李飞飞至今清晰记得那个深夜,她的研究生发来消息:有一个参赛结果「脱颖而出」。这个名为「SuperVision」的团队(即后来知名的 AlexNet 团队),使用了卷积神经网络(CNN)并首次将两块 GPU 并行用于深度学习计算。「这不仅仅是卷积神经网络,」李飞飞强调,「它是数据、GPU 和神经网络首次汇聚在一起的时刻。」ImageNet 挑战赛上 AlexNet 的突破性胜利,正式宣告了现代深度学习时代的来临,验证了数据驱动范式的巨大威力。 ImageNet 解决了「对象识别」这个基础问题,但李飞飞的梦想远不止于此。自研究生时期起,她就怀有一个「百年梦想」:让机器能像人一样「讲述世界的故事」。她解释道,人类睁开眼看到的不是一个孤立的物体列表,而是一个完整的场景——一个会议室、一个舞台及其所有元素。2015 年左右,随着深度学习的成熟,她与学生 Andrej Karpathy 等人成功实现了让计算机为图像生成描述(image captioning)。「我几乎觉得,我这辈子接下来要做什么?」她当时半开玩笑地想,因为这个成就曾是她预设的「终生目标」。然而,技术的车轮滚滚向前,从图像描述到根据文字生成图像(如今生成式 AI 的核心能力之一),李飞飞的职业生涯恰好贯穿了 AI 从寒冬到腾飞的全过程。「我觉得自己是世界上最幸运的人,」她感慨道。 空间智能:比语言更基础、更艰难的 AGI 拼图 在实现了「场景描述」甚至「图像生成」之后,李飞飞的视野投向了更宏大的目标:世界本身。这直接促使她离开学术界,创立 World Labs。她解释道,驱动她做出这一抉择的,不仅是技术进步,更是对智能本质的生物学和进化论思考。 她提出了一个引人深思的对比:人类语言能力的进化,如果从最宽泛的角度算,发生在不到一百万年里,并且几乎是人类独有的复杂能力。然而,「视觉」——理解三维世界、在其中导航、交互、认知和交流的能力——其进化历程长达 5.4 亿年。最早的生物(三叶虫)在 5.4 亿年前发展出了水下视觉。李飞飞指出,在视觉出现之前的数亿年里,动物世界相对简单;正是视觉能力开启了「进化的军备竞赛」,推动了动物智能的飞速发展。「因此,对我来说,解决空间智能问题——理解 3D 世界、生成 3D 世界、在 3D 世界中推理和行动——是 AI 的一个根本性问题。」她坚定地表示:「对我来说,没有空间智能的 AGI 是不完整的,而我想解决这个问题。」 这涉及到创建超越「扁平像素」和「语言」的「世界模型」,真正捕捉世界的三维结构和空间智能。为此,她聚集了一支「顶尖团队」:Justin Johnson(她的前学生,实时神经风格迁移的系统专家)、Ben Mildenhall(NeRF 论文的作者)和 Christian Lassner(可微分渲染先驱 Pulsar 的创建者)。她坦言,空间智能的难度远超当前如火如荼的大语言模型(LLM)。 首先,维度差异巨大。 语言本质上是「一维」的序列信号,而真实世界是三维的(加上时间则是四维),其组合复杂性呈指数级增长。其次,感知方式不同。 我们通过眼睛或相机感知世界,这是一个将 3D 信息「投影」到 2D 平面的过程,在数学上是一个「不适定问题」,信息大量丢失,需要多传感器融合等其他方式来解决。第三,数据性质迥异。 语言是纯粹生成的,源于人类思维,并已在互联网上被大规模数字化。而关于 3D 空间的海量数据「存在于我们的头脑中」,并未被系统地数字化和获取。最后,应用频谱更广。 空间智能模型需要在「生成」(如游戏、元宇宙内容创作)和「重建/理解」(如机器人感知现实世界)之间灵活切换,形成一个连续的应用谱系。 「我的整个职业生涯都在追求那些极其困难、近乎妄想的问题,」李飞飞笑着说,「而我认为这就是那个‘妄想级’的问题。」这种对根本性挑战的迷恋,正是她创业的原动力。 从洗衣店到 AI 教母:智力无畏与创业者心态 李飞飞的职业生涯充满了从零到一的跨越。她分享了一段鲜为人知的经历:19 岁时,为了筹措大学学费和支持家庭,她在美国经营过一家干洗店,一干就是七年。「用硅谷的话说,我完成了筹资,我是创始人兼 CEO,同时我也是收银员……最后我‘退出’了。」这段经历磨练了她最底层的生存和创业能力。 她总结自己的职业选择时,多次表现出对「开创性路径」的偏好:无论是选择去一个没有计算机视觉教授的院系工作,还是从谷歌回到斯坦福创立「以人为本人工智能研究院」(HAI),抑或是现在全职投身创业。「我就是喜欢成为创业者,」她说,「我喜欢那种归零的感觉。忘记你过去的成就,忘记别人对你的看法,就是埋头苦干。这就是我的舒适区。」 作为培养了 Andrej Karpathy、Jim Fan、Jia Deng 等一批 AI 领域领军人物的导师,李飞飞也被问及识别人才的秘诀。她谦逊地表示自己「欠学生更多」,但指出这些杰出人才有一个共同的核心特质:智力上的无所畏惧(intellectual fearlessness)。「这种拥抱难题、全身心投入并以自己的方式去解决的勇气,是成功者的核心特质。」这也成为她如今作为 World Labs CEO 招聘人才的首要标准。她现场发出邀请,寻找对解决空间智能问题充满热情和无畏精神的工程、产品、3D 和生成模型等方面的人才。 AI 未来:给研究者、创业者与所有人的建议 在问答环节,李飞飞针对多个关键问题给出了坦诚而富有洞见的回答。 对于考虑攻读 AI 博士学位的学生,她直言当今学术界在算力和数据资源上已无法与工业界比拟。她建议博士生寻找那些「北极星」式的问题,即并非单纯依靠更多芯片和数据就能更快解决的课题。例如:跨学科 AI 用于科学发现、AI 可解释性与因果推理等基础理论、计算机视觉中尚未解决的表示问题,以及小数据学习等。 当被问及 AGI 更可能以单一统一模型还是多智能体系统形态出现时,李飞飞表现出对「AGI」这一流行术语本身的审慎态度。她认为,AI 创始先贤们提出的「创造能思考的机器」这一根本目标,与今天所说的 AGI 并无本质不同。她更倾向于关注智能科学本身的发展,而非纠结于定义。她类比人脑,它虽然是单一实体,但内部也存在语言、视觉、运动等不同功能分区。 关于开源与闭源的争论,她持务实态度,认为健康的生态需要不同策略并存。「我对于必须开源或必须闭源并不教条,这取决于公司的商业战略。」她以 Meta 开源模型以壮大其平台生态为例,说明了开源策略的商业合理性。同时,她也强调,开源本身对于创业生态和公共部门至关重要,应当受到保护和支持。 最后,面对关于女性及少数群体在 STEM 领域处境的提问,李飞飞给出了充满韧性与智慧的答案。她承认每个人都会有感到自己是「房间里唯一那个人」的时刻,无论是基于身份、观点还是其他原因。她分享了自己的心态:「我很早就发展出一种能力,不过度索引(overindex)在那个身份上。我和在场的每一位一样,是来学习、做事和创造的。」她鼓励所有创业者,在感到脆弱或迷茫时,「专注于手头的事,像梯度下降一样,让自己优化到解决方案。」