撰文:Techub News 整理
导语
2025 年春季,斯坦福大学经典的 CS231n《计算机视觉深度学习》课程再度开讲。课程联合负责人、斯坦福大学计算机科学系教授、AI 领域著名学者 Fei-Fei Li(李飞飞)担纲首场讲座。在这场面向全球学子的公开课中,李飞飞并未急于切入技术细节,而是从 5.4 亿年前的寒武纪生命大爆发讲起,将视觉置于智能进化的宏大叙事中,为这门技术课程奠定了深厚的人文与科学哲学基础。此次讲座不仅是新学期的导论,更是一次对计算机视觉本质、历史脉络及未来责任的深刻梳理,对于理解当前 AI 浪潮的根源与方向具有重要价值。
摘要
- 视觉是智能的基石:从寒武纪首个感光细胞的出现,到人类超半数皮层细胞参与视觉处理,视觉作为首要感官驱动了神经系统与智能的进化。
- 数据是深度学习的“一等公民”:2012 年 AlexNet 在 ImageNet 挑战赛上的突破性胜利,标志着数据(如 ImageNet)与算法(如反向传播)、算力共同成为推动现代 AI 复兴的三大支柱。
- 计算机视觉远未“解决”:尽管在物体识别、图像生成等领域取得巨大进展,但人类视觉中蕴含的细微差别、复杂性与情感理解,仍是 AI 面临的长期挑战。
- AI 的责任与跨学科协作至关重要:技术的双刃剑效应要求研究者关注数据偏见、伦理影响,并需要与医学、法律、心理学等领域的专家共同推动负责任的 AI 发展。
- 课程将全面覆盖从线性分类器到生成式模型的核心知识:本季度 CS231n 将系统讲授深度学习基础、视觉感知与理解、生成与交互式视觉智能,以及以人为本的 AI 应用。
视觉:驱动智能进化的 5.4 亿年旅程
Fei-Fei Li(李飞飞)开篇即将听众的视野拉远至 5.4 亿年前。她指出,视觉的历史并非始于人类文明,而是源于地球生命的“寒武纪大爆发”。在这段地质学上相对短暂的时期内,动物物种为何呈现爆炸式增长?一个极具说服力的理论是:视觉出现了。最初的三叶虫进化出了感光细胞,尽管只是一个简单的“针孔”,却能收集光线。这一进化转折点至关重要——从被动的新陈代谢,到主动感知环境并与之互动,生存竞争由此加剧,智能演化的引擎被点燃。
“一旦你收集了光,生命就完全不同了,”李飞飞解释道。视觉,连同触觉,成为动物最古老的传感器。此后的 5.4 亿年,视觉的进化史实质上就是智能的进化史。作为动物的首要感官,视觉推动了神经系统的发展。人类更是极致的“视觉动物”:超过一半的皮层细胞参与视觉处理,形成了极其复杂、精妙的视觉系统。李飞飞希望以此激发学生对视觉研究的根本兴趣:我们不仅要“看”,更要理解“看”背后的智能如何产生。
从神经科学到算法:计算机视觉的奠基
快速穿越至人类文明,人类不仅满足于自身能“看”,还渴望建造“会看”的机器。从达芬奇研究暗箱,到现代相机的普及,李飞飞指出,相机(如同眼睛)只是工具,真正的核心在于理解“视觉智能”如何发生。
她梳理了计算机视觉与深度学习交汇的关键历史脉络:
- 1959 年:神经科学的启示。David Hubel 和 Torsten Wiesel 对猫初级视觉皮层的研究揭示了两个关键原则:1)神经元有特定的“感受野”,负责处理一小块视觉空间中的特定简单模式(如特定朝向的边缘);2)视觉通路是层级化的。简单神经元的输出汇聚到更复杂的神经元,从而逐步构建对物体的理解。这项为其赢得诺贝尔奖的工作,为后来人工神经网络的架构提供了最直接的生物学灵感。
- 1960 年代:计算机视觉的诞生。Larry Roberts 关于形状理解的博士论文被广泛认为是该领域的第一篇博士论文。随后 MIT 那个“用一个夏天解决视觉问题”的天真项目,则标志着一个充满雄心的新学科正式起步。
- 1970 年代:David Marr 的理论框架。在其影响深远的著作中,Marr 提出了视觉处理的三个阶段:初级草图(边缘等)、2.5维草图(深度信息)和最终的三维模型表示。他清晰地指出,从二维图像反推三维世界是视觉的根本性难题,也是一个数学上的“不适定问题”。
李飞飞特别比较了视觉与语言的根本区别:语言并非自然存在,它是人类大脑生成的、一维的、序列化的产物;而视觉则是对一个遵守物理规律的真实三维世界的感知。这一哲学层面的差异,深刻影响了各自领域(如计算机视觉与大语言模型)的算法发展路径。
数据的力量:ImageNet 如何点燃深度学习革命
在计算机视觉独立发展的同时,另一条主线——神经网络与深度学习也在默默演进。李飞飞回顾了感知机、福岛邦彦的“认知机”、反向传播算法的发明(Rumelhart, Hinton)、以及 Yann LeCun(杨立昆)在贝尔实验室成功应用的卷积神经网络(用于识别邮政编码)。然而,在 21 世纪初,尽管算法不断改进,识别真实世界中的猫、狗、椅子等物体这一核心问题仍然进展缓慢。
“一个巨大的问题在于缺乏数据,”李飞飞强调,“缺乏数据不仅仅是一种不便,更是一个数学问题。” 当时的研究大多聚焦于模型架构,而未能充分认识到数据是机器学习和深度学习的“一等公民”。高容量的模型需要海量数据来学习泛化,避免过拟合。
正是基于这一洞见,李飞飞和她的团队在 2000 年代初启动了 ImageNet 项目。他们清理了约 10 亿张网络图片,最终构建了一个包含 1500 万张图像、涵盖 2.2 万个类别的庞大数据集。其类别数量参考了心理学研究中人类在幼年时期学习识别的物体类别大致规模。随后,他们基于 ImageNet 的子集发起了“大规模视觉识别挑战赛”。
比赛初期(2010、2011年),最佳算法的错误率接近 30%,而人类水平则低于 3%。转折点在2012 年到来。Geoffrey Hinton(杰弗里·辛顿)和他的学生 Alex Krizhevsky 等人使用深度卷积神经网络(AlexNet)参赛,将错误率几乎降低了一半,取得了压倒性胜利。
李飞飞分析,AlexNet 与 32 年前的“认知机”在架构上并非天差地别,但两大关键进展使其成功:一是反向传播提供了自动、数学严谨的参数学习规则;二是海量数据(ImageNet)驱动了高容量模型的训练。2012 年 ImageNet 挑战赛的胜利,被广泛认为是现代 AI 复兴或深度学习革命的历史性时刻。自此,算法、数据与计算力的“三重奏”正式引爆了 AI 时代。
爆炸式发展下的机遇、挑战与责任
李飞飞展示了自 2012 年后计算机视觉领域的爆发式增长:学术会议规模、论文数量、创业公司、企业应用均呈指数级上升。“我们已完全走出 AI 寒冬,进入了一个‘AI 全球变暖’时期,”她调侃道。
技术进步是惊人的:从物体识别、检测、分割,到图像描述、关系理解、风格迁移(本课程客座讲师 Justin Johnson 将讲述其开创性工作),再到如今生成式 AI 创造的逼真图像。硬件(如 NVIDIA GPU)的算力增长曲线也因深度学习的需求而变得陡峭。
然而,在展示辉煌成就的同时,李飞飞以相当大的篇幅强调了领域的未竟之路与重大责任:
- 技术挑战:人类视觉的微妙、复杂和情感维度,计算机视觉仍远未企及。
- 数据偏见与社会伦理:AI 系统由数据驱动,而数据承载着人类的历史与社会偏见。人脸识别算法中已观察到与人类相似的偏见。AI 在医疗影像等领域的应用造福社会,但若用于决定就业、贷款等关键事务,则带来严峻的伦理挑战。
- 跨学科协作的必要性:李飞飞特别高兴看到来自医学院、法学院、商学院的学生选修此课,因为“并非所有 AI 问题都是工程问题”。解决技术的社会影响需要与人文社科领域的深度合作。她也介绍了自己与 Ehsan Adeli、Zane 等同事在利用计算机视觉关爱老年群体等方向的应用研究。
最后,她将讲台交给共同授课的 Ehsan Adeli 教授,由他概述本季度 CS231n 课程的具体安排。课程将分为四大板块:深度学习基础、视觉世界的感知与理解、生成与交互式视觉智能、以及以人为本的 AI 应用与启示。学生们将从最基础的图像分类和线性分类器起步,逐步深入到卷积神经网络、循环神经网络、Transformer、大模型分布式训练、自监督学习、扩散模型、视觉-语言模型、3D 视觉乃至具身智能等前沿主题。通过课程学习,学生将能形式化计算机视觉任务、开发并训练视觉模型,并深刻理解该领域的现状与未来走向。










