视觉智能的幻觉:当深度学习遗忘了几何与时间
当前计算机视觉领域正沉浸在一场宏大的胜利叙事中。从ImageNet到GPT-4V,大模型在图像分类、检测、生成上不断刷新人类的认知边界,似乎视觉智能的圣杯已被牢牢握在手中。但如果我们撕下这些SOTA指标的华丽外衣,将镜头拉近至真实物理世界中的机器人、自动驾驶或医疗影像,便会发现一个尴尬的悖论:最先进的视觉系统在遭遇视角突变、光照扭曲或时间断层时,表现得比一只蜜蜂还要笨拙。问题根源并不在于数据量不够大,也不在于网络结构的复杂度不足,而在于我们正在用统计拟合替代结构理解,用相关性的记忆伪装成因果性的推理。视觉的本质并非像素的排列组合,而是对三维几何在二维投影中的可逆解码,以及对时间流中状态连续性的内在建模。可我们却迫使网络从零开始学习这一切,这既是算力与数据的巨大浪费,也是通往真正视觉智能的南辕北辙。
当深度学习从学术界走向工业界,一个不可逆的异化过程开始了:视觉任务被分割为一个个孤立且标签化的子模块,人脸识别、物体检测、语义分割……各有各的骨干网络,各有各的评测标准。这种碎片化使得算法可以极快地获得局部最优,却也斩断了视觉感知的整体性与生成性。我们很少追问:一个在静态图像上达到99%准确率的模型,在连续视频流中是否还能保持时间一致性?一个在合成数据上训练完美的分割算法,迁移到真实场景时为何崩盘?因为当前主流架构——无论是CNN还是Transformer——本质上都是对空间信息的静态聚合,它们对时间维度的处理要么粗暴采样为帧输入,要么干脆忽略。而人类或动物的视觉系统,却是在时间流动中不断预测、校正、再预测的闭环过程。我们不需要看完全部物体才能认出它,只需要一个粗略轮廓加上下一秒的预期运动就能触发完整的识别。这种'预测性编码'被主流视觉界长期冷落,被当作神经科学的古老陈词滥调,而非可实现的工程范式。然而,正是这种对时间连续性的忽视,导致视觉系统在面对遮挡、模糊和动态场景时极易被对抗样本击穿,暴露出其底层理解的空洞。
我们不禁要问:为什么几何学和物理学的先验被如此彻底地放逐出视觉研究的前沿?在深度学习之前的古典视觉时代,多视图几何、结构光照明、立体匹配曾是核心课程,研究者们小心翼翼地计算相机内外参,用三角化从多张图片中恢复点的三维坐标。这种范式虽然脆弱,但它遵循一个不可动摇的法则:图像是几何过程的投影结果,反向投影才有可能逼近真实。然而深度学习的降临,让'端到端'成为政治正确,让显式建模被视为手工特征的遗老遗少。于是几何先验被彻底内卷进网络权重,用海量数据去隐式表示三维结构。可悲的是,这种隐式表示在特定数据集上有效,却缺乏泛化到未知环境的几何刚性。一旦拍摄设备换用鱼眼镜头,或者场景中出现非朗伯表面,网络就会迷之自信地输出错误结果。而新近的神经辐射场(NeRF)和3D高斯泼溅虽然将几何重新抬回舞台,但他们仍然是在重建单一场景,而非学习具有迁移能力的几何规则。真正的独立观点应当是:视觉系统必须具备一个可微的几何引擎,既能从数据中学习材质与纹理,也能显式地进行刚体变换、投影运算和光照模拟,而不是让模型在一个黑箱中同时承担无可分辨的映射任务。
除了几何的缺失,时间的连续性是另一个被低估的宝藏。想象一下,一只猫在跳跃过程中,它的姿态变化具有物理上的惯性约束。一个真正的视觉智能体,应当能够利用前几帧的视觉信息,预测下一帧中的遮挡区域或运动模糊,并将预测误差作为感知更新的信号。这样的机制不仅可以大幅减少对标注数据的依赖,还能自然地赋予系统'常识':物体不会凭空消失或瞬间改变颜色。当前走向通用人工智能的视觉路径却主要依赖于把视频拆成帧序列进行监督学习,模型从未被训练来感知事件的因果关系,于是'撞上玻璃的鸟'这类违反物理直觉的对抗攻击才会屡屡得手。我认为,视觉的下一革命将不再来自更多的参数或更大的数据集,而是来自将时间建模为微分方程、将感知视为贝叶斯状态估计的回归。视觉系统应当像我们的认知一样,建构一个对连续世界的内部模拟器,并在每一次观测时更新模拟结果,形成预测与校正的循环。这种视角会彻底改变损失函数的设计:我们不再追求分类概率的极大似然,而是最小化未来状态预测误差;不再有离散的图片输入输出,而是一片连续感知流上的动态映射。届时像机器人抓取、自动驾驶等任务将获得真正的鲁棒性,因为系统拥有的不仅仅是像素分类表,而是一个能力可泛化的物理世界模型。
当然,这个独立观点并不意味着全盘否定深度学习的意义,而是呼吁一场激进的'重新锚定'。我们需要构建混合架构:数据驱动模块负责处理不可穷举的高维视感细节,而先验引擎(如层次化几何变换、物理模拟器)则负责提供结构约束与时间推理。当下一种极具前景的方向是,将隐式神经表示与可微分渲染结合,使模型可以同时进行上下文的语义推理和几何参数的显式求解。更进一步,可以借鉴脑科学中'可预测性编码'的具体算法实现,例如让网络维护一个稀疏的三维场景图,结合光流场反馈来动态更新。这样的路线图将让计算机视觉回归到人工智能的初心——理解世界而非注解图片。作为研究者,我们大可不必沉溺于一次性自监听的刷榜游戏中,而应思考一个更宏大命题:如何构建一套在结构、时间与因果上自洽的视觉认知体系?答案可能就藏在被我们遗忘的几何教科书与钟表齿轮中,等待着一次新旧范式的融合。