视觉的幻象:计算机视觉在数据迷宫中丢失的结构灵魂
当前主流的计算机视觉体系,本质上是一场规模宏大的统计学胜利。ImageNet时代的遗产至今仍深刻影响着每一个视觉模型——我们习惯性地将图像切割成无数个像素块,让卷积核或Transformer在数以亿计的文本-图像对中寻找相关性。诚然,这种数据洪流驱动的范式在识别、检测、分割等标准任务上达到了超越人类的精度,但这种‘超能力’是脆弱的。当一张图片被加上肉眼不可见的对抗噪声,模型会以100%置信度将熊猫识别为长臂猿;当场景中物体位置发生轻微偏移,模型便丧失空间逻辑;当训练数据与测试数据分布稍有偏移,性能便断崖式下跌。这些现象共同指向一个事实:模型学到的是像素间的统计共现频率,而非视觉世界背后的物理结构、几何约束与因果链条。我们创造了一个精于匹配、拙于理解的视觉盲人。
视觉的本质不是模式匹配,而是结构推断。人类婴儿仅需极少量的样例就能建立物体的持久性、遮挡关系、三维立体形状等认知,因为我们的视觉系统天生内置了关于空间、时间、物理的强先验。反观当前深度学习模型,它们用海量数据试图隐式地逼近这些结构,结果却是学到了无数个不可解释的捷径(shortcut)。例如,在雪地上识别狼时,模型可能只依赖背景中的雪,而非狼的形态;在医学影像诊断中,模型可能依赖扫描设备的金属伪影标记,而非真实的病理特征。这种‘表面相关性’在分布外测试中会彻底崩溃。我们需要承认,单纯堆积数据并不能涌现出对世界结构的真正理解,恰恰相反,数据成了遮挡结构真相的帷幕。独立的观点在于:计算机视觉的进一步发展,必须以‘显式结构先验’为基石,而非继续迷信大数据无所不能。
要让视觉模型获得‘灵魂’,必须重新引入因果推理与具身交互。传统视觉系统是一个从图像到标签的开放环路,没有反馈,没有动作,更没有对世界改变结果的验证。一种全新的范式是构建‘感知-行动-因果模型’的闭环:模型不仅要识别场景中的物体标签,更要预测物体间相互作用的结果(例如,推倒一个杯子后水会流出)、物体在时间序列中的状态变化(例如,从部分遮挡推断完整形状),甚至主动通过动作去消除感知的不确定性(例如,像人一样转动头部或移动视点来验证深度)。这种具身认知的视角,将视觉任务从静态的‘分类’升维为动态的‘问答’与‘假设检验’。同时,将符号逻辑与神经表征相结合,让模型在拥有连续特征嵌入的同时,能够提取出离散的、可操纵的结构化关系,例如‘A物体支撑B物体’、‘C事件导致D状态’。只有让模型具备对因果结构的显式表达,它才能在面对未知场景时表现出常识性的推理,而非仅仅依赖数据中的相关性。
当然,这条回归结构之路充满挑战。我们需要放弃部分‘端到端’的便利,重新设计能注入物理规律、几何约束和因果断言的网络架构;我们需要开发新的基准测试,不局限于标准数据集上的准确率,而是评估模型在干预性实验、反事实推理和少样本泛化上的能力;我们还需要跨学科合作,从认知科学、发展心理学中汲取灵感,构建能够模拟人类视觉发展过程的计算模型。但这并非倒退,而是一次深刻的范式跃迁——从‘看’到‘知’,从‘感知’到‘理解’。未来十年的计算机视觉,将不再是训练数据的军备竞赛,而是结构先验与数据力量相互融合的艺术。那些勇于打破数据幻象、重建视觉结构的探索者,终将解开视觉智能的真正奥秘。