超越像素的错觉:计算机视觉需要一场从“感知”到“理解”的范式革命

🔑 关键词:计算机视觉,表征学习,因果推理,感知与认知,范式革命

📖 摘要:本文批判性审视当前计算机视觉领域对深度学习的过度依赖,指出其本质仍是“高级像素分类器”,缺乏真正的视觉推理能力。通过对比生物视觉系统与人工神经网络的结构性差异,提出一种融合主动感知、因果推断与符号-神经混合的新范式,并讨论其实现路径与潜在挑战。

超越像素的错觉:计算机视觉需要一场从“感知”到“理解”的范式革命

图片

当前计算机视觉领域被深度学习,尤其是卷积神经网络(CNN)和视觉Transformer(ViT)所主导。这些模型在ImageNet等基准测试上取得了超越人类的准确率,但这是否意味着机器真正“看见”了世界?本文认为,绝大多数现代视觉系统本质上仍是极其复杂的像素映射器——它们擅长学习训练数据中的统计规律,却从未触及视觉的终极目标:对物理世界的结构化理解。我们观察到一个矛盾的对比:一个六岁儿童能一眼识别出从未见过的卡通形象、理解遮挡关系、推断物体的未来运动,而最强大的AI系统却会在精心设计的对抗样本下产生荒唐的误判。这种脆弱性暴露了当前范式的根本缺陷——模型学到的是相关性的表面模式,而非因果性的生成机制。

图片

从表征层面看,深度学习视觉模型使用分布式特征向量编码图像内容,这种表示具有连续性和可微性,但对离散的、符号化的关系(如“A在B之上”“A推动B”)缺乏显式建模。相比之下,生物视觉系统在大脑中形成了多层级、多模态的稀疏表征,其中包含了大量的几何结构、物理属性和因果关系的编码。神经科学家发现,视觉皮层不仅仅被动接收视网膜信号,还会通过眼动、注意力和脑干反馈主动采样信息,形成“感知-行动”闭环。而当前主流架构多以静态图像批处理为输入,没有内在的探索机制,因此只能“看”而不能“注视”,只能“识别”而不能“追问”。这种范式差异导致机器在复杂场景理解、具身交互和零样本泛化等任务上表现糟糕。

图片

值得深思的是,最近一些研究试图通过大规模预训练和自监督学习来“涌现”更高级的视觉能力,例如CLIP对齐视觉与语言,BEiT、MAE等模型学习重建或对比特征。不可否认,这些方法拓宽了视觉表征的语义边界,但本质上仍是在高维空间中做统计插值。它们可以回答“图像里有猫”,却无法回答“猫为什么用后腿挠耳朵”或“如果我把碗往左推,它会碰到杯子吗”。后者需要的不是更精细的特征,而是关于物理实体、时空过程和因果链的推断能力。换言之,计算机视觉亟需从“感知级模拟”跃升至“认知级建模”。我提出一个全新观点:视觉系统应该是“可落地的知识引擎”——它必须将像素流转换为具有真值条件的结构化命题,并通过模拟或想象来验证这些命题的合理性。这种思路可称为“视觉逻辑与物理推理的融合范式”,其核心是构建一个动态场景图(Dynamic Scene Graph),其中节点代表实体,边代表时空关系与交互,而边的更新时间步由主动感知策略驱动。

图片

当然,这种范式变革并非易事,它要求我们摒弃“用更大Transformer堆叠一切”的路径依赖,转而从认知科学、发展心理学和物理学中汲取灵感。我们需要设计新的损失函数,不仅仅惩罚分类误差,还要惩罚对场景物理状态预测的偏差;我们需要研发神经符号混合架构,让神经网络负责从像素到元语的翻译,而符号部件负责基于规则的逻辑推理;我们还需要与环境交互的训练协议,让视觉系统通过“试错”学习因果模型,而不是仅仅从静态数据中提取表面相关性。诚然,这条路充满挑战,但唯有如此,计算机视觉才能真正从“像素的幻象”走向“世界的智识”。否则,我们只是在构建越来越精致的海市蜃楼,而距离真正的视觉理解愈发遥远。

图片