视觉模型的暗面:当计算视觉失去物理常识,我们只是在做高级拟合
一、从识别到拟合:我们丢失了视觉的本源
深度学习革命以来的计算机视觉,本质上是一条不断加宽、加深的曲线拟合之路。我们赋予模型数以亿计的参数,喂给它海量的标注图像,然后用梯度下降法把输入到输出的映射关系打磨得无比光滑。诚然,在ImageNet、COCO等基准上,分类、检测、分割的精度曲线仍在缓慢爬升,但一个令人不安的事实逐渐浮出水面:这些模型在实验室里的光鲜表现,一旦遭遇真实世界的微小扰动——光照突变、物体遮挡、视角倾覆——就如同纸牌屋般坍塌。我们极少追问一个根本性问题:视觉,真的是从像素直接跃迁到语义标签吗?人类婴儿不需要看到几百万张猫的图片才能认识猫,他只需要一次偶然的触摸和几次观察,就能理解猫的柔软、会动、会发出声音,以及猫是独立于背景的连续实体。视觉从不是孤立的像素统计,而是与触觉、运动、因果关系纠缠在一起的对物理世界的感知。当我们把视觉简化为一个I/O映射,我们实际上阉割了视觉的全部生存意义。
当前主流的自监督学习——对比学习、掩码重建等——试图从图像本身的统计结构里挖掘线索,这比依赖人工标注进步了一截,但其本质仍然是在捕捉像素级别的相关性。CLIP试图用文本拉近视觉与语义的距离,但它学会的只是图像与文本片段的共现概率,而不是事物在物理世界中的行为法则。诚然,大模型凭借参数量和数据量堆出了惊人的“抽象能力”,但那是基于庞大语料和图像对的统计相关性,一种高级的插值艺术。当模型在测试时遇到分布外数据,它并没有“理解”的能力,只是在高维空间中寻找一个最近的邻居。我们以为我们在构建视觉智能,实际上我们在构建一个无比精巧的自动编码器。
这种范式带来的直接后果是,视觉系统对鲁棒性和适应性的极端匮乏。你可以在合成图像上训练一个完美的机械零件检测器,但一旦真实光线产生金属反光,模型就立即失效。为什么人类不会被这种反光欺骗?因为人类知道金属是硬的,反光只是表面纹理,不改变物体的几何和身份。这种知识——关于物体材质、惯性、运动连续性的基本物理直觉——完全是视觉模型缺失的。我们试图用更多数据、更强增强、更大模型来掩盖这个缺陷,但数据增强只是人工模拟了一些变换,并没有把物理规律内化进模型表达能力。结果是,我们拥有了无所不知的视觉模型,却对世界一无所知。
因此,我提出一个观点:计算机视觉的未来不在于更精巧的神经网络架构,不在于更大的数据集,而在于如何把物理世界的因果结构和常识嵌入视觉表征。我们需要从“拟合”走向“理解”,从“统计相关”走向“因果干预”。这不是一句空话,而是对视觉本质的回归——视觉原本就是物理智能的一部分。
二、为什么物理先验是视觉推理的必然解
视觉智能的核心任务不是给图像贴标签,而是从图像中提取可用于行动和预测的信息。即使是一张静态图片,它也冻结了物理世界的一个瞬间——物体间的遮挡关系、光照方向、反射率、几何连续性、乃至隐隐约约的因果痕迹(例如破碎的窗户暗示着冲击)。人类视觉系统在进化中早已将这类物理规律内化为视觉皮层的默认机制。婴儿的深度知觉、物体永存认知、以及面对违反物理直觉的场景时的惊讶表情,都证明先天物理直觉的存在。而当前的深度神经网络所获得的“知识”却完全是后天的、仅基于训练集分布的。
将物理先验引入视觉模型,并非要在网络中加入显式的手工规则——那是符号人工智能的老路,已被证明过于脆弱——而是要在训练范式上实现突破。我们可以借助可微分渲染器,让模型在训练时不仅看到真实像素,还看到物理约束下的潜在场景表示。比如,一个物体在受到重力时会下落,在没有支撑时会滑倒,在遇到障碍时会产生形变。这些规律可以通过物理引擎模拟出无限多符合因果关系的场景,然后让模型学会在顶层表征中保留这些关系。简单来说,我们期望模型从“图像A中存在球”进步为“图像A中球位于斜坡上,它会滚下来,并可能撞翻旁边的杯子”。后者需要模型具备一种“视觉想象能力”,能够对当前状态进行物理推演,这正是当前模型完全缺失的。
这种能力也是通往通用视觉智能的必经之路。试想,如果一个人工智能系统要在家庭环境中服务用户,它需要理解杯子掉在地上会碎、纸巾被风会吹走、书本竖放容易倒。这些知识无法通过静态图像学习,因为静态图像没有提供作用力和时间演化信息。但如果我们在视觉表征中加入运动趋势和力场,模型就能对下一帧或下一动作做出预判。另一个方向是引入因果发现技术。在一段视频序列中,我们不仅学到“A伴随B发生”,而且通过干预(遮挡或变换A)学到“改变A会导致B改变,而改变B不会影响A”——这种非对称关系就是因果结构。训练完成后,模型看到静态图时也能激活这种因果结构,从而在新的环境中做出符合物理常识的决策。
诚然,这条路充满艰难。物理先验的引入需要承担更大的计算开销,要在图像空间中解耦物理属性(材质、质量、摩擦系数)和视觉外观,这本身就是极具挑战的逆问题。但正因为艰难,才有真正的突破价值。对比现有的暴力拟合范式,物理先验能够带来真正的泛化——分布外泛化、跨域泛化、语意组合泛化。线性组合的“猫+毛”我们已能应对,但“会抓鱼的猫”与“会爬树的鱼”这种反事实场景,只有基于物理和因果的模型才能正确处理。我们不应害怕引入先验,因为先验恰恰是人类智能的基石。
三、重构对比度:任务驱动的视觉不应该被数据绑架
当前视觉研究的另一个严重误区是对公开数据集的锚定效应。每一代新的SOTA都诞生于同一个基准,每篇论文都在反复咀嚼同一个数据的统计规律,看似百花齐放,实则内卷。我们完全忽略了一个事实:真实世界的视觉任务千差万别——在手术中分析内窥镜图像,机器人分拣垃圾,无人机在暴风中降落的视觉导航——这些任务的数据分布、噪声模式、物理交互都完全不同。以固定数据集为唯一衡量标尺,本质上是一种思维惰性。真正有对比度的视觉研究应该以任务为核心来重新定义问题和评价指标。
以任务驱动意味着视觉系统应该具有“主动感知”能力。它不应只是被动接收图像流,而是能根据当前任务的不确定性去主动获取观测。例如,一个自动驾驶系统在十字路口光凭摄像头无法判断被遮挡的行人,这时它应该融合激光雷达或调整视角——这要求视觉系统知道自己“不知道什么”。当前模型无法量化自身的认知空洞,它只能给出一个置信度,但这个置信度常常是错误校准的。我们需要构建一种新的视觉架构,其中包含显式的不确定性估计与信息增益目标。当模型不确定时,它能主动规划下一步观测(调整焦距、改变角度、等待行人移动),使信息增益最大化。这种机制完全超越了当前“喂数据-学映射”的单向流程。
另一个被忽视的维度是时间上的因果一致性。现有模型基本上以独立帧为单位处理视觉输入,即使有视频模型,也大多是在时序上做简单的池化或注意力。但真实世界是高度时间连续且因果闭合的。一个乱糟糟的桌面在未被触碰时不会突然自己变整洁,这就是因果一致性。如果我们让模型在训练中不仅学习每一帧的语义,还要学习帧与帧之间的可迁移性(同一物体在不同帧应保持特征稳定,且其变化应遵循物理律),那么模型就会自动建立起对世界状态的稳定表征。这比当前单纯使用时间对比学习(如VideoMAE)要强得多,因为它不是在像素层面做预测,而是在场景图和物理参数层面做预测。
我还想强调:对比度并不需要一味求新。我们应该敢于质疑“越大越好”的信仰。有一批研究者开始用很小的模型配合强物理先验达到甚至超过大模型的性能,这本身就是一种范式对比。例如,在桌面机器人抓取任务中,一个显式编码了物体质心和摩擦力的模型,仅用数百张真实图像就能胜过用数万张图像训练的端到端大模型。这个对比告诉我们:深度学习的潜力不在于吃掉所有数据,而在于如何把数据的深层结构挖掘到极致。复用已有的物理知识是远远不够的,我们需要创造全新的视觉语言来表述物理交互。
四、我们该如何走出当下的困局?——迈向物理启发的视觉智能
基于以上分析,我认为计算机视觉的下一步革命将发生在模型结构、学习目标和数据生成三个层面。首先,模型结构方面,我们需要重新引入显式的几何和物理模块。不必全篇都交给可微分渲染器,而是可以构造一种“混合架构”:底层使用卷积或Transformer提取视觉特征,中间层引入场景图或物体节点来建模空间关系和物理属性,顶层通过一个轻量物理模拟器对状态进行forward预测。这样的结构既吸收了深度学习的特征表达能力,又赋予了模型推理和想象的能力。当模型看到新图像时,它能够通过上述结构“模拟”出物体的未来状态,这比纯粹从数据中学习到的“伪推理”要可靠得多。
其次,在学习目标上,我们要把“预测下一帧”从像素级提升到物理级。目前的自监督方法,比如MAE,重建的是缺失的像素块,这种做法逼着模型去记忆纹理细节,而忽略更高层的语义。如果我们把目标函数设计为“预测物体在未来时间点的位置、姿态、受力情况”,那么模型必须学习物体的刚性、质量、摩擦力等物理参数。这些参数虽然不直接可见,但可以从视频序列中的动态变化中推断出来。这种学习目标不需要人工标注,因为物理引擎能自动生成完美的监督信号。这就是自监督学习的升级版:不是预测像素,而是预测世界的状态。
再次,数据生成方面,我们应该大力拥抱可微物理渲染器的合成数据。现代图形引擎已经能够生成几乎以假乱真的场景,但真正的价值在于它们是可微的——我们能通过计算梯度来调整场景的物理参数,使合成数据针对性地覆盖模型薄弱的地方。这样的主动学习方式,比盲目采集真实数据效率高得多。关键是我们要脱离“图像逼真度”的执念,转而追求“物理逼真度”。一个卡通化的渲染场景,只要其物理规律(重力、碰撞、光影)一致,就能教会模型通用的物体动力学。这与领域随机化的思想有异曲同工之妙。
最后,我要呼吁研究者们回归视觉本身的意义——不仅是为了识别,更是为了理解、预测和行动。当我们不再用基准分数来衡量进步,而是用模型在未知环境中的适应能力、面对反事实场景时的判断能力、以及进行多步推理的准确性作为标准,计算机视觉才能迎来真正的曙光。我相信,那些把物理先验、因果推理和主动感知融入其中的视觉系统,终将超越以数据为王的时代,成为通往通用AI的关键拼图。本文描述的只是一个起点,但它指向一个更宏大的未来:视觉,将成为连接像素与意义的桥梁,而不只是像素的处理工具。