本文从概率视角重新审视三维卷积神经网络中的时空融合机制,提出了一种统一的概率建模框架,以刻画空间与时间信息在卷积过程中的交互关系。通过将时空融合视为潜在变量条件下的概率推断问题,该方法能够更有效地捕捉视频数据中的动态依赖,并提升模型在动作识别等视频理解任务上的表现。