文章预览
↑ 点击 蓝字 关注极市平台 来源丨将门创投 编辑丨极市平台 极市导读 VideoMamba 克服了现有 3D 卷积神经网络和视频转换器的局限性,其线性复杂度运算符可实现高效的长期建模。 >> 加入极市CV技术交流群,走在计算机视觉的最前沿 我们提出了一个仅基于状态空间模型(SSM)的高效视频理解架构VideoMamba,并通过大量的实验证明了它具备一系列良好的特性,包括 (1) Visual Domain Scalability; (2) Short-term Action Sensitivity; (3) Long-term Video Superiority; (4) Modality Compatibility。这使得VideoMamba在一系列视频benchmark上取得不俗的结果,尤其是长视频benchmark,为未来更全面的视频理解提供了更高效的方案。 论文链接: https://arxiv.org/abs/2403.06977 代码链接: https://github.com/OpenGVLab/VideoMamba Huggingface: https://huggingface.co/OpenGVLab/VideoMamba Online Demo: https://huggingface.co/spaces/OpenGVLab/Vide
………………………………