专栏名称: 计算机视觉研究院
主要由来自于大学的研究生组成的团队,本平台从事机器学习与深度学习领域,主要在人脸检测与识别,多目标检测研究方向。本团队想通过计算机视觉战队平台打造属于自己的品牌,让更多相关领域的人了解本团队,结识更多相关领域的朋友,一起来学习,共同进步!
今天看啥  ›  专栏  ›  计算机视觉研究院

再战Transformer!原作者带队的Mamba 2来了,新架构训练效率大幅提升

计算机视觉研究院  · 公众号  ·  · 2024-06-05 11:12
点击蓝字关注我们关注并星标从此不迷路计算机视觉研究院公众号ID|计算机视觉研究院学习群|扫码在主页获取加入方式论文地址:https://arxiv.org/pdf/2405.21060GitHub 地址:https://github.com/state-spaces/mamba论文标题:Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality 计算机视觉研究院专栏Column of Computer Vision Institute自 2017 年被提出以来,Transformer 已经成为 AI 大模型的主流架构,一直稳居语言建模方面 C 位。但随着模型规模的扩展和需要处理的序列不断变长,Transformer 的局限性也逐渐凸显。一个很明显的缺陷是:Transformer 模型中自注意力机制的计算量会随着上下文长度的增加呈平方级增长。几个月前,Mamba 的出现打破了这一局面,它可以随上下文长度的增加实现线性扩展。随着 Mamba 的发布,这些状态空间模型 (SSM) 在中小型规 ………………………………

原文地址:访问原文地址
快照地址: 访问文章快照