一个有情怀的公众号。机器学习、自然语言处理、算法等知识集中营、期待与你相遇~
今天看啥  ›  专栏  ›  机器学习算法与自然语言处理

详解这一年多模态视觉-语言大模型的架构演进

机器学习算法与自然语言处理  · 公众号  ·  · 2024-07-04 00:00
    

文章预览

MLNLP 社区是国内外知名的机器学习与自然语言处理社区,受众覆盖国内外NLP硕博生、高校老师以及企业研究人员。 社区的愿景 是促进国内外自然语言处理,机器学习学术界、产业界和广大爱好者之间的交流和进步,特别是初学者同学们的进步。 转载自 | 青稞AI 作者 | Dreamweaver 本文回顾了多模态LLM (视觉-语言模型) 近一年来的模型架构演进,对其中有代表性的工作进行了精炼总结,截止2024.04,持续更新ing... 欢迎大家多多点赞、收藏、讨论 这篇综述一张图总结了多模态LLM的典型架构: BLIP 【2022.01发布】[1] 统一视觉-语言理解和生成,使用captioner+filter高效利用互联网有噪数据 模型架构: • Image/text encoder: ITC loss对齐视觉和语言表征,基于ALBEF提出的momentum distillation • Image-grounded text encoder: ITM loss建模视觉-语言交互,区分positive/negative图文对,使用ha ………………………………

原文地址:访问原文地址
快照地址: 访问文章快照
总结与预览地址:访问总结与预览