专栏名称: 图灵人工智能

人工智能及其他科技学术前沿、机器学习、图像识别、语音识别、自动驾驶、自然语言处理、脑机接口、云计算、大数据、物联网、机器人、天文物理、生物科学、数学、区块链、比特币、计算机等学术前沿知识、报告、讲座等介绍。

我也要提交微信公众号

今天看啥

微信公众号rss订阅, 微信rss, 稳定的RSS源

微信公众号RSS订阅方法

B站投稿RSS订阅方法

微博RSS订阅方法

微博搜索关键词订阅方法

豆瓣日记 RSS订阅方法

大模型的模型压缩与有效推理综述

图灵人工智能 · 公众号 · · 2024-07-11 00:00

文章预览

单击上方“ 图灵人工智能 ”，选择“星标”公众号您想知道的人工智能干货，第一时间送达 1 介绍本文对大型语言模型的压缩和效率推理进行了综述。大型语言模型基于Transformer架构，具有强大的性能，但也带来了巨大的内存和计算成本。本文从算法角度对大型语言模型的压缩和效率推理方法进行了分类，包括量化、剪枝、知识蒸馏、紧凑架构设计和动态网络。大型语言模型有两个显著特点：（1）大多数压缩算法需要在压缩后对模型进行微调和甚至重新训练，而大型模型的微调和训练成本非常高。因此，许多算法，如量化和剪枝，开始探索免调优算法。（2）大型模型强调通用性和泛化能力，而非单一任务的性能。因此，许多算法，如知识蒸馏，关注如何在压缩后保留其通用性和泛化能力。 2 基本知识 2.1 Transformer Transformer 是一种用于机器 ………………………………

原文地址：访问原文地址
快照地址：访问文章快照
总结与预览地址：访问总结与预览

分享到微博