清华微软最新力作：用物理学革新Transformer注意力，「大海捞针」精度暴涨30%！

江大白 · 公众号 · · 2024-10-12 08:00

文章预览

以下文章来源于微信公众号：极市平台作者：极市平台链接：https://mp.weixin.qq.com/s/upLUoqVDewSeoxjfBKdOXA 本文仅用于学术分享，如有侵权，请联系后台作删文处理导读随着诺贝尔物理学奖颁给了「机器学习之父」Geoffrey Hinton，另一个借鉴物理学概念的模型架构也横空出世——微软清华团队的最新架构Differential Transformer，从注意力模块入手，实现了Transformer的核心能力提升。随着近些年来NLP领域研究的不断深入，我们逐渐发现，Transformer架构中出现的幻觉问题，以及各种下游任务中的性能不足，都或多或少与注意力缺陷有关。虽然上下文窗口可以扩展，但是Transformer还是无法真正关注到有价值的信息。最近，微软研究院和清华大学的研究人员共同提出了一种新的模型架构——Differential Transformer，不仅保留了原始Transformer中的可扩展性，也能让模型更 ………………………………

原文地址：访问原文地址
快照地址：访问文章快照
总结与预览地址：访问总结与预览

分享到微博

推荐文章

跟宇宙结婚 · 节目更新：跟宇宙结婚悄悄话 vol.236 在雨中跑来一堆闹将

昨天

跟宇宙结婚 · 日常叨叨：上饿了么搜【跟宇宙结婚】领红包哟

昨天

体坛周报 · 热议 | 赢得对王楚钦的关键战役，樊振东回归乒超表现抢眼！

3 天前

体坛周报 · 热议 | 赢得对王楚钦的关键战役，樊振东回归乒超表现抢眼！

3 天前

体坛周报 · 聚焦 | 乒超联赛第一阶段落幕，八支晋级总决赛球队诞生！

3 天前

体坛周报 · 聚焦 | 乒超联赛第一阶段落幕，八支晋级总决赛球队诞生！

3 天前

跟宇宙结婚 · 日常念叨：上饿了么搜【跟宇宙结婚】领红包哟

4 天前