专栏名称: Hugging Face

The AI community building the future.

我也要提交微信公众号

今天看啥

微信公众号rss订阅, 微信rss, 稳定的RSS源

微信公众号RSS订阅方法

B站投稿RSS订阅方法

雪球动态RSS订阅方法

微博RSS订阅方法

微博搜索关键词订阅方法

豆瓣日记 RSS订阅方法

相关文章推荐

中国建筑 · 北京城市更新最佳实践奖④丨北京市经开区地铁万 ... · 2 天前

智讯ZEX · 【一键短视频】版本上线！5分钟，即刻生成法律 ... · 3 天前

睡前人间 · 【产经破壁机033】拆掉方向盘，马斯克的美国 ... · 4 天前

风清扬大侠 · mate70新题材双层OLED屏幕概念股小表哥 · 4 天前

分享迷 · 全套TV版+插件，支持AppleTV+安卓+ ... · 5 天前

今天看啥 › 专栏 › Hugging Face

为视觉语言多模态模型进行偏好优化

Hugging Face · 公众号 · · 2024-07-16 10:30

文章预览

训练模型使得它能够理解并预测人类偏好是一项比较复杂的任务。诸如 SFT (Supervised finetuning) 的传统的方法一般都需要耗费较大成本，因为这些算法需要对数据打上特定的标签。而偏好优化 (Preference Optimization) 作为一种替代选项，通常可以简化这一过程，并产出更准确的结果。通过对候选回答的对比和排序，而不是赋予固定的标签，偏好优化使得模型能更高效地捕捉人类偏好中的细微差别。偏好优化已经在大语言模型中广泛使用了，但现在，它也可以用在视觉语言模型 (VLM) 上。得益于 TRL 的开发，现在我们可以使用 TRL 对 VLM 进行直接偏好优化 (Direct Preference Optimization)。本文将会介绍使用 TRL 和 DPO 对视觉语言模型进行训练的全过程。 TRL https://hf.co/docs/trl/index 偏好数据集进行偏好优化，首先我们需要有一个能体现用户偏好的数据集。在双项选择 ………………………………

原文地址：访问原文地址
快照地址：访问文章快照
总结与预览地址：访问总结与预览

分享到微博

推荐文章

中国建筑 · 北京城市更新最佳实践奖④丨北京市经开区地铁万源街站点周边片区城市更新项目之北京智慧融媒创新中心

2 天前

中国建筑 · 北京城市更新最佳实践奖④丨北京市经开区地铁万源街站点周边片区城市更新项目之北京智慧融媒创新中心

2 天前

智讯ZEX · 【一键短视频】版本上线！5分钟，即刻生成法律内容短视频

3 天前

智讯ZEX · 【一键短视频】版本上线！5分钟，即刻生成法律内容短视频

3 天前

睡前人间 · 【产经破壁机033】拆掉方向盘，马斯克的美国特色无人车

4 天前

睡前人间 · 【产经破壁机033】拆掉方向盘，马斯克的美国特色无人车

4 天前

风清扬大侠 · mate70新题材双层OLED屏幕概念股小表哥

4 天前

风清扬大侠 · mate70新题材双层OLED屏幕概念股小表哥

4 天前

分享迷 · 全套TV版+插件，支持AppleTV+安卓+iOS…

5 天前

分享迷 · 全套TV版+插件，支持AppleTV+安卓+iOS…

5 天前

爱可可-爱生活 · 《爱可可微博热门分享(7.19)》爱可可微博热门分享(7.1-20240719225747

3 月前