注册
登录
专栏名称:
GiantPandaCV
专注于机器学习、深度学习、计算机视觉、图像处理等多个方向技术分享。团队由一群热爱技术且热衷于分享的小伙伴组成。我们坚持原创,每天一到两篇原创技术分享。希望在传播知识、分享知识的同时能够启发你,大家一起共同进步(・ω<)☆
我也要提交微信公众号
今天看啥
微信公众号rss订阅, 微信rss, 稳定的RSS源
微信公众号RSS订阅方法
B站投稿RSS订阅方法
雪球动态RSS订阅方法
微博RSS订阅方法
微博搜索关键词订阅方法
豆瓣日记 RSS订阅方法
目录
相关文章推荐
今天看啥
›
专栏
›
GiantPandaCV
OpenAI o1 技术初探1:整体框架,利用Test-Time Scaling Law提升逻辑推理能力
GiantPandaCV
·
公众号
·
3D
· 2024-10-21 14:26
文章预览
前段日子OpenAI推出的o1模型,以其提升显著的逻辑推理能力,引发了人们对它背后训练方法的热烈讨论。关于o1的介绍和输出结果demo,这里就不再赘述,大家可以去openai的官网上阅读(很短,读起来很快,因为秘密都藏好了)。我相信最近的一段时间里,当大家在网上探索o1是如何训练时,肯定会看到以下几个热点词: Test/Inference-Time scaling law,通过增加推理阶段的算力提升模型的推理能力 Post Training,通过后训练提升模型的推理能力 PRM/ORM:基于过程/结果的奖励模型 CoT:思维链 强化学习、self-play(自我博弈)与MCTS(蒙特卡洛搜索树算法 ) 等等。 当这些词单个出现在我们面前时,我们似乎很难把他们串在一起。不仅如此,我们也不知道单个词背后的原理,比如“什么是test/inference-time scaling law"?什么叫把算力花在推理阶段?为什么把算力花在推理 ………………………………
原文地址:
访问原文地址
快照地址:
访问文章快照
总结与预览地址:
访问总结与预览
分享到微博
推荐文章
动脉橙果局
·
第五期全国卫生领域技术经理人培训班扬帆再起航
7 月前
OFweek维科网
·
拍摄LGD广州工厂图纸,这家面板大厂员工被起诉逮捕!
5 月前
安居客广州
·
起猛了!珠城二手地板价刷新,惊现2字头低价?
4 月前
新加坡国立大学EMBA
·
新生专辑 | 新加坡国立大学中文EMBA第33A班
4 月前
黄益贺
·
微调Llama 3.1,用神器Unsloth
6 月前