专栏名称: GiantPandaCV

专注于机器学习、深度学习、计算机视觉、图像处理等多个方向技术分享。团队由一群热爱技术且热衷于分享的小伙伴组成。我们坚持原创，每天一到两篇原创技术分享。希望在传播知识、分享知识的同时能够启发你，大家一起共同进步(･ω<)☆

我也要提交微信公众号

今天看啥

微信公众号rss订阅, 微信rss, 稳定的RSS源

微信公众号RSS订阅方法

B站投稿RSS订阅方法

雪球动态RSS订阅方法

微博RSS订阅方法

微博搜索关键词订阅方法

豆瓣日记 RSS订阅方法

OpenAI o1 技术初探1：整体框架，利用Test-Time Scaling Law提升逻辑推理能力

GiantPandaCV · 公众号 · 3D · 2024-10-21 14:26

文章预览

前段日子OpenAI推出的o1模型，以其提升显著的逻辑推理能力，引发了人们对它背后训练方法的热烈讨论。关于o1的介绍和输出结果demo，这里就不再赘述，大家可以去openai的官网上阅读（很短，读起来很快，因为秘密都藏好了）。我相信最近的一段时间里，当大家在网上探索o1是如何训练时，肯定会看到以下几个热点词： Test/Inference-Time scaling law，通过增加推理阶段的算力提升模型的推理能力 Post Training，通过后训练提升模型的推理能力 PRM/ORM：基于过程/结果的奖励模型 CoT：思维链强化学习、self-play（自我博弈）与MCTS（蒙特卡洛搜索树算法）等等。当这些词单个出现在我们面前时，我们似乎很难把他们串在一起。不仅如此，我们也不知道单个词背后的原理，比如“什么是test/inference-time scaling law"？什么叫把算力花在推理阶段？为什么把算力花在推理 ………………………………

原文地址：访问原文地址
快照地址：访问文章快照
总结与预览地址：访问总结与预览

分享到微博