专栏名称: 新智元

智能+中国主平台，致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展，关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响，领航中国新智能时代。

我也要提交微信公众号

今天看啥

微信公众号rss订阅, 微信rss, 稳定的RSS源

微信公众号RSS订阅方法

B站投稿RSS订阅方法

雪球动态RSS订阅方法

微博RSS订阅方法

微博搜索关键词订阅方法

豆瓣日记 RSS订阅方法

DeepSeek开源o1击毙OpenAI，强化学习惊现「啊哈」时刻！网友：AGI来了

新智元 · 公众号 · AI · 2025-01-21 12:29

文章预览

新智元报道编辑：编辑部 Yhs 【新智元导读】中国版o1刷屏全网。DeepSeek R1成为世界首个能与o1比肩的开源模型，成功秘诀竟是强化学习，不用监督微调。AI大佬们一致认为，这就是AlphaGo时刻。一觉醒来，AGI就实现了？！中国开源版o1，直接冲爆了整个AI圈。继DeepSeek V3之后，DeepSeek再次官宣了全新推理模型——DeepSeek-R1。让所有人为之震惊的是，新模型直接与o1打平手，关键还是开源版的o1。当人们扒开其22页技术报告后发现，DeepSeek-R1在强化学习阶段之前，没有进行微调SFT，便在性能上刷新SOTA。也就是说，R1自己就学会了推理，就像战胜人类的AlphaZero/AlphaGo一样。还有一点，就是连研究人员都没有预料到——R1竟出现了「啊哈」时刻！研究人员称，这一刻凸显了强化学习的力量和美妙之处。「我们没直接教模型如何解决问题，只是给予它正 ………………………………

原文地址：访问原文地址
快照地址：访问文章快照
总结与预览地址：访问总结与预览

分享到微博