专栏名称: 新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
今天看啥  ›  专栏  ›  新智元

DeepSeek开源o1击毙OpenAI,强化学习惊现「啊哈」时刻!网友:AGI来了

新智元  · 公众号  · AI  · 2025-01-21 12:29
    

文章预览

   新智元报道   编辑:编辑部 Yhs 【新智元导读】 中国版o1刷屏全网。DeepSeek R1成为世界首个能与o1比肩的开源模型,成功秘诀竟是强化学习,不用监督微调。AI大佬们一致认为,这就是AlphaGo时刻。 一觉醒来,AGI就实现了?!中国开源版o1,直接冲爆了整个AI圈。 继DeepSeek V3之后,DeepSeek再次官宣了全新推理模型——DeepSeek-R1。 让所有人为之震惊的是,新模型直接与o1打平手,关键还是开源版的o1。 当人们扒开其22页技术报告后发现,DeepSeek-R1在强化学习阶段之前,没有进行微调SFT,便在性能上刷新SOTA。 也就是说,R1自己就学会了推理,就像战胜人类的AlphaZero/AlphaGo一样。 还有一点,就是连研究人员都没有预料到——R1竟出现了「啊哈」时刻! 研究人员称,这一刻凸显了强化学习的力量和美妙之处。 「我们没直接教模型如何解决问题,只是给予它正 ………………………………

原文地址:访问原文地址
快照地址: 访问文章快照
总结与预览地址:访问总结与预览