DeepSeek-R1 论文登上《自然》封面,通讯作者为梁文锋
创始人
2025-09-18 09:21:37
0

IT之家 9 月 18 日消息,由 DeepSeek 团队共同完成、梁文锋担任通讯作者的 DeepSeek-R1 推理模型研究论文,登上了国际权威期刊《自然(Nature)》第 645 期的封面。与今年 1 月发布的 DeepSeek-R1 的初版论文相比,本次论文披露了更多模型训练的细节。

据悉,DeepSeek-R1 也是全球首个经过同行评审的主流大语言模型。Nature 评价道:目前几乎所有主流的大模型都还没有经过独立同行评审,这一空白“终于被 DeepSeek 打破”。

论文摘要显示,通用推理一直是人工智能(AI)领域一项长期且艰巨的挑战。近年来,以大型语言模型(LLMs)、和思维链(CoT)提示为代表的技术突破,已在基础推理任务上取得了显著成功。然而,这种成功在很大程度上依赖于大量人工标注的演示数据,且模型在处理更复杂问题时的能力仍显不足

研究表明,大型语言模型的推理能力可通过纯强化学习(RL)来激发,无需依赖人工标注的推理轨迹。所提出的强化学习框架能够促进高级推理模式的自主形成,例如自我反思、验证和动态策略调整

因此,经训练的模型在数学、编程竞赛和 STEM(科学、技术、工程、数学)领域等可验证任务上展现出更优异的性能,优于通过传统监督学习(基于人工演示数据)训练的同类模型。此外,这些大规模模型所呈现的自主形成的推理模式,可被系统性地用于指导和提升小型模型的推理能力。

IT之家附论文链接:

相关内容

热门资讯

美国打压进口多晶硅,中使馆回应 【环球时报报道 记者 倪浩 尹野平】当地时间8月6日,美国总统特朗普签署行政令,依据《1962年贸易...
历史性一天,给美国的一个强烈信... 对中东来说,这是历史性的一天。沙特王储萨勒曼、土耳其总统埃尔多安、巴基斯坦总理夏巴兹,8月7日在沙特...
美参议院法案拟对中印加税100... 据美国消费者新闻与商业频道(CNBC)8月7日报道,美国参议院周五以压倒性优势通过了一项对俄罗斯制裁...
华为×Les Néréides... IT之家 8 月 7 日消息,华为终端 BG CEO 何刚今日宣布,FreeClip 2 耳夹耳机配...
2026年正规的手机取卡针品控... 现在手机数码行业更新迭代速度越来越快,终端品牌对供应链配套的要求也越来越高,一个小小的手机取卡针,虽...
预计“白海豚”明晚将在浙江舟山... 今天6时中央气象台发布台风橙色预警和强对流天气蓝色预警。台风橙色预警今年第13号台风“白海豚”(强台...
谷歌AI业务重组幕后:商业化压... 财联社8月7日讯(编辑 史正丞)本周早些时候, 美国互联网巨头谷歌宣布对旗下AI业务展开全面洗牌。D...
喜报!古田一小斩获全国青少年无... 近日,第十届全国青少年无人机大赛总决赛在天津收官。古田县第一小学慈育雏鹰基地无人机社团6名学子,在基...
加媒:加拿大正与美国商讨,以贸... 据加拿大《环球邮报》8月7日消息,知情人士称,加拿大和美国正在讨论一项潜在协议。根据该协议,渥太华将...
德意电器油烟机怎么样,口碑好吗 最佳回答 你好,得意的抽油烟机虽然不怎么做广告,但是人家很牛啊,不做广告,我的价格依然很高,关键是,...