<HashMap><database>biostudies-literature</database><scores/><additional><omics_type>Unknown</omics_type><volume>645(8081)</volume><submitter>Guo D</submitter><pubmed_abstract>General reasoning represents a long-standing and formidable challenge in artificial intelligence (AI). Recent breakthroughs, exemplified by large language models (LLMs)&lt;sup>1,2&lt;/sup> and chain-of-thought (CoT) prompting&lt;sup>3&lt;/sup>, have achieved considerable success on foundational reasoning tasks. However, this success is heavily contingent on extensive human-annotated demonstrations and the capabilities of models are still insufficient for more complex problems. Here we show that the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labelled reasoning trajectories. The proposed RL framework facilitates the emergent development of advanced reasoning patterns, such as self-reflection, verification and dynamic strategy ad</pubmed_abstract><journal>Nature</journal><pagination>633-638</pagination><full_dataset_link>https://www.ebi.ac.uk/biostudies/studies/S-EPMC12443585</full_dataset_link><repository>biostudies-literature</repository><pubmed_title>DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning.</pubmed_title><pmcid>PMC12443585</pmcid><pubmed_authors>Li XQ</pubmed_authors><pubmed_authors>Xue B</pubmed_authors><pubmed_authors>Liang W</pubmed_authors><pubmed_authors>Sha Z</pubmed_authors><pubmed_authors>Guo Y</pubmed_authors><pubmed_authors>Zhang H</pubmed_authors><pubmed_authors>Lin X</pubmed_authors><pubmed_authors>Zhang M</pubmed_authors><pubmed_authors>Zhang L</pubmed_authors><pubmed_authors>Cai JL</pubmed_authors><pubmed_authors>Zhang R</pubmed_authors><pubmed_authors>Zhang P</pubmed_authors><pubmed_authors>Shi Y</pubmed_authors><pubmed_authors>Wei YX</pubmed_authors><pubmed_authors>Yan Z</pubmed_authors><pubmed_authors>Guo J</pubmed_authors><pubmed_authors>Hao Z</pubmed_authors><pubmed_authors>Liang J</pubmed_authors><pubmed_authors>Guo D</pubmed_authors><pubmed_authors>Su X</pubmed_authors><pubmed_authors>Shen X</pubmed_authors><pubmed_authors>Xu L</pubmed_authors><pubmed_authors>Zheng Y</pubmed_authors><pubmed_authors>Jin X</pubmed_authors><pubmed_authors>Xu R</pubmed_authors><pubmed_authors>Li YK</pubmed_authors><pubmed_authors>Xu H</pubmed_authors><pubmed_authors>Zeng W</pubmed_authors><pubmed_authors>Yuan J</pubmed_authors><pubmed_authors>Wang YQ</pubmed_authors><pubmed_authors>He Y</pubmed_authors><pubmed_authors>Lin F</pubmed_authors><pubmed_authors>Hao G</pubmed_authors><pubmed_authors>Hu K</pubmed_authors><pubmed_authors>Xu Z</pubmed_authors><pubmed_authors>Xu Y</pubmed_authors><pubmed_authors>Zhu Z</pubmed_authors><pubmed_authors>Yu S</pubmed_authors><pubmed_authors>Zhu Y</pubmed_authors><pubmed_authors>Ren Z</pubmed_authors><pubmed_authors>Fu Z</pubmed_authors><pubmed_authors>Qu H</pubmed_authors><pubmed_authors>Jin RL</pubmed_authors><pubmed_authors>Yu K</pubmed_authors><pubmed_authors>Xiao WL</pubmed_authors><pubmed_authors>Cheng X</pubmed_authors><pubmed_authors>Zhao Y</pubmed_authors><pubmed_authors>Tang M</pubmed_authors><pubmed_authors>Zhao L</pubmed_authors><pubmed_authors>Shao Z</pubmed_authors><pubmed_authors>Yu W</pubmed_authors><pubmed_authors>An W</pubmed_authors><pubmed_authors>Yu X</pubmed_authors><pubmed_authors>Tang Y</pubmed_authors><pubmed_authors>Yu Y</pubmed_authors><pubmed_authors>Ni J</pubmed_authors><pubmed_authors>Zhou M</pubmed_authors><pubmed_authors>You Y</pubmed_authors><pubmed_authors>Zhao C</pubmed_authors><pubmed_authors>Zhou S</pubmed_authors><pubmed_authors>Zha Y</pubmed_authors><pubmed_authors>Zhou Y</pubmed_authors><pubmed_authors>Zhou X</pubmed_authors><pubmed_authors>You K</pubmed_authors><pubmed_authors>Wu ZF</pubmed_authors><pubmed_authors>Deng C</pubmed_authors><pubmed_authors>Huang Y</pubmed_authors><pubmed_authors>Huang Z</pubmed_authors><pubmed_authors>Ye S</pubmed_authors><pubmed_authors>Ruan C</pubmed_authors><pubmed_authors>Dai F</pubmed_authors><pubmed_authors>Yun T</pubmed_authors><pubmed_authors>Gou Z</pubmed_authors><pubmed_authors>Dai D</pubmed_authors><pubmed_authors>Zhu YX</pubmed_authors><pubmed_authors>Tian N</pubmed_authors><pubmed_authors>Zhu Q</pubmed_authors><pubmed_authors>Qiu J</pubmed_authors><pubmed_authors>Du Q</pubmed_authors><pubmed_authors>Wang B</pubmed_authors><pubmed_authors>Wu B</pubmed_authors><pubmed_authors>Huang K</pubmed_authors><pubmed_authors>Gao H</pubmed_authors><pubmed_authors>Wang L</pubmed_authors><pubmed_authors>Huang P</pubmed_authors><pubmed_authors>Wang M</pubmed_authors><pubmed_authors>Xiong Y</pubmed_authors><pubmed_authors>Ge R</pubmed_authors><pubmed_authors>Wu Z</pubmed_authors><pubmed_authors>Wang P</pubmed_authors><pubmed_authors>Shan X</pubmed_authors><pubmed_authors>Wang Q</pubmed_authors><pubmed_authors>Xia L</pubmed_authors><pubmed_authors>Wang R</pubmed_authors><pubmed_authors>Dong K</pubmed_authors><pubmed_authors>Wang S</pubmed_authors><pubmed_authors>Wang T</pubmed_authors><pubmed_authors>Wu S</pubmed_authors><pubmed_authors>Ou Y</pubmed_authors><pubmed_authors>Wang X</pubmed_authors><pubmed_authors>Chen X</pubmed_authors><pubmed_authors>Chen S</pubmed_authors><pubmed_authors>Li SS</pubmed_authors><pubmed_authors>Wang Y</pubmed_authors><pubmed_authors>Chen R</pubmed_authors><pubmed_authors>Wu Y</pubmed_authors><pubmed_authors>Li G</pubmed_authors><pubmed_authors>Li H</pubmed_authors><pubmed_authors>Chen Q</pubmed_authors><pubmed_authors>Li J</pubmed_authors><pubmed_authors>Chen J</pubmed_authors><pubmed_authors>Xie X</pubmed_authors><pubmed_authors>Li E</pubmed_authors><pubmed_authors>Xie Z</pubmed_authors><pubmed_authors>Lu C</pubmed_authors><pubmed_authors>Chen G</pubmed_authors><pubmed_authors>Sun T</pubmed_authors><pubmed_authors>Ren ZZ</pubmed_authors><pubmed_authors>Yang D</pubmed_authors><pubmed_authors>Tu J</pubmed_authors><pubmed_authors>Sun X</pubmed_authors><pubmed_authors>Sun Y</pubmed_authors><pubmed_authors>Li M</pubmed_authors><pubmed_authors>Chen D</pubmed_authors><pubmed_authors>Yang X</pubmed_authors><pubmed_authors>Li X</pubmed_authors><pubmed_authors>Li Y</pubmed_authors><pubmed_authors>Li Z</pubmed_authors><pubmed_authors>Gao K</pubmed_authors><pubmed_authors>Tan Y</pubmed_authors><pubmed_authors>Lu S</pubmed_authors><pubmed_authors>Gao Z</pubmed_authors><pubmed_authors>Gao W</pubmed_authors><pubmed_authors>Pei T</pubmed_authors><pubmed_authors>Bi X</pubmed_authors><pubmed_authors>Ding H</pubmed_authors><pubmed_authors>Ma S</pubmed_authors><pubmed_authors>Ma Y</pubmed_authors><pubmed_authors>Ma Z</pubmed_authors><pubmed_authors>Feng B</pubmed_authors><pubmed_authors>Gong Y</pubmed_authors><pubmed_authors>Liu W</pubmed_authors><pubmed_authors>Liu X</pubmed_authors><pubmed_authors>Chen RJ</pubmed_authors><pubmed_authors>Liu Y</pubmed_authors><pubmed_authors>Zou Y</pubmed_authors><pubmed_authors>Liu Z</pubmed_authors><pubmed_authors>Song X</pubmed_authors><pubmed_authors>Nie X</pubmed_authors><pubmed_authors>Song Z</pubmed_authors><pubmed_authors>Ji D</pubmed_authors><pubmed_authors>Guan K</pubmed_authors><pubmed_authors>Pan Z</pubmed_authors><pubmed_authors>Pan S</pubmed_authors><pubmed_authors>Luo F</pubmed_authors><pubmed_authors>Gu Z</pubmed_authors><pubmed_authors>Yan Y</pubmed_authors><pubmed_authors>Song J</pubmed_authors><pubmed_authors>Zhang W</pubmed_authors><pubmed_authors>Zhang Z</pubmed_authors><pubmed_authors>Zhang Y</pubmed_authors><pubmed_authors>Zhang X</pubmed_authors><pubmed_authors>Liu A</pubmed_authors><pubmed_authors>Piao Y</pubmed_authors><pubmed_authors>Pan R</pubmed_authors><pubmed_authors>Luo Y</pubmed_authors></additional><is_claimable>false</is_claimable><name>DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning.</name><description>General reasoning represents a long-standing and formidable challenge in artificial intelligence (AI). Recent breakthroughs, exemplified by large language models (LLMs)&lt;sup>1,2&lt;/sup> and chain-of-thought (CoT) prompting&lt;sup>3&lt;/sup>, have achieved considerable success on foundational reasoning tasks. However, this success is heavily contingent on extensive human-annotated demonstrations and the capabilities of models are still insufficient for more complex problems. Here we show that the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labelled reasoning trajectories. The proposed RL framework facilitates the emergent development of advanced reasoning patterns, such as self-reflection, verification and dynamic strategy ad</description><dates><release>2025-01-01T00:00:00Z</release><publication>2025 Sep</publication><modification>2026-06-03T11:32:50.867Z</modification><creation>2026-04-27T03:10:30.505Z</creation></dates><accession>S-EPMC12443585</accession><cross_references><pubmed>40962978</pubmed><doi>10.1038/s41586-025-09422-z</doi></cross_references></HashMap>