DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Open-source reasoning model claimed to match o1 performance at 1/20th training cost
Open-source reasoning model claimed to match o1 performance at 1/20th training cost