Controlling Reasoning Effort in LLMs
Explains how LLMs learn low, medium, and high-effort reasoning modes, covering training techniques and effort settings.
Explains how LLMs learn low, medium, and high-effort reasoning modes, covering training techniques and effort settings.
A review of key paradigm shifts in Large Language Models (LLMs) in 2025, focusing on RLVR training and new conceptual models of AI intelligence.
A tutorial on reproducing DeepSeek R1's RL 'aha moment' using Group Relative Policy Optimization (GRPO) to train a model on the Countdown numbers game.