Skip to content
STIMSMITH

reinforcement learning for language models

Technique
First seen 9/3/2026
Last seen 9/3/2026
Evidence 5 chunks

NEIGHBORHOOD

5 nodes · 7 edges
graph · reinforcement learning for language models · depth=1

RELATIONSHIPS

4 connections
The paper applies reinforcement learning to teach LLMs from verification outcomes.
Group Relative Policy Optimization ← implements 100% 2e
GRPO is a specific RL technique applied to language model training.
GRPO with State Mutation ← implements 100% 2e
GRPO-SMu is a specific implementation of reinforcement learning for language model training.
GRPO-SMu training dataset uses → 100% 1e
RL fine-tuning uses the GRPO-SMu training dataset constructed via tree-based mutations.