reinforcement learning for language models
TechniqueFirst seen 9/3/2026
Last seen 9/3/2026
Evidence 5 chunks
NEIGHBORHOOD
5 nodes · 7 edgesgraph · reinforcement learning for language models · depth=1
RELATIONSHIPS
4 connectionsThe paper applies reinforcement learning to teach LLMs from verification outcomes.
GRPO is a specific RL technique applied to language model training.
GRPO-SMu is a specific implementation of reinforcement learning for language model training.
RL fine-tuning uses the GRPO-SMu training dataset constructed via tree-based mutations.