Theme of inquiry
How do different training methods affect model reasoning?
A question within its area, explored through 4 lines of inquiry below — each a family of specific questions the research asks.
40 specific questions
- Why does decoupling planning from execution improve over sequential interleaving?
- How does decomposing tasks prevent interference between planning and execution?
- Does algorithmic decomposition prevent planning-execution interference in reasoning?
- How does separating decomposition from execution improve multi-step reasoning accuracy?
- How does task decomposition prevent bias from spreading across therapeutic AI pipelines?
- Does training on granular tasks beat training on the full function calling problem?
- Can task decomposition fragment harmful objectives into locally plausible subtasks?
114 specific questions
- Can reinforcement learning add new capabilities or only remove inaccurate knowledge?
- Can RL create new reasoning primitives that pretraining never established?
- Does RL amplify existing reasoning or create genuinely new computational strategies?
- Does RL refine existing knowledge or discover entirely new capabilities?
- How does RL refine reasoning paths without simply adding model capability?
- When does RL discover genuinely novel reasoning strategies versus timing optimization?
- Does RL primarily teach when to use reasoning or how to reason?
65 specific questions
- How do two-phase training dynamics explain reasoning emergence?
- What distinguishes surface mechanisms from the training regimes that produce them?
- How does post-training shift models from passive prediction to on-policy action?
- Do emergent abilities result from genuine new capabilities or implicit in-context learning?
- How does model scale affect anticipatory behavior in structured training?
- How does in-context learning trigger phase transitions in model behavior?
- What training interventions could close the perception-action gap?
37 specific questions
- What causes policy entropy collapse in reasoning-focused reinforcement learning?
- Does policy entropy collapse limit how many iterations of reasoning training work?
- What happens to model reasoning when policy entropy collapses during RL?
- Why does policy entropy collapse limit reasoning and dialogue RL scaling?
- Does policy entropy collapse prevent inference-time search from finding solutions?
- Why does policy entropy collapse when scaling RL for reasoning?
- How does policy entropy during training affect search discipline during inference?