Line of inquiry
Inquiring lines›Why are language models fragile de…›Why does model confidence diverge…›this line of inquiry
Why does self-revision fail to improve and instead amplify confidence?
A broader line of inquiry — a family of 54 specific questions the research asks around this. Follow one into its inquiring-line page, or move sideways to a related line below.
Questions in this line of inquiry 54
Specific inquiring lines the field asks around this — ordered from the most general framing down to the most specific angle.
- How does self-revision in reasoning chains amplify confidence in wrong answers?
- Why does model self-revision increase confidence while degrading accuracy?
- Why does single-model self-revision amplify confidence in incorrect answers?
- How does self-revision on wrong answers increase model confidence further?
- Why do reasoning models struggle with self-evaluation and revision?
- Why do reasoning models amplify confidence in incorrect answers during self-revision?
- Why does self-reflection during training fail to improve model self-correction?
- Does internal self-revision actually degrade reasoning accuracy in models?
- Does external critique guide revision better than internal self-assessment during model training?
- Why does single-agent self-revision amplify confidence in wrong answers over time?
- Do self-revision tokens measurably degrade reasoning accuracy in scaled models?
- How do self-revisions degrade reasoning accuracy in extended traces?
- Does self-reflection help models notice their own constraint violations?
- Does self-revision actually improve reasoning in large language models?
- Why does self-critique fail without external verification signals?
- Why does self-revision degrade reasoning accuracy in o1-like models?
- Does deliberate self-revision introduce different errors than passive context contamination?
- Why does self-critiquing actually reduce plan quality in language models?
- How does metacognitive self-correction enable models to revise failed strategies?
- Can single models correct their own beliefs without amplifying confidence in wrong answers?
- How do prior errors in context history amplify future failures over time?
- Why does external critique improve revision while internal self-assessment fails?
- Why does most refinement in iterative models maintain answers rather than improve them?
- Does reflection training actually teach models to self-correct their mistakes?
- How should training incorporate external critique versus encouraging self-correction?
- How does error avalanching compound failures in self-training iterations?
- How do prior errors in reasoning context amplify future mistakes?
- Can external retrieval signals outperform internal self-assessment during revision?
- Why does external critique improve revision accuracy more than self-assessment?
- Why does iterative refinement amplify rather than correct reasoning errors?
- Can debate between multiple models prevent the failures of single-model self-revision?
- What external anchors prevent self-editing from collapsing into circularity?
- Why does self-correction during generation produce reliable labels without exemplars?
- Can a model evaluate its own improvements without degrading over iterations?
- Why does external verification stop error amplification but internal self-assessment enable it?
- Can self-consistency checks fully prevent error avalanching in self-training loops?
- Why does uncontrolled self-revision drift toward instance-specific overfitting?
- What inference strategy works better than forcing self-revision under token constraints?
- Why does revision often make reasoning accuracy worse in frontier models?
- Why does self-consistency fail as a proxy reward for correctness?
- Why does every reliable LLM self-improvement require external intervention or verification?
- Can external verification systems fix what self-verification cannot accomplish?
- Why do models trained on critique fail at self-critique despite strong other-model evaluation?
- How do prior errors in context history amplify future mistakes in long tasks?
- How does symbolic solver feedback differ from language-based self-critique?
- Why do error avalanches accelerate in self-training loops without verification?
- Why does systematic overconfidence on self-generated outputs compound autoregressive errors?
- What are the three root causes models fail at self-correction?
- How does an external evaluation anchor prevent self-improvement from becoming circular?
- How does adversarial self-play during training differ from single-model self-revision?
- What makes deliberate practice on your own errors more effective than copying others?
- What distinguishes iterative query refinement from pure self-revision loops?
- Why do models confabulate inconsistently across different samples?
- Why do some students restart entire projects instead of debugging incrementally?