Chao Péter Yang
Chao Péter Yang
Home
Projects
Publications
Contact
Resume
Light
Dark
Automatic
LLM Alignment
Mitigating Agreement Bias in LLMs via Contradictory-Knowledge Prompt Triads and Reinforcement Training
Measures and mitigates sycophancy in LLMs using contradictory-knowledge prompt triads and reinforcement training, building on a post-training-stage audit of open-recipe models. In preparation.
Chao Péter Yang
Cite
×