Evaluating and Improving LLM Self-Modeling
To improve self-modeling skill, a scalable synthetic-data pipeline is developed that produces self-modeling training data, and reinforcement-learning can improve aggregate self-modeling skill across three open-source model families with some transfer to held-out tasks.
Si-Qi Zeng, André Assis, Rowan Wang
· 0 citations