RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
RL LLM
Zhiyuan Zeng*, Hamish Ivison*, Yiping Wang*, Lifan Yuan*, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi
ICML 2026
We built a benchmark with verifiable environments that procedurally generate problems and provide algorithmically verifiable rewards to scale up RL for LLMs.