RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

RL LLM

Zhiyuan Zeng*, Hamish Ivison*, Yiping Wang*, Lifan Yuan*, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi

ICML 2026

We built a benchmark with verifiable environments that procedurally generate problems and provide algorithmically verifiable rewards to scale up RL for LLMs.

Abstract