NVIDIA,延长强化学习以扩展推理 · NVIDIA, prolonged RL for reasoning
刘明杰在 NVIDIA 研究 ProRL,通过延长强化学习来扩展推理能力。
Mingjie Liu works at NVIDIA on ProRL, using prolonged reinforcement learning to expand reasoning capabilities.