← Back to all news
OpenAI Blog April 10, 2018

Gotta Learn Fast: A new benchmark for generalization in RL

Read the original on OpenAI Blog →

The Flow has not summarised this story yet — read it at OpenAI Blog.

  • reinforcement-learning
  • benchmarks

Related stories

arXiv AI
Jun 2

Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?

arXiv:2510. 10541v2 Announce Type: replace-cross Abstract: Current benchmarks are inadequate for evaluating progress in reinforcement learning (RL) for large language models (LLMs).

By Zihan Chen, Yiming Zhang, Hengguang Zhou, Zenghui Ding, Yining Sun, Cho-Jui Hsieh
llmsreinforcement-learningbenchmarks
More like this →
OpenAI Blog
Nov 9, 2016

RL²: Fast reinforcement learning via slow reinforcement learning

reinforcement-learning
More like this →
arXiv AI
Jun 2

Certificate-Guided Evaluation of Reinforcement Learning Generalization

arXiv:2606. 00840v1 Announce Type: new Abstract: This work presents a logic-driven framework to evaluate the performance of reinforcement learning (RL) algorithms in their ability to generalize to unseen tasks.

By Vignesh Subramanian, {\DJ}or{\dj}e \v{Z}ikeli\'c, Suguman Bansal
reinforcement-learningbenchmarks
More like this →
arXiv AI
Jul 1

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

arXiv:2606. 31813v1 Announce Type: cross Abstract: Low-rank adaptation (LoRA) and its variants enable parameter-efficient fine-tuning of large language models under the supervised fine-tuning (SFT) paradigm.

By Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi
llmsreinforcement-learningfine-tuningbenchmarks
More like this →
arXiv Machine Learning
Jun 25

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

arXiv:2606. 25450v1 Announce Type: new Abstract: Traditional evaluations measure a learning algorithm's final performance on an i.

By Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai
reinforcement-learningfine-tuningefficiencybenchmarks
More like this →
arXiv Machine Learning
Jul 22

Exposure-Based Reinforcement Learning to Rank

arXiv:2607. 18689v1 Announce Type: new Abstract: Reinforcement learning (RL) methods for learning-to-rank (LTR) can optimize (almost) any ranking goal, e.

By Harrie Oosterhuis, Rolf Jagerman, Zhen Qin, Xuanhui Wang
reinforcement-learningefficiencysafety
More like this →