arXiv AI

Training on Irrelevant States Implies Data Augmentation: Generalization in Contextual MDPs

arXiv:2410. 03565v4 Announce Type: replace-cross Abstract: In the zero-shot policy transfer (ZSPT) setting for contextual Markov decision processes (CMDP), agents train on a fixed, finite set of contexts and must generalize to new ones.