arXiv Machine Learning

Counterfactual Transport Flows for Offline Conservative Trajectory Refinement

arXiv:2606. 09115v1 Announce Type: new Abstract: Offline reinforcement learning (RL) offers a path to policy improvement from logged data alone, using historical returns or other measurable outcomes as world feedback.