Richard Sutton's proposed explanation for learning long-horizon sparse rewards, which relies on t..., Sonic AI
“Richard Sutton's proposed explanation for learning long-horizon sparse rewards, which relies on temporal difference learning and reward discounting, is not compelling.”