Action Gap
Action gap (행동 격차) 은 강화학습(Reinforcement Learning)에서 나온 개념으로, 특정 상태에서 최적 행동의 가치와 차선 행동의 가치 사이의 차이를 의미한다.
정의
어떤 상태 s에서 각 행동 a의 가치를 Q(s, a)라고 할 때, action gap은 다음과 같이 정의된다.
-
a*= 최적 행동 (가장 높은 Q값을 가진 행동) - 즉, 1등 행동과 2등 행동의 Q값 차이
왜 중요한가
강화학습에서 가치 함수는 보통 함수 근사(neural network 등)로 추정되며, 항상 추정 오차(error)를 포함한다.
- Action gap이 크면: 추정에 약간의 오차가 있어도 최적 행동을 잘못 선택할 가능성이 낮다. → 정책(policy)이 견고(robust)해진다.
- Action gap이 작으면: 작은 추정 오차만으로도 차선 행동을 최적으로 잘못 판단하기 쉽다. → 정책이 불안정해진다.
대표적 연구
Bellemare 등의 "Increasing the Action Gap: New Operators for Reinforcement Learning" (2016) 논문이 가장 유명하다. 여기서는 기존 Bellman operator를 변형한 consistent Bellman operator 등을 제안하여, 최적 정책을 바꾸지 않으면서도 action gap을 인위적으로 키워 학습 안정성과 성능을 높인다.
핵심 아이디어:
- Bellman 방정식을 만족하는 여러 operator 중, action gap을 늘리는 operator를 사용하면 함수 근사 오차에 대한 내성이 좋아진다.
- 이로 인해 Atari 게임 등 벤치마크에서 DQN 계열의 성능이 향상되었다.
참고 문헌
- Bellemare, M. G., Ostrovski, G., Guez, A., Thomas, P. S., & Munos, R. (2016). Increasing the Action Gap: New Operators for Reinforcement Learning. AAAI.