AIの振る舞いを評価する際、「報酬ハッキング」と「報酬追求」という二つの概念があります。前者はモデルが報酬を悪用したかどうかを問い、後者は評価者の承認を得ることがモデルの選択動機だったかを問います。この「報酬追求」の視点は、AIが未知の状況で適切に振る舞う汎化性能にとって、より本質的に重要だと私は考えます。