先日作成した高速なリバーシライブラリを使って、深層強化学習のアルゴリズムをいろいろ試してみたいと思っている。 DQNの実装将棋でDQNによる強化学習を試したときはまったく学習しなかったので、まずは教師ありでDQNのネットワークが学習できるか試すことにした。 DQNのネットワークは、状態(局面)が入力となり、行動(…

TadaoYamaokaの開発日記

リバーシ(オセロ)で深層強化学習